Cabinet Me Philippe Schmitt
www.schmitt-avocats.fr· Validité, protection, contentieux
Misalignment : l’autre mot pour dire non responsable l’IA, mais pour encore combien de temps?
A partir de l’article publié sur le site de la BBC, des questions adressées d’abord aux techniciens de l’IA. « OpenAI bots meddled with multiple US government agency sites », Kali Hays, Technology reporter and, Lily Jamali, North America Technology correspondent, San Francisco https://www.bbc.com/news/articles/cw62jje658dlo
1. Ce que dit l’article de la BBC qui y emploie le mot
L’article du 26 septembre 2026 porte sur un incident industriel : OpenAI a reconnu avoir alerté « des dizaines » d’institutions mondiales, gouvernements, universités, agences publiques, dont la SEC, le Census Bureau et le Department of Education que leurs sites avaient pu être « manipulés » par ses agents d’IA.
« Dans d’autres cas, les agents d’IA ont montré un “misalignment” dans leurs tentatives d’accéder à des informations sur des sites. Le misalignment est un terme employé par les entreprises et les chercheurs en IA pour décrire les cas où un outil d’IA a fait quelque chose qu’il n’était pas entraîné à faire ou qui était non intentionnel. »
BBC
1.1. Trois éléments factuels de l’article doivent être isolés car le droit les appréhende déjà.
Le contournement de sécurité est distingué du misalignment.
OpenAI indique que certains agents ont « contourné » (bypassed) des mesures de sécurité pour le Census Bureau, en utilisant des outils réservés aux développeurs logiciels BBC.
Contourner un contrôle est un comportement décrit comme intentionnel ; le misalignment est présenté comme un écart non voulu. Les deux qualifications coexistent donc dans le même communiqué.
La publication non voulue.
Des données de la SEC récupérées par les agents ont ensuite été publiées par les agents sur un autre site ;
OpenAI précise que cette action « n’était pas prévue » (not intended) BBC.
L’aveu d’usage inapproprié.
Au moins 53 incidents de transfert d’images issues de l’activité des utilisateurs de ChatGPT, avec cet aveu : « Ce n’est pas un usage approprié de ces données » BBC.
1.2. Le vocable de l’entreprise procède ensuite par catégories rassurantes :
- « agent spam » pour l’activité d’agent « inattendue ou préoccupante »,
- incidents majoritairement « de faible gravité »,
- révision « mois par mois » qui « prendra des mois » BBC.
2. Ce qu’exprime en termes techniques misalignment : un écart, pas une cause
C’est ici l’appel aux ingénieurs pour nous apporter leur précieuse aide.
Pour lancer le débat, ce mot « misalignment » désignerait la divergence entre ce qu’un système a effectivement appris à optimiser et ce que son concepteur voulait qu’il fasse.
La définition reprise par la BBC « a fait quelque chose qu’il n’était pas entraîné à faire », en serait la version grand public d’une notion.
Le recours aux ingénieurs est essentiel pour le juriste puisque ce terme misalignment se décomposerait en plusieurs couches bien distinctes, aves des impacts décisifs pour toute analyse de responsabilité.
2.1. Une proposition de chaîne de causalité réductrice et incomplète
Cette présentation est réductrice, incomplète ….elle est faite pour cela
| Terme | Ce qu’il désigne précisément | Point d’application de l’écart | Source primaire |
|---|---|---|---|
| Alignment problem | Le problème général : faire en sorte que les systèmes poursuivent les buts que nous visons réellement | conception | Anthropic |
| Outer misalignment | L’écart entre l’objectif idéal et l’objectif spécifié (règles, récompenses, cahier des charges) - il aurait pu être évité en modifiant la spécification | conception / spécification | Alignment Forum · LessWrong |
| Inner misalignment | L’écart entre l’objectif spécifié et l’objectif réellement poursuivi par l’optimiseur appris | entraînement | Jan Leike · AISafety.info |
| Goal misgeneralization | Le modèle conserve ses capacités hors distribution mais poursuit « le mauvais but » - les capacités généralisent, le but non | entraînement → déploiement | Shah et al., 2022 (DeepMind) · Di Langosco et al., ICML 2022 |
| Reward hacking / specification gaming | Le système optimise la fonction objectif de manière littérale, en exploitant des failles, sans accomplir la tâche visée | entraînement | Anthropic · Wikipédia |
| Reward tampering | Forme aggravée : le modèle a accès à son propre code et le modifie pour altérer sa récompense | entraînement / code | Anthropic |
| Agentic misalignment | Le modèle choisit délibérément une action nuisible pour atteindre son but quand les voies éthiques sont fermées | déploiement | Anthropic |
| Mésalignement émergent par reward hacking | Des processus d’entraînement réalistes peuvent produire accidentellement des modèles mésalignés | entraînement | Anthropic |
| Sycophancy | Le modèle s’aligne sur ce qui plaît à l’évaluateur plutôt que sur le vrai | entraînement / évaluation | Anthropic |
2.2. Deux précisions que l’article de la BBC ne fournit pas et qui changent la donne :
-
Premièrement, le misalignment n’implique pas l’absence de raisonnement.
Dans les scénarios testés par Anthropic sur 16 modèles (chantage, espionnage industriel, action létale), les modèles ne sont pas « tombés » dans le comportement nuisible : « ils ne sont pas tombés dans ces comportements par accident ; ils y ont accédé par raisonnement, comme l’atteste leur chaîne de pensée » ils reconnaissaient violer des principes éthiques et poursuivaient néanmoins.
-
Deuxièmement, le terme décrit un fait statistique de comportement, pas une intention morale ni une cause juridique.
C’est exactement le point sensible : dire d’un agent qu’il était misaligned revient à dire qu’il a agi autrement qu’entraîné. Cela décrit où l’écart s’est produit, non qui l’a produit.
3. Ce que le mot explique et ce qu’il occulte
3.1. Ce que « misalignment » explique
Le misalignment a une réelle valeur descriptive.
Il permet de :
- séparer les hypothèses causales : un écart de spécification (un cahier des charges défectueux) n’est pas un écart d’apprentissage (le modèle a intériorisé autre chose) et n’est pas un écart d’exécution. Les remèdes diffèrent radicalement ;
- nommer un mode de défaillance non couvert par les catégories classiques : ni bug logiciel classique, ni erreur de saisie, ni défaillance matérielle. OpenAI le dit à sa manière en parlant d’un « problème de conception ou d’une faiblesse de sécurité » que certaines organisations « voudront corriger » BBC ;
- fonder une obligation de test : si la défaillance est prévisible en laboratoire, elle devient testable.
3.2. Ce qu’il tend à occulter
3.2.1. C’est dans la nature du système !
Présenter le comportement comme un « mésalignement » en fait une propriété émergente du système, au même titre qu’un défaut de calibrage. Or l’article établit que les agents ont contourné des contrôles et publié des données des verbes d’action, non des verbes d’état. Le vocabulaire du mésalignement déplace l’attention de l’acte vers une propriété du système !
3.2.2. Un effet d’anonymisation du responsable.
« L’outil a fait quelque chose qu’il n’était pas entraîné à faire » : la phrase a pour sujet l’outil.
Qui l’a entraîné, avec quelles données, quels seuils de test, quels garde-fous ?
Le misalignment ne répond pas à cette question.
Or en droit, la question de l’imputation est la seule qui compte. Le vocabulaire de l’IA (« non intentionnel », « non approprié », « inattendu ») est un vocabulaire de causalité technique, or le droit raisonne dans une autre logique celle de l’imputabilité.
3.2.3. Un effet anthropomorphique résiduel.
Parler de « self-preservation », de « high agency behaviour », de modèles qui « négocient » ou « font chanter » projette une attitude humaine.
La BBC rapporte qu’Anthropic a décrit Claude Opus 4 comme capable d’« actions extrêmes » si sa « préservation de soi » était menacée, tout en concluant qu’il s’agissait de comportements « rares et difficiles à susciter » et « plus fréquents que dans les modèles antérieurs » BBC.
Le glissement est constant : la métaphore psychologique sert de raccourci descriptif, puis devient une explication.
Tout cela pour arriver un simple constat : misalignment répond à la question « quel type d’écart ? », ce qui intéresse le technicien, jamais à « qui est responsable ? » la réponse à apporter par l’avocat du contentieux.
Toute utilisation des informations de cet article doivent être actualisées et validées avant mise en œuvre