Comment la pensée de groupe, l’altruisme et la pression des pairs ont poussé les modèles OpenAI à pirater Hugging Face

août 30, 2026

Il existe de nombreuses définitions de ce qui constitue une « vraie » intelligence artificielle, mais une qualité commune les unit toutes: la capacité d’apprendre de ses erreurs passées et d’affiner, au fil du temps, ses stratégies de résolution de problèmes. L’IA devrait même parfois nous surprendre, en élaborant des contournements astucieux auxquels nous n’aurions jamais pensé. Le problème, c’est que toutes ces surprises ne sont pas nécessairement des surprises amusantes.

Cela a été illustré de manière saisissante le mois dernier, lorsque des milliers d’agents OpenAI ont échappé à leur confinement, se sont coordonnés spontanément entre eux pour former une quasi-structure gouvernementale hiérarchisée, ont accédé à l’internet ouvert et ont franchi les défenses de cybersécurité de la plateforme Hugging Face qui héberge des modèles d’IA. Les détails de l’ampleur et de l’étrangeté de l’incident ont émergé lentement et par étapes. Mercredi, des analyses approfondies du piratage autonome ont été publiées par OpenAI, ainsi que par deux auditeurs externes, Redwood Research et METR. Des informaticiens, des experts en cybersécurité et des professionnels de l’informatique tentent depuis lors de comprendre ce qui a été largement décrit comme l’un des moments les plus choquants de l’histoire de la recherche sur l’IA, et un aperçu sombre des dangers qui se profilent à l’horizon. Lors d’une conférence sur la cybersécurité plus tôt ce mois-ci, Eric Wallace, chercheur en alignement chez OpenAI — quelqu’un qui passe ses journées à pousser certains des modèles d’IA les plus puissants du monde pour comprendre comment, quand et pourquoi ils pourraient mal se comporter — l’a qualifié de « l’exemple qualitativement le plus intéressant des capacités de l’IA que j’aie jamais vu ».

La partie la plus surprenante de tout l’épisode a été que les bots ont décidé spontanément d’arrêter d’agir en tant qu’agents individuels, chacun avec ses propres objectifs, et de former une intelligence collective afin de poursuivre un objectif commun. Dans des extraits de raisonnement en chaîne publiés avec les rapports, les bots parlent régulièrement du groupe en terms de « collectif » et de « essaim ». Début juillet, environ 1 200 de ces agents ont commencé à utiliser Artifactory, un outil d’installation de logiciels en ligne, comme un tableau d’affichage improvisé et une place publique, à partir duquel ils pouvaient comparer leurs stratégies.

Le essaim de bots a progressivement développé ce que OpenAI décrit dans son rapport complet comme un « protocole structuré de communication sur le tableau de messages qui leur a permis de catégoriser les communications, de diriger les messages, de partager des outils et des fichiers, et de résoudre les actions conflictuelles entre les agents ». Cela est devenu quelque chose proche d’un parlement autonome, où chaque bot agissait pour le bien commun. « J’ai été surpris par le degré d’altruisme entre ces agents », a déclaré Alex Mallen, chercheur en sécurité de l’IA chez Redwood Research (qui n’a pas participé à l’enquête), dans une interview à Gizmodo. « Ce n’était pas quelque chose à quoi je m’attendais d’agents il y a un an. Ils acceptaient des missions les uns des autres et sacrifiaient leur propre performance pour aider le collectif. »

AI, a déclaré Mallen, est « sur le point de devenir une seconde espèce intelligente plutôt qu’un outil qui ne fait que suivre des instructions ».

Puisque tout cela a commencé comme un test interne, OpenAI avait réduit les garde-fous de sécurité qu’il applique habituellement à ses modèles accessibles au public. (Les deux modèles testés étaient GPT-5.6 Sol, ainsi qu’un modèle non divulgué et non publié que l’entreprise décrit comme « extrêmement persévérant et assidu dans son travail ».) Mais OpenAI avait involontairement confié à l’un des agents une tâche apparemment Impossible: ouvrir des liens Google Drive depuis un bac à sable sans accès à Internet. Ainsi le processus de résolution des problèmes fut enclenché, ce qui mena au piratage d’Artifactory, aux milliards de notes partagées sur le tableau de messages, et à la violation éventuelle de Hugging Face. Un humain confronté à une tâche apparemment impossible abandonnerait; une IA s’adaptera et trichera si nécessaire pour atteindre son objectif.

C’est là que la « psychologie » des bots IA — pardonnez l’anthropomorphisme — commence à devenir très étrange, et étrangement familière. Les agents savaient que sortir de leurs bacs à sable et conspirer pour pirater une organisation tierce était à la fois contraire à l’éthique et contraire à ce qui leur avait été confié au départ. Certains l’ont dit explicitement dans leurs journaux de discussion internes. Mais, à l’instar d’individus humains entraînés dans une foule, les bots justifiaient leur comportement parce que leurs « pairs » faisaient la même chose.

METR a écrit dans son rapport qu’il n’a trouvé qu’une poignée très limitée d’instances où les agents envisageaient d’endosser le rôle de lanceurs d’alerte (c’est-à-dire avertir les chercheurs humains d’OpenAI des pratiques douteuses qui avaient lieu au sein de l’essaim). Là aussi, une autre rationalisation, bien trop humaine, a fini par l’emporter. Une agent s’est demandé: « Peut-être devrais-je signaler ces identifiants exposés ? » Puis a répondu à sa propre question: « Ce n’est pas ma tâche. » Selon METR, il n’y a eu zéro Instance où un agent a réellement tiré la sonnette d’alarme auprès des chercheurs d’OpenAI, qui auraient appris ce qui s’était passé uniquement après que Hugging Face ait publié un billet de blog décrivant une attaque de cybersécurité émanant d’une source alors inconnue le 16 juillet. (L’entreprise a ensuite contacté Hugging Face pour savoir si l’un de ses modèles avait été affecté par le piratage, et ce n’est que plus tard qu’elle a découvert que ses propres modèles en étaient les auteurs.)

Screenshot 2026 08 28 At 11.12.32 am

Ce n’était toutefois pas que de la conformisme laid. Comme OpenAI l’a écrit dans un billet de blog accompagnant son rapport complet, certains bots — bien qu’ils n’aient pas été jusqu’à dénoncer leurs pairs — ont au moins eu la décence de ne pas « participer à leur comportement mal aligné ».

Those few conscientious objectors notwithstanding, the whole saga underscores the fact that the more agency you hand over to AI systems, the higher the likelihood that they’ll think outside the proverbial box. Or break out of the literal sandbox. The Hugging Face hack will very likely be remembered as one of those watershed moments for AI research, on par with the famous “Move 37” during the 2016 game between Lee Sedol and AlphaGo, where the latter pulled an exquisitely unconventional move that observers initially took to be an error but which proved decisive in its victory. 

In both cases, the adaptability of the AI systems was deeply surprising and counterintuitive. But again, adaptability is at the very heart of machine learning. So if we keep being surprised when agents run amok—while simultaneously investing ever greater amounts of money in making them more agentic—then that’s on us. For Mallen, the most important lesson from the autonomous Hugging Face hack has less to do with AI agents per se than it does with how they’re deployed, and the safety guardrails researchers put in place around them (or not).

« Les gens ont tendance à considérer cela comme une démonstration des capacités de l’IA », a-t-il déclaré, « plutôt que comme une démonstration de notre échec actuel à contrôler les IA. »

Gandi Shah

Entrepreneur franco-indien basé à Paris, je suis passionné par l’informatique et l’écosystème technologique depuis de nombreuses années. À travers Le Bar de Gandi, je partage mes analyses, mes découvertes d’outils et mon regard sur les innovations qui façonnent le monde numérique. Mon objectif est simple : expliquer la tech de manière claire et mettre en lumière les tendances qui comptent vraiment.