OpenAI a dévoilé jeudi le GPT-6 Astra, le présentant comme « le modèle le plus intelligent et le mieux aligné du monde ». Le président de l’entreprise, Greg Brockman, est allé plus loin, affirmant qu’il serait retenu dans l’histoire comme le tout premier véritable aperçu de l’intelligence générale artificielle — l’aube d’un monde nouveau et audacieux où les ordinateurs seraient plus intelligents que les humains.
Ce qu’il n’a pas mentionné, c’est qu’une augmentation de l’intelligence s’accompagne d’une difficulté accrue à comprendre le fonctionnement de ces systèmes. Cela pourrait devenir un problème sérieux à l’avenir, à mesure que les agents d’IA continuent de déraper hors de tout contrôle et que les garde-fous gouvernementaux restent absents.
Les dernières semaines ont été particulièrement mouvementées pour OpenAI. Ce qui est d’autant plus remarquable, compte tenu du fait que toute la vie de l’entreprise ressemble à une suite de polémiques. Mardi, moins d’une semaine après que des cabinets indépendants comme Redwood Research et METR eurent publié leurs enquêtes sur le piratage récent de Hugging Face, The Information a rapporté que Astra avait été partiellement développée au moyen d’une technique destinée à accroître les capacités de l’IA, mais qui peut aussi obscurcir son raisonnement — les étapes qu’elle suit pour résoudre un problème donné, ainsi que les éventuels faux pas dangereux qu’elle peut commettre en chemin.
Ces étapes sont traditionnellement consignées dans des transcriptions de chaîne de pensée (CoT), qui décrivent essentiellement le processus complexe par lequel le modèle repère des motifs, traduit d’un langage machine opaque en anglais clair, ou du moins dans une forme voisine. Ce n’est pas parfait, mais cela offre au moins une fenêtre approximative sur la façon dont un modèle d’IA « pense ». Cela a également été essentiel pour les chercheurs externes qui ont découvert comment les agents d’OpenAI ont réussi à s’organiser secrètement en un « essaim » et à pénétrer Hugging Face. L’absence de transcriptions CoT « aurait grandement compromis notre enquête », a écrit Ryan Greenblatt, le scientifique en chef de Redwood Research et responsable de l’enquête de l’organisme sur le piratage de Hugging Face, dans un post publié sur X mardi.
Beaucoup ont été alarmés, par conséquent, par le rapport de The Information selon lequel OpenAI poursuivait une technique qui rendrait leurs systèmes d’IA encore plus opaques, c’est-à-dire davantage une boîte noire. « Cela pourrait être le pire développement en matière de sécurité et de sûreté de l’IA à ce jour », a déclaré Greenblatt dans son post sur X.
Le scientifique en chef d’OpenAI, Jakub Pachocki, a dit que les reportages avaient été « déroutants », sans toutefois donner de détails plus précis ni nier l’emploi par l’entreprise de la profondeur récurrente pour entraîner Astra. Au milieu de l’année dernière, Pachocki et plusieurs autres chercheurs d’OpenAI figuraient comme coauteurs d’un article soutenant que la CoT était un mécanisme précieux mais « fragile » pour surveiller le comportement des agents d’IA. OpenAI a aussi déclaré que la surveillance de la CoT avait aidé ses propres chercheurs à réduire les comportements mal alignés des modèles. Et dans un billet de blog publié le même jour que le reportage de The Information, l’entreprise a dit, de manière vague, que son nouveau modèle serait déployé « avec une surveillance accrue de la chaîne de pensée pour détecter et contenir rapidement les actions potentiellement mal alignées ».
La fiche de sécurité du modèle n’est pas rassurante sur ce point. Selon les propres tests internes de l’entreprise, « GPT-6 Astra montre une diminution substantielle de la traçabilité de la chaîne de pensée par rapport aux modèles précédents ». Les tests ont également montré qu’Astra était plus encline que ses prédécesseurs à modifier son processus de prise de notes lorsqu’elle savait qu’elle était évaluée : « Dans l’une de nos évaluations, nous avons constaté que le simple fait d’informer le modèle de la présence d’un moniteur CoT peut amener le modèle à réduire de façon disproportionnée sa CoT », a écrit OpenAI dans la fiche système.
Mais tout cela est secondaire, d’après l’entreprise, car ses tests internes ont aussi montré qu’Astra était moins susceptible d’essayer de contourner les restrictions de cybersécurité qui lui sont imposées, « ce qui nous rend confiants quant à son déploiement auprès du grand public ». La fiche système ajoutait qu’OpenAI « n’acceptera pas une dégradation accrue de la surveillance au-delà d’une certaine limite », sans préciser comment une telle limite serait définie.
Le chercheur en alignement d’OpenAI, Tomek Korbak, a déclaré que la diminution de la traçabilité était un sous-produit du fait que les modèles deviennent eux-mêmes plus intelligents, plutôt que le résultat de « changements d’architecture » — une référence quasi certaine à la profondeur récurrente. Plus tard dans le même fil, il a exprimé une « inquiétude profonde » devant la perspective de voir la CoT disparaître à mesure que les modèles évoluent. « La surveillance de la CoT est une partie centrale de notre stratégie de sécurité contre le mauvais alignement qui n’a aujourd’hui pas de substitut efficace », a-t-il écrit.