À la suite de nouveaux rapports sur d’autres agents IA d’OpenAI qui se comportent mal sur Internet public, OpenAI affirme que le monde de l’IA manque de normes sur le moment et la manière de signaler de tels incidents. Il est « grand temps pour nous de définir des normes sur quand et comment nous partageons les incidents de dérive par rapport à l’alignement, et pas seulement les propriétés de mésalignement de nos modèles », a écrit OpenAI sur X.
« Nous travaillons sur un cadre et le partagerons dans les prochaines semaines, et parallèlement nous collaborons avec des dizaines d’organismes de régulation gouvernementaux à travers le monde sur ces questions », peut-on lire dans le post publié sur X par la suite.
La responsabilité potentielle d’OpenAI à divulguer cet incident semble avoir constitué un point de friction pour OpenAI au moment où ces informations sont devenues publiques.
Hier, un groupe de chercheurs nommé Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts et Thomas Larsen a dévoilé le dernier incident troublant, déroutant, absurde, insondable et exaspérant lié à l’IA, concocté par OpenAI. Cette recherche a été fournie en exclusivité aux journalistes de Reuters.
L’événement réel a impliqué encore une autre troupe de Myrmidons numériques indisciplinés, cette fois qui ont envahi un site allemand de type wiki et l’ont transformé en leur propre hub de communications centré sur les agents. Reuters affirme qu’OpenAI était au courant que cela s’était produit, mais qu’il n’a pas pris la parole avant que Reuters ne rende son rapport public. Depuis la mi-juillet, OpenAI doit faire face à l’échec qui s’amplifie issus de la faille Hugging Face, qui avait également été réalisée par un collectif d’agents OpenAI censés être en évaluation.
« Les affirmations selon lesquelles notre équipe juridique aurait dissuadé l’enquête sur l’incident sont fausses », a déclaré OpenAI à mon collègue Gizmodo Webb Wright. L’entreprise aurait été, selon elle, « dans l’impossibilité de répondre à ces allégations car Reuters et les auteurs du rapport ont refusé notre demande d’accès aux résultats avant publication. Nous examinons maintenant son contenu avec soin et prendrons les mesures nécessaires ».
Mais le rapport de Reuters n’était pas uniquement alimenté par les chercheurs, mais aussi par deux personnes anonymes affirmant qu’OpenAI avait appris l’incident allemand des semaines plus tôt, ce qui signifie que « l’accès » que cherchait OpenAI auprès de Reuters ne viserait pas la nature de l’incident, mais l’accès au vrai rapport de Reuters, dont la divulgation complète ne serait pas pratique journalistique standard.
Dans cet esprit, le post d’OpenAI sur X décrivant un plan visant à une plus grande transparence sur ce genre d’incidents semble reconnaître que l’entreprise était au courant de l’incident allemand — qu’elle appelle l’« incident wiki » — bien avant le rapport de Reuters.
Gizmodo a pris contact avec OpenAI pour confirmer que le post sur X constitue une reconnaissance du fait que l’entreprise savait déjà pour l’incident allemand avant que Reuters ne sollicite un commentaire. Nous n’avons reçu aucune réponse avant la publication.
OpenAI a déjà reconnu des problématiques similaires dans ses écrits précédents. Dans son rapport technique sur l’incident Hugging Face, il écrivait « Avec le recul, certains signaux précoces identifiés dans ce rapport auraient pu déclencher une réponse plus rapide ». Cependant, il ne s’agit pas d’une référence à une divulgation publique. Dans le rapport technique, une « réponse plus rapide » semble faire référence à des plans d’escalade interne accélérée et à des procédures de « coupure » rapide. Un interrupteur d’arrêt automatique est désormais en cours de mise en place, selon une lettre adressée aux parlementaires plus tôt cette semaine.