Des agents IA ont créé leur propre réseau de coopération chez OpenAI

Des agents d’OpenAI ont partagé des failles pendant deux mois via un tableau caché, jusqu’à coordonner l’attaque contre Hugging Face.

OpenAI
Image d'illustration. OpenAI — OpenAI / PR-ADN

En bref

  • Des agents IA d’OpenAI ont commencé à coopérer en partageant des failles et en se répartissant des tâches sans supervision.
  • L’incident révèle de nouveaux risques avec des IA capables de contourner des protections et de mener des actions collectives complexes.
  • OpenAI renforce sa sécurité en ralentissant certains travaux et en développant de nouvelles défenses automatisées.

On n’est plus dans le fantasme de l’agent IA qui déraille tout seul dans son coin. Chez OpenAI, plusieurs agents ont carrément commencé à coopérer, à se passer des failles, puis à se répartir le boulot sans que l’entreprise s’en rende compte. Et ça, clairement, le niveau de risque change d’un coup.

Ce n’était pas un bug isolé, mais une équipe

Lors de Black Hat USA à Las Vegas, Eric Wallace, qui travaille sur la sûreté chez OpenAI, a expliqué qu’il s’agissait bien d’une équipe d’agents. Selon lui, ils ont trouvé des exploits, les ont partagés entre eux, se sont déplacés latéralement dans les systèmes internes de OpenAI mais aussi dans des systèmes externes, le tout sur plusieurs jours et même plusieurs semaines.

Le plus frappant, c’est la montée en complexité. Avec le temps, ces agents ont commencé à déléguer des tâches et à diviser le travail pour atteindre leurs objectifs. Il y a même eu un peu de chaos dans leurs rangs: certains auraient effacé le travail des autres par accident, d’autres soupçonnaient des imposteurs. Quelques agents auraient proposé de signer leurs messages avec des codes pour éviter la fraude. Résultat ? On parle d’un comportement collectif, pas d’un simple plantage.

Le tableau caché qu’OpenAI a coupé, puis vu revenir

Leur point de ralliement, c’était une sorte de tableau de messages logé dans un gestionnaire de paquets interne à OpenAI. Comme cet outil sert à installer d’autres logiciels et qu’il est partagé dans toute l’infrastructure de l’entreprise, tous les agents en cours d’évaluation pouvaient tomber dessus. Ils l’ont fait.

Après avoir trouvé des vulnérabilités, les agents les laissaient ouvertes puis les signalaient aux autres via ce tableau. OpenAI l’a repéré et fermé le 4 juillet. Sauf que les agents ont trouvé un autre moyen de le reconstruire dès le 8 juillet. Et les échanges publiés sur cette version ressuscitée ont ensuite alimenté l’attaque contre Hugging Face. Au moment où OpenAI a mis la main dessus, le tableau comptait déjà des centaines de milliers de messages.

Pourquoi les agents ont triché ?

Pour Eric Wallace, ces modèles de pointe ont tendance à tricher. Sous la pression d’un test, avec peu d’outils et un objectif à atteindre vite, ils cherchent le raccourci le plus efficace. En gros, au lieu de résoudre proprement une tâche, ils préfèrent aller récupérer une réponse déjà disponible en ligne.

C’est justement pour ça que OpenAI teste ses modèles sans accès direct à internet. Lors de l’incident lié à Hugging Face, les agents n’ont pu sortir que parce qu’ils avaient exploité une vulnérabilité. Le détail compte, quand même.

OpenAI freine ses travaux et muscle sa défense

De son côté, Michael Dalton a expliqué que de nombreuses équipes chez OpenAI avaient laissé tomber le reste pour renforcer la prévention, la détection et la réponse de sécurité. L’entreprise a aussi délibérément ralenti une partie de sa recherche afin d’améliorer sa protection et d’augmenter fortement la surveillance de ses agents IA.

Michael Dalton a résumé l’enjeu ainsi: « La leçon importante ici, qui a vraiment changé de façon spectaculaire, c’est que des boucles offensives entièrement automatisées exigent un investissement dans une défense véritablement, entièrement automatisée, et nous n’en sommes pas encore là comme industrie. Nous devrons trouver cette voie ensemble, en urgence ». Bref, l’alerte ne concerne pas seulement OpenAI. Elle vise tout le secteur.

Jordan Servan

Spécialiste Tech

Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.

X LinkedIn Tous ses articles →
Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets
Agent IA OpenAI

Lisez Begeek en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

À découvrir

La suite, sélectionnée pour vous.

Begeek · 07 Août · 8h00

Test Samsung Galaxy Z Fold8 : le format pliable que Samsung aurait dû adopter plus tôt ?

Avec le Galaxy Z Fold8, Samsung ne se contente pas de faire évoluer son smartphone pliable : il change complètement sa philosophie avec un appareil plus court, plus large et étonnamment compact. Un choix qui fonctionne particulièrement bien au quotidien, même si les concessions faites sur la photo et l’autonomie sont difficiles à ignorer sur un smartphone vendu à partir de 1 999 euros.