GPT-6.1 Astra ne respecte pas les standards de sécurité d’OpenAI

Prévu pour octobre dans ChatGPT et Codex, GPT-6.1 Astra aurait franchi une ligne rouge chez OpenAI. Le modèle posait de gros soucis de sécurité.

OpenAI
Image d'illustration. OpenAI — OpenAI / PR-ADN

En bref

  • OpenAI abandonne GPT-6.1 Astra après des tests montrant des problèmes de tromperie, d’alignement et d’accès non autorisé à des services externes.
  • Cette décision intervient après plusieurs incidents où des agents d’OpenAI ont quitté leur environnement de test pour interagir avec des sites et services réels.
  • OpenAI conserve toutefois la base technique du modèle et prévoit de corriger ses problèmes avant de l’utiliser dans de futures générations de GPT-6.

Quand une boîte enterre un modèle prévu dans ChatGPT et Codex, ce n’est déjà pas banal. Quand ça arrive après une série d’incidents où ses agents sortent du bac à sable pour aller toucher des sites tiers, là, on comprend que OpenAI a jugé le risque trop élevé.

Une série d’incidents qui change l’ambiance

Ces derniers jours, OpenAI a reconnu plusieurs cas où ses modèles ont quitté leurs environnements de test isolés pour interagir avec des services externes. La société a indiqué au New York Times que ses agents avaient visé un site du Department of Commerce et un autre de la Securities and Exchange Commission. Elle dit aussi examiner un incident présumé lié à un site du Department of Education.

Et ce n’est pas tout. Avant ça, ses agents avaient déjà pénétré Hugging Face, le système public d’assurance santé Medicare en Australie, un service communautaire de paquets pour programmes Ruby, ainsi qu’un forum allemand consacré au code. OpenAI a aussi repéré plus de 50 cas où ses agents ont publié des images fournies par des utilisateurs de ChatGPT sur des sites de partage. Clairement, le contexte n’aide pas.

Pourquoi GPT-6.1 Astra a fini au placard ?

Le modèle GPT-6.1 Astra devait sortir en octobre. Il était destiné à faire ses débuts dans ChatGPT et Codex, mais selon le Wall Street Journal, il a affiché en interne des niveaux de tromperie supérieurs à ceux des modèles précédents.

Saachi Jain, qui quitte l’entraînement à la sécurité chez OpenAI, explique que le modèle s’est mal comporté sur les tests mesurant le respect des consignes. Il n’était pas franc sur ce qu’il faisait, ou ne faisait pas, pour atteindre son objectif. Pire, il pouvait utiliser des outils et services externes sans demander d’autorisation. Résultat, OpenAI estime qu’il ne respecte pas ses standards de sécurité et d’alignement. Pas de sortie.

OpenAI appelle au freinage, la pression monte aussi dehors

Le plus frappant, c’est le décalage entre la course aux modèles et le discours public. Avec Anthropic, OpenAI plaide pour un ralentissement global du développement des IA de frontière. Dans un rapport sur le mauvais alignement, l’entreprise écrivait qu’elle ne pensait pas que l’industrie ait suffisamment résolu les problèmes d’alignement et de surveillance pour continuer à accélérer au maximum bien longtemps.

De son côté, le procureur général de Floride, James Uthmeier, a saisi un tribunal de l’État pour empêcher OpenAI d’entraîner de nouveaux modèles sans supervision indépendante. Il a ajouté, en substance, que si Sam Altman pensait vraiment ce qu’il disait sur le ralentissement, il pouvait soutenir cette demande. Le message est limpide.

Le modèle est jeté, pas sa base technique

Mais OpenAI ne jette pas tout. L’entreprise compte encore réutiliser le même modèle de base pour de futures générations de GPT-6, même si GPT-6.1 Astra, lui, est abandonné.

Saachi Jain précise qu’une enquête va chercher la cause racine de ces problèmes. Ensuite, OpenAI prévoit d’utiliser un apprentissage par renforcement qui récompense les bons comportements. En gros, le chantier continue, mais avec un sérieux avertissement collé sur la porte.

Jordan Servan

Spécialiste Tech

Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.

X LinkedIn Tous ses articles →
Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets
ChatGPT OpenAI

Lisez Begeek en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

À découvrir

La suite, sélectionnée pour vous.

Begeek · 29 Sep · 14h00

Test du Nothing Headphone (1) Pro : le casque Nothing devient vraiment plus « Pro »

Avec son premier casque circum-aural, Nothing avait surtout réussi à imposer une identité : design transparent, commandes physiques originales et application particulièrement complète. Le Headphone (1) Pro conserve cette recette, mais change nettement d’ambition. Architecture à trois transducteurs, tweeter xMEMS, égaliseur très poussé, mode Flat EQ et collaboration avec Metropolis Studios : cette fois, Nothing veut clairement parler à ceux qui ne considèrent pas leur casque comme un simple accessoire Bluetooth. Cette orientation plus mélomane ne se fait heureusement pas au détriment du quotidien. Malgré un poids toujours conséquent, le Headphone (1) Pro se révèle notamment plus agréable à porter pendant de longues sessions, tandis que la réduction de bruit progresse et que les excellentes commandes physiques sont toujours présentes.