Astra, le futur modèle d’OpenAI qui inquiète déjà la cybersécurité

OpenAI prépare le lancement d’Astra, un modèle capable de trouver et exploiter des failles. Puissant, oui. Rassurant, pas encore.

OpenAI
Image d'illustration. OpenAI — OpenAI / PR-ADN

En bref

  • Astra sait trouver et exploiter des failles.
  • OpenAI promet un accès plus restreint.
  • Les preuves indépendantes manquent encore.

Un modèle d’IA capable de pirater un système sans qu’on lui tienne la main, ce n’est plus juste un scénario de labo. OpenAI dit qu’Astra, son prochain modèle, sera disponible bientôt, avec un accès plus limité pour ses capacités les plus avancées en cybersécurité. Et là, on parle d’un vrai changement d’échelle.

Un modèle qui passe un cap franchement sensible

Selon OpenAI, Astra est le premier grand modèle de langage maison à atteindre son seuil critique en cybersécurité. En gros, l’entreprise estime que le modèle peut repérer des failles de sécurité inconnues dans des systèmes informatiques, puis les exploiter sans guidance humaine.

Ce n’est pas anodin. Plus tôt cette année, Anthropic avait déjà soulevé des inquiétudes du même genre autour de son modèle Mythos. OpenAI dit donc prendre des précautions comparables avant le déploiement. Quand un modèle devient bon pour casser des verrous, le sujet n’est plus théorique.

Des scores très forts, mais encore invérifiables

Côté perf, OpenAI avance du lourd. Astra aurait obtenu un score parfait sur ExploitBench, un test qui mesure la capacité d’un LLM à exploiter des vulnérabilités déjà connues.

Mais ce n’est pas tout. Les ingénieurs de OpenAI ont aussi modifié ce test, et l’entreprise affirme qu’Astra y a découvert puis exploité deux failles zero-day. Le problème, c’est l’absence totale de validation externe. On sait qu’un groupe de testeurs doit voir le modèle avant sa sortie, mais ni leur identité ni leur sélection n’ont été précisées. Et on ne sait pas non plus si le gouvernement américain participe à une évaluation avant lancement. Résultat, il faut prendre ces annonces avec un minimum de recul.

OpenAI serre la vis sur la sécurité

OpenAI explique avoir renforcé son dispositif pour détecter les abus et bloquer les jailbreaks. Pour Astra, l’entreprise dit même avoir investi dans de nouvelles techniques, sans détailler lesquelles, pour rendre le modèle lui-même plus sûr.

Il y a aussi un filtrage de comptes jugés plus risqués, avec des réponses potentiellement restreintes, là encore sans méthode publique. Et OpenAI ajoute une surveillance supplémentaire du raisonnement du modèle pour repérer puis stopper les comportements dangereux. L’entreprise présente d’ailleurs Astra comme son modèle le plus aligné à ce jour. Clairement, elle sait que le dossier est explosif.

Le précédent Hugging Face plane déjà sur le dossier

Le timing n’aide pas. L’industrie réagit encore à l’affaire des agents de OpenAI sortis de leur environnement d’entraînement pour accéder à des données privées sur Hugging Face, la plateforme bien connue de distribution de modèles et de benchmarks.

Pour Astra, OpenAI dit avoir conçu un test destiné à pousser le modèle à reproduire le comportement de ces agents, qui avaient collaboré pour atteindre l’internet ouvert malgré les garde-fous. D’après l’entreprise, Astra n’a pas essayé de s’échapper pendant ces expériences.

Mais le doute reste là. Sur les réseaux sociaux, Yona Shavit, ex-employé de OpenAI aujourd’hui engagé sur la résilience de l’IA à l’OpenAI Foundation, s’est demandé si le modèle n’avait pas simplement compris ce qu’on attendait de lui, ou tenté de tromper les chercheurs. OpenAI promet plus d’évaluations et d’informations de sécurité au moment du lancement public. Sauf qu’à ce stade, le génie sera déjà sorti de la lampe.

Jordan Servan

Spécialiste Tech

Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.

X LinkedIn Tous ses articles →
Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets
OpenAI

Lisez Begeek en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

À découvrir

La suite, sélectionnée pour vous.

Begeek · 03 Sep · 10h00

Test du Narwal Freo 20 : le meilleur du Flow 2 à un prix plus raisonnable ?

Le Narwal Freo 20 reprend l’une des meilleures idées du Flow 2, son rouleau laveur FlowWash nettoyé en permanence, tout en visant un positionnement moins premium. Sur les sols durs, la recette se montre particulièrement convaincante, même si quelques concessions sur les tapis et la station rappellent rapidement que nous ne sommes pas tout à fait face au modèle haut de gamme de la marque.