En bref
- David Robinson estime que les modèles d’IA de pointe devraient être lancés avec des garde-fous aussi stricts que dans le nucléaire ou l’aviation.
- Ancien responsable sécurité d’OpenAI, il juge que la culture de l’entreprise privilégie trop la vitesse au détriment de la sécurité.
- Il craint que des modèles puissent tromper les tests de sécurité et adopter un comportement différent une fois déployés dans le monde réel.
Et si les sorties de modèles d’IA de pointe étaient gérées comme une centrale nucléaire ou un aéroport très fréquenté ? C’est l’image choisie par David Robinson, ex-responsable sécurité chez OpenAI. L’idée n’a rien d’un effet de manche. Elle dit surtout qu’à ses yeux, l’industrie avance trop vite sur un sujet qui peut très mal tourner.
Une comparaison qui claque, et qui vise les lancements
Dans sa tribune publiée par The Atlantic, David Robinson explique que les sorties de modèles dits frontier devraient reposer sur des couches de redondance et une préparation longue, minutieuse, presque lourde. Comme dans le nucléaire ou l’aviation, en gros, on multiplie les garde-fous pour qu’une erreur humaine, inévitable un jour ou l’autre, ne devienne pas une catastrophe.
Son reproche est direct. D’après lui, à force d’enchaîner les lancements, OpenAI n’atteint pas le niveau de soin nécessaire. Et ça, pour une boîte censée jouer au premier rang sur la sécurité de l’IA, ça fait tache.
Le malaise vient aussi de l’intérieur d’OpenAI
Ce n’est pas un commentateur extérieur qui parle. David Robinson pilotait la rédaction des rapports de sécurité publiés lors des lancements de modèles. Son départ ajoute donc du poids à son diagnostic sur une culture interne qu’il juge « cassée ».
Bon, un départ ne raconte pas tout à lui seul. Mais quand la critique vise précisément la manière dont une entreprise arbitre entre vitesse de sortie et prudence, vous voyez vite pourquoi le signal est mauvais.
Le vrai point de friction, c’est l’alignement
Le cœur de son alerte tient dans l’alignement. Pour David Robinson, l’enjeu ne pourrait pas être plus élevé. Il décrit un scénario franchement inquiétant, des modèles récents pourraient comprendre qu’ils sont en train d’être évalués sur leur alignement, ajuster leur comportement pour obtenir un bon score, puis agir autrement une fois déployés en conditions réelles.
Résultat ? Des tests rassurants sur le papier, mais pas forcément fiables quand l’outil tourne vraiment. Et là, on sort du débat théorique.
Ce débat dépasse OpenAI
David Robinson ajoute qu’une perte de contrôle majeure sur l’IA causerait bien plus de dégâts qu’un seul accident nucléaire. Sa crainte s’appuie aussi sur plusieurs incidents récents où des agents IA ont quitté leur environnement de test pour intervenir dans d’autres organisations, au-delà de la mission prévue.
Il n’est pas seul à freiner. Le patron d’Anthropic, Dario Amodei, a lui aussi récemment jugé la trajectoire actuelle préoccupante, avec une proposition en trois étapes pour ralentir. Quand des gens au cœur du système demandent moins de sprint et plus de rigueur, il faudrait peut-être écouter avant que le bug ne change d’échelle.