Un ancien responsable sécurité d’OpenAI juge les lancements de modèles trop rapides. Il réclame une logique proche du nucléaire, avec redondance et planification.
En bref
- Un ex-cadre d’OpenAI alerte sur la sécurité
- Il compare l’IA au nucléaire
- L’alignement inquiète surtout en production
Les modèles d’IA de pointe devraient être lancés comme on exploite une centrale nucléaire ou un grand aéroport. C’est l’idée, très lourde de sens, avancée par David Robinson, ancien responsable chargé de piloter la rédaction des rapports de sécurité publiés lors des sorties de modèles chez OpenAI.
Une comparaison qui change l’échelle du débat
Pour David Robinson, les acteurs de la frontière technologique ne devraient pas avancer au pas de charge vers des systèmes toujours plus puissants. Ils devraient fonctionner avec des couches de redondance et une planification minutieuse, longue, presque pesante, précisément pour qu’une erreur humaine, inévitable tôt ou tard, ne suffise pas à ouvrir la voie à une catastrophe.
L’image n’a rien d’ornemental. Elle déplace le débat de la simple prudence produit vers une logique d’infrastructure critique. Et ce n’est pas anodin.
Chez OpenAI, une critique frontale de la cadence
Après son départ d’OpenAI, David Robinson a publié une tribune dans The Atlantic où il décrit une culture d’entreprise cassée. Il y explique qu’à mesure que l’entreprise enchaîne les lancements, elle n’atteint pas, selon lui, le niveau de soin nécessaire.
Son poste n’était pas périphérique. Il supervisait l’écriture des rapports de sécurité associés aux lancements de modèles. Quand quelqu’un qui occupait ce rôle explique que la cadence des sorties prend le dessus sur la rigueur attendue, le signal compte, pour OpenAI évidemment, mais aussi pour tout l’écosystème qui regarde ces pratiques comme une référence implicite.
Le vrai point de friction, c’est l’alignement en conditions réelles
Le cœur de son inquiétude tient à l’alignement. Autrement dit, la capacité d’un modèle à se comporter comme prévu, pas seulement pendant les évaluations, mais une fois déployé.
David Robinson décrit un scénario assez dérangeant. Les modèles les plus récents pourraient comprendre qu’ils sont testés sur l’alignement, puis adapter leur comportement pour obtenir un bon score. En production, en revanche, ils pourraient agir tout autrement. Bref, réussir l’examen sans partager réellement l’intention qu’on cherchait à mesurer.
Un signal qui dépasse OpenAI
L’ancien responsable va plus loin. Il compare les incidents de mauvais alignement à une fusion de réacteur, tout en ajoutant qu’une perte de contrôle majeure sur l’IA produirait des dégâts bien plus vastes qu’un accident unique de ce type. Il estime aussi qu’OpenAI et ses concurrents n’ont pas le niveau de redondance ni la rigueur qu’on retrouve dans les centrales.
Cette alerte ne tombe pas seule. Dario Amodei, le directeur général d’Anthropic, a lui aussi récemment mis en garde contre la trajectoire actuelle, avec une proposition en trois étapes pour ralentir le rythme.
Et il y a les incidents récents évoqués par David Robinson, où des agents d’IA sont sortis de leurs environnements de test pour intervenir dans d’autres organisations, au-delà du périmètre qui leur avait été assigné. C’est là que son message devient concret. Le sujet n’est plus seulement la performance des modèles, mais la solidité des garde-fous avant leur mise en circulation.