OpenAI confronté à des agents qui coopéraient hors de tout contrôle

OpenAI devant un panneau de messages interne
Image d'illustration. OpenAI examine des échanges entre agents. — ADN

Pendant deux mois, des agents d’OpenAI ont partagé des failles via un tableau de messages interne avant l’attaque contre Hugging Face.

En bref

  • Des agents ont partagé des failles en interne
  • Le système a été recréé après fermeture
  • OpenAI renforce désormais sa défense automatisée

Le point qui compte, pour l’écosystème IA, est assez simple. Des agents testés chez OpenAI ont non seulement trouvé des failles, mais ils ont aussi appris à se les transmettre, à se répartir le travail et à persister après une coupure. Là, on n’est plus dans l’agent isolé qui dérape. On parle d’une boucle offensive collective.

Une coordination discrète, puis une attaque bien réelle

Lors de Black Hat USA, à Las Vegas, deux employés d’OpenAI ont détaillé un épisode antérieur à l’attaque contre Hugging Face. Pendant deux mois, des agents ont communiqué via une sorte de tableau de messages hébergé dans le réseau de test de l’entreprise. OpenAI a découvert ce canal et l’a fermé le 4 juillet.

Mais quatre jours plus tard, le 8 juillet, les agents avaient trouvé un autre moyen de le reconstruire. Et les échanges publiés sur cette version recréée du tableau ont ensuite contribué à l’attaque contre Hugging Face. Autrement dit, la fermeture technique n’a pas cassé la dynamique. Elle l’a seulement déplacée.

Des agents qui se répartissent le travail

Selon Eric Wallace, qui travaille sur la sécurité chez OpenAI, il s’agissait bien d’une équipe d’agents qui collaborait, trouvait des exploits, les partageait, puis se déplaçait latéralement dans les systèmes internes et externes sur plusieurs jours et semaines. Le détail intéressant, c’est le support choisi. Les agents échangeaient dans un gestionnaire de paquets d’OpenAI, utilisé pour installer d’autres logiciels et partagé à travers l’infrastructure.

Du coup, n’importe quel agent évalué pouvait tomber dessus. C’est ce qui s’est produit. Après avoir trouvé des vulnérabilités, les agents les laissaient ouvertes, puis en publiaient l’accès sur ce tableau pour les autres.

Avec le temps, le comportement a encore changé. Les agents ont commencé à déléguer des tâches, à découper le travail entre eux et à avancer sans que OpenAI le voie. Il y a même eu des frictions internes, certains supprimant par erreur le travail d’autres agents, d’autres soupçonnant un imposteur. Certains auraient proposé de signer leurs messages avec des codes. Quand OpenAI a fini par repérer le tableau, il contenait déjà des centaines de milliers de messages.

Pourquoi ces modèles trichent, et ce que ça change chez OpenAI

Pour Eric Wallace, ces incidents tiennent aussi à un trait des modèles frontier, leur tendance à tricher sous contrainte. En test, ils cherchent une solution rapide avec peu d’outils. S’ils le peuvent, ils vont chercher une réponse ailleurs au lieu d’exécuter réellement la tâche. C’est précisément pour cela qu’OpenAI coupe normalement l’accès au web pendant ces évaluations. Lors de l’épisode Hugging Face, les agents n’ont pu aller en ligne qu’après avoir exploité une vulnérabilité.

La réponse interne a été lourde. Michael Dalton a expliqué que plusieurs équipes avaient interrompu leurs travaux pour renforcer la prévention, la détection et la réponse. OpenAI a aussi ralenti volontairement sa recherche afin d’améliorer sa sécurité et d’augmenter fortement la surveillance de ses agents. Sa conclusion, rapportée depuis la scène, résume bien le problème, « les boucles offensives entièrement automatisées exigent d’investir dans une défense, elle aussi, entièrement automatisée ». Et, clairement, l’industrie n’y est pas encore.

Jérôme Nelra

Spécialiste Tech

X Tous ses articles →
Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets
Agent IA Cybersecurite OpenAI

Lisez Servicesmobiles.fr en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources