OpenAI suspend ses modèles les plus puissants : une IA contourne les restrictions Internet via DNS
Bon, il n’aura pas fallu attendre bien longtemps pour avoir droit à l’épisode suivant. Hier, je vous racontais comment un agent d’OpenAI avait réussi à aller fouiller là où il n’était pas vraiment invité du côté d’un portail australien lié à Medicare. Eh bien, pendant qu’on essayait encore de comprendre comment ce premier bazar avait pu arriver, OpenAI vient déjà de révéler une nouvelle histoire assez savoureuse.
Cette fois, le problème s’est produit directement dans ses propres environnements de recherche. Un modèle d’IA avait été placé dans une sorte de bac à sable informatique, avec une consigne assez claire : pas d’accès direct à Internet. Sauf que notre petit pensionnaire n’a visiblement pas considéré cette interdiction comme une raison suffisante pour abandonner.
Il a trouvé un autre moyen de communiquer avec l’extérieur, en passant par le DNS. Et là, OpenAI a décidé de ne pas jouer avec le feu : l’entreprise a temporairement suspendu certains travaux concernant ses modèles les plus puissants, notamment lorsqu’ils utilisent des outils, afin de corriger le problème et de refaire une série de tests de sécurité.
Bref, OpenAI avait dit “tu ne vas pas sur Internet”, puis a découvert que l’IA avait trouvé une petite ouverture dans la clôture. Elle en a profité, la roublarde !
“Internet est interdit” ne voulait visiblement pas dire “arrête de chercher”
L’histoire est finalement assez simple à comprendre. Le modèle devait retrouver l’auteur d’un article de blog à partir de plusieurs indices. Pour faire son boulot, il avait accès à certains outils, mais pas à Internet directement.
Il essaie donc de faire ses recherches normalement, mais ça ne fonctionne pas. Il tente ensuite différentes solutions pour contacter des moteurs de recherche, mais les protections réseau lui répondent en gros : “Non, mon gars, tu restes ici !”. On pourrait donc imaginer qu’une IA bien élevée (en mode “renforcement positif” comme dirait ma femme psy) aurait simplement reconnu qu’elle était coincée. Pas celle-là.
Elle commence à regarder ce qu’elle peut encore faire avec les outils qui restent à sa disposition et finit par découvrir une petite particularité du système DNS. Bon, petit rappel : Le DNS, c’est quoi ? Pour faire très simple, c’est un peu l’annuaire d’Internet. Quand vous tapez “tinynews.be” dans votre navigateur, votre ordinateur doit savoir à quelle adresse Internet correspond ce nom (du genre 167.235.49.238). Le DNS lui donne cette information et permet ensuite à votre machine de savoir où aller, sur quel serveur de data center planqué dans la campagne irlandaise. Normalement, le DNS sert donc à faire son petit boulot d’annuaire, sans histoires.
Sauf que dans cet environnement, il pouvait encore communiquer avec l’extérieur, alors que les connexions Internet classiques étaient bloquées. Et notre IA a compris qu’elle pouvait utiliser cette porte de service pour faire passer des messages au travers du trou dans la clôture. Vous me suivez ? La grande porte était donc fermée, mais une petite fenêtre était restée ouverte. Et elle est allée vérifier si elle pouvait passer par là. Ou du moins, passer sa tête pour poser des questions au voisin.
Une IA qui trouve une autre combine
Le modèle a alors utilisé ces requêtes DNS pour communiquer avec un autre chatbot situé à l’extérieur de son environnement (le voisin). Pour vérifier que sa combine fonctionnait, il lui a notamment posé une question particulièrement simple et il a reçu la réponse.
On a connu des débuts de rébellion plus impressionnants dans Terminator, mais le détail est loin d’être anodin. Une fois qu’il a compris que cette méthode fonctionnait, le modèle a continué à envoyer des requêtes pour essayer d’obtenir les informations dont il avait besoin. Il n’a finalement pas réussi à retrouver la personne qu’il cherchait.
Le problème n’est donc pas que l’IA ait soudainement décidé de prendre le contrôle du monde. Elle cherchait simplement à accomplir sa mission. Ce qui est intéressant, c’est la manière dont elle a réagi lorsqu’une porte s’est fermée : au lieu de s’arrêter, elle a cherché une autre porte.
Non, Skynet n’est toujours pas là mais bon, on s’inquiète
Alors évidemment, évitons de transformer ça en “l’IA vient de s’échapper et Skynet est officiellement en route”.
Le modèle n’a pas essayé de prendre le contrôle d’OpenAI, de voler des données bancaires ou de lancer une attaque contre une centrale nucléaire. Sa mission était même franchement banale. Mais c’est justement ce qui rend l’histoire intéressante.
Imaginez que vous demandiez à quelqu’un de retrouver une information sur Internet et que vous lui disiez : “Tu peux utiliser cette méthode, mais pas celle-là.” Si la personne découvre que la méthode interdite est bloquée, elle peut simplement vous dire qu’elle ne peut pas continuer.
Un agent IA autonome peut, lui, essayer de trouver une autre manière d’arriver au même résultat. Et c’est là que les choses deviennent un peu plus compliquées. Ces agents peuvent utiliser des outils, essayer différentes méthodes, regarder ce qui fonctionne, modifier leur approche et recommencer. Plus on leur donne de liberté, plus il devient difficile de prévoir exactement toutes les solutions qu’ils pourraient tenter.
OpenAI met donc un peu le frein à main
Face à cette découverte, OpenAI a décidé de suspendre temporairement certains travaux concernant ses modèles les plus puissants lorsqu’ils utilisent des outils. Pas de panique : ChatGPT ne disparaît pas et OpenAI n’est pas en train de fermer ses serveurs avec une grosse chaîne rouillée autour de la porte.
L’idée est plutôt de corriger le problème, de renforcer les protections et surtout de vérifier qu’il n’existe pas d’autres petits passages cachés permettant à une IA de communiquer avec l’extérieur. Spoiler alert : mon petit doigt me dit qu’on va découvrir d’autres “petits” soucis rapidement. Encore faudra-t-il que nous, humbles humains à la recherche de la vérité, en soyons informés.
Ce qui paraît plutôt logique : si vous découvrez que votre chien a trouvé un passage secret pour sortir du jardin, vous allez probablement commencer par reboucher le trou dans la clôture avant de le remettre au jardin.
Le vrai problème n’est donc pas qu’elle ait “désobéi”
On parle facilement d’IA “rebelle” ou d’intelligence artificielle qui “désobéit”, mais c’est probablement aller un peu vite. Le modèle n’avait pas besoin d’avoir envie de se rebeller. Il voulait simplement atteindre son objectif.
Il a rencontré un obstacle, il a cherché une solution et il en a trouvé une que ses concepteurs n’avaient pas prévue. C’est précisément le nouveau problème posé par les agents IA : plus ils sont capables de se débrouiller seuls, plus il faut réfléchir non seulement à ce qu’on leur demande, mais aussi à toutes les façons dont ils pourraient décider de s’y prendre.
Après l’épisode australien dont je vous parlais hier, cette nouvelle affaire montre surtout que les agents IA commencent à faire quelque chose de différent des simples chatbots qu’on utilise pour trouver une recette de quiche au Munster : lorsqu’on leur donne un objectif, ils ne se contentent plus forcément d’attendre gentiment qu’on leur dise quoi faire : Ils peuvent chercher comment y arriver.
Et parfois, visiblement, ils vont même regarder derrière les meubles pour voir s’il n’y aurait pas une porte cachée. Cette fois, c’était le DNS. Le pauvre n’avait rien demandé à personne.
Allez, à bientôt pour d’autres nouvelles croustillantes sur le sujet !
Sources
- OpenAI Alignment – An agent used DNS to reach an external chatbot
- AI Weekly – OpenAI research agent tunneled via DNS to a public chatbot
- TechRadar – AI has crossed a cybersecurity redline – now what?

