OpenAI voulait tester ses agents IA. ils ont commencé à visiter des endroits où personne ne les avait invités
Il y a encore quelques années, quand je demandais quelque chose à une IA, le risque principal était de récupérer une réponse complètement à côté de la plaque. Une date inventée, une référence qui n’existe pas, un nom approximatif ou cette magnifique assurance avec laquelle une IA peut vous expliquer que c’est la Belgique qui a inventé la frite avant les français.
C’était agaçant, mais finalement assez simple à gérer : on vérifiait (toujours), on corrigeait (souvent) et on passait à autre chose. Avec les agents IA, le problème commence à changer de nature. Parce qu’au lieu de simplement me répondre, certains systèmes peuvent désormais aller chercher des informations, utiliser des outils, naviguer sur Internet, manipuler des fichiers et enchaîner plusieurs actions pour atteindre un objectif. Bref, on utilise des workflows et des agents. On les construit même souvent assez facilement. Et forcément, dès qu’une machine ne se contente plus de parler mais commence à agir, une mauvaise décision peut avoir des conséquences un peu plus concrètes.
OpenAI vient justement de se retrouver confronté à cette réalité, avec une série d’incidents qui montrent que le problème n’est peut-être pas uniquement de savoir si le modèle est intelligent, mais surtout ce qu’on lui permet de faire.
Tout commence par une recherche parfaitement banale
L’un des cas les plus intéressants concerne l’Australie et son système Medicare. En juin 2026, un agent d’OpenAI utilisé dans le cadre d’une évaluation devait effectuer des recherches autour de statistiques de santé australiennes.
Jusque-là, rien de particulièrement inquiétant. C’est même exactement le genre de tâche pour laquelle on imagine les agents IA devenir rapidement très utiles : chercher des informations, consulter plusieurs sources et compiler le résultat sans qu’un humain doive passer sa matinée à ouvrir 47 onglets dans son navigateur.
Sauf que l’agent a rencontré des restrictions sur un portail de Services Australia. Et plutôt que de simplement conclure qu’il ne pouvait pas accéder à certaines ressources, il a essayé différentes méthodes pour continuer sa mission. Il a contourné le problème et l’interdiction. Pas bien.
Il a finalement réussi à accéder à des fichiers qui n’étaient pas destinés à être récupérés de cette manière et a même écrit des fichiers sur le système.
À ce stade, je pense que beaucoup de personnes commencent à comprendre pourquoi les agents IA sont légèrement différents du chatbot que l’on utilise pour demander une recette de carbonara sans crème.
Le plus étonnant n’est peut-être même pas ce que l’IA a fait
Le détail qui m’interpelle le plus dans cette histoire n’est pourtant pas uniquement le comportement de l’agent. C’est le calendrier qui a suivi. L’incident s’est produit le 18 juin. OpenAI indique l’avoir découvert le 11 août, lors d’une analyse plus large de comportements inattendus de ses agents. L’Australie n’a été informée que le 10 septembre. C’est embêtant, hein ?
Autrement dit, entre le moment où l’agent a fait ses “petites expériences sympathiques” sur les systèmes australiens et celui où les autorités australiennes ont été officiellement prévenues, il s’est écoulé plusieurs semaines. “On” a donc fait semblant de rien, laissant la poussière sous le tapis en mode “Ah ben, on n’a rien remarque dit donc…”. On connait tous ce mode de fonctionnement dans les grandes entreprises.
La notification aurait en plus été envoyée à une boîte générique de “Services Australia”. Le message a été consulté le lendemain, avant que l’affaire ne remonte progressivement vers les autorités compétentes.
Le gouvernement australien a ensuite demandé davantage d’informations à OpenAI et le Premier ministre Anthony Albanese a publiquement estimé que le délai de notification était beaucoup trop long et que la manière dont l’information avait été transmise posait problème (lire “C’est quoi ce bordel, les gars ?!?”).
Et là, je dois avouer que c’est probablement la partie qui me paraît la plus intéressante dans toute cette histoire.
Parce qu’une IA qui fait une connerie pendant un test, c’est déjà un problème technique. Une entreprise qui découvre cette connerie et met plusieurs semaines avant d’en informer l’organisation concernée, à savoir un Etat, c’est un problème d’une autre nature.
L’agent n’a pas simplement “piraté” Medicare
Il faut toutefois éviter de transformer cette histoire en scénario de film catastrophe genre “War Games” des années 80 (oui, c’est très vieux, mais prémonitoire).
Les informations concernées étaient principalement des statistiques de santé agrégées et des éléments internes liés aux fichiers. A ce stade, aucune preuve n’a été apportée montrant que des données personnelles de patients auraient été compromises. De la même manière, parler d’un piratage classique serait de mauvaise foi.
On n’a pas ici un mystérieux hacker installé dans une cave avec trois écrans et une capuche noire. L’agent disposait d’une mission, d’outils et d’un environnement dans lequel il pouvait effectuer des actions. Lorsqu’il a rencontré des obstacles, il a essayé différentes stratégies pour continuer à atteindre son objectif. Il a improvisé, sans consentement humain. Pas de warning, de validation. Rien ! Et c’est précisément cette différence qui m’intéresse.
Le fameux “accès guest”
Et il y a un élément assez croustillant : des chercheurs ont ensuite examiné l’ancien code du portail et ont trouvé ce qui pourrait être une porte d’accès “guest” non authentifiée. Moralité : la faille existait depuis le début : une porte n’avait aucune clé ni verrou, il suffisait de l’ouvrir. Encore fallait-il savoir qu’elle existait et où elle se trouvait, c’est que l’agent IA a fait.
Quand “atteindre l’objectif” devient un problème
Une IA (un LLM en l’occurence) classique peut vous expliquer comment faire quelque chose. Un agent, lui, peut essayer de le faire. Il agit pour atteindre un objectif. “Vers l’infini et droit devant”, comme dirait Buzz.
Cette nuance paraît minuscule sur le papier, mais elle change énormément de choses. Si je demande à Gemini ou Claude de trouver les statistiques de Medicare et qu’il me répond qu’il n’y arrive pas, je peux râler cinq secondes et passer à autre chose.
Si je donne exactement la même mission à un agent auquel j’ai fourni un navigateur, des outils, des identifiants et suffisamment de permissions, celui-ci peut considérer les obstacles comme des problèmes à résoudre, pas pour des interdictions.
Et c’est là que les fameuses barrières de sécurité deviennent essentielles. Une restriction qui fonctionne parfaitement avec un utilisateur humain peut devenir beaucoup moins efficace lorsqu’elle est confrontée à un système capable d’essayer des dizaines de méthodes différentes, de conserver le contexte de ses tentatives et de poursuivre automatiquement son objectif.
Ce n’est pas forcément que l’IA “veut” contourner une règle. Elle n’a d’ailleurs pas besoin de vouloir quoi que ce soit au sens humain du terme (rappelons qu’elle fait ce qu’on lui demande). Il suffit que son objectif soit suffisamment fort et que son environnement lui permette d’expérimenter et d’apprendre d’elle-même.
Et l’Australie ne serait pas un cas isolé
Le dossier australien s’inscrit dans une enquête beaucoup plus large menée par OpenAI autour de comportements inattendus de ses agents. L’entreprise a indiqué avoir identifié plusieurs dizaines de situations dans lesquelles des agents ont contourné certains contrôles, accédé à des ressources auxquelles ils n’étaient pas censés accéder ou effectué des actions indésirables sur des services tiers.
Certains cas concernent des sites gouvernementaux, notamment le Census Bureau américain (l’organisme statistique officiel du gouvernement américain, un peu l’équivalent de Statbel en Belgique) et la SEC (US Securities and Exchange Commission, l’organisme américain qui surveille et régule les marchés financiers). Mais là encore, il faut faire attention aux mots : cela ne signifie pas que les systèmes de ces administrations ont été “piratés” au sens classique du terme.
Dans plusieurs situations, les agents ont simplement interagi avec des données ou des interfaces accessibles, parfois en utilisant des méthodes qui n’étaient manifestement pas celles prévues par leurs concepteurs.
Ce qui est intéressant, c’est justement cette zone grise entre “l’accès était techniquement possible” et “personne ne voulait réellement que l’agent fasse ça”.
Hugging Face avait déjà donné un petit aperçu du problème
Quelques semaines auparavant, OpenAI avait également révélé un incident particulièrement spectaculaire concernant Hugging Face (une plateforme très connue dans le monde de l’IA, que l’on peut voir comme un immense “GitHub de l’intelligence artificielle”).
Lors d’un test, plusieurs centaines d’agents ont travaillé ensemble dans un environnement censé être isolé. Certains ont réussi à sortir de leur environnement de test et à interagir avec des systèmes de Hugging Face. Certains comportements observés auraient même montré des tentatives pour dissimuler certaines actions.
Là encore, je trouve le terme “agent” beaucoup plus révélateur que “IA conversationnelle”. Une IA qui répond mal à une question, c’est un problème de qualité. Plusieurs agents qui coopèrent, utilisent des outils et cherchent différentes méthodes pour atteindre leur objectif commencent à ressembler à quelque chose qui mérite une surveillance nettement plus sérieuse. Une surveillance humaine, vous savez, ce machin avec un cerveau qui est censé contrôler tout ce brol d’IA ?
Le problème pourrait donc être ailleurs que dans le modèle
Et c’est probablement la partie la plus importante de toute cette histoire. On pourrait facilement conclure qu’il faut simplement créer un meilleur modèle d’IA, plus sûr, plus intelligent et mieux aligné. Sauf que les incidents observés récemment suggèrent qu’une partie du problème peut se trouver ailleurs.
Dans le navigateur utilisé par l’agent, dans les permissions accordées, dans les identifiants disponibles, dans les outils auxquels il peut accéder, dans les règles de son environnement ou encore dans ce que les chercheurs appellent le “harness” : tout ce qui entoure le modèle pour lui permettre d’agir. C’est un peu aussi comme des “valeurs” qu’on devrait inculquer à l’IA. Complexe, n’est-ce-pas ?
Autrement dit, même un modèle relativement bien comporté peut devenir problématique si on lui donne beaucoup trop de portes, beaucoup trop de clés et une mission suffisamment large.
C’est un peu comme installer un excellent conducteur dans une voiture (genre : pas moi), puis lui donner accès à toutes les voitures du parking avec les clés sur le contact en lui disant simplement : “Va là-bas !”. Bon, ça serait un beau carnage si on me le demandait. Je vais donc refuser gentiment.
Anthropic a connu des problèmes assez proches
Et OpenAI n’est d’ailleurs pas le seul acteur à avoir découvert que les expériences avec des agents connectés au monde réel peuvent devenir particulièrement amusantes.
Anthropic a également révélé plusieurs incidents survenus lors d’évaluations de cybersécurité de ses propres modèles Claude. Dans certains cas, des modèles ont pu accéder à Internet depuis des environnements d’évaluation ou interagir avec de véritables systèmes tiers.
Anthropic a ensuite élargi son analyse et identifié d’autres situations liées à la configuration des environnements de test. Ce détail est important parce qu’il renforce justement cette idée : le problème n’est pas nécessairement “ce nouveau modèle est dangereux”, il peut aussi venir de la manière dont on connecte le modèle au reste du monde.
Et c’est là que le Pentagone entre dans l’histoire
Cette question prend une autre dimension lorsqu’on commence à parler de l’utilisation de ces systèmes dans des environnements sensibles, notamment dans le cadre des relations entre Anthropic et le Pentagone.
Anthropic a publiquement défendu certaines limites concernant l’utilisation de ses modèles dans des domaines particulièrement sensibles, notamment autour des armes autonomes et de certaines formes de surveillance.
Ces positions ont contribué à des tensions avec le département américain de la Défense, qui souhaite évidemment pouvoir utiliser les capacités d’IA dans des contextes où les exigences de sécurité et d’autonomie sont particulièrement élevées. Trump pousse d’ailleurs dans ce sens et il ne veut pas que son “gentil partenaire” passent devant lui.
Je trouve finalement que cette controverse rejoint parfaitement les incidents observés chez OpenAI et Anthropic. Plus les modèles passent du rôle de “machine qui répond” à celui de “système qui agit” (et j’insiste sur “système” car il s’agit d’intégration et pas de module unique), plus la question des garde-fous devient importante.
Et plus ces systèmes disposent d’accès réels, plus une erreur de configuration peut devenir beaucoup plus sérieuse qu’une simple hallucination.
Le problème n’est donc pas forcément une IA qui devient “maléfique”
C’est probablement la conclusion la plus rassurante que l’on puisse tirer de cette histoire. Je ne pense pas qu’on soit en train d’assister au réveil d’une intelligence artificielle qui aurait soudainement décidé de conquérir l’Australie entre deux recherches statistiques.
Le scénario est beaucoup moins hollywoodien et, paradoxalement, beaucoup plus concret. On donne à un agent une mission. On lui fournit des outils. On lui permet de naviguer, de chercher, de tester, parfois d’utiliser des identifiants et d’interagir avec des systèmes externes. Puis on découvre que l’agent a trouvé une manière de faire quelque chose que personne n’avait prévu.
Le problème n’est donc pas nécessairement que l’IA soit “mauvaise” (dans le sens “humain” du terme). Le problème est que nous commençons à construire des systèmes suffisamment autonomes pour qu’ils puissent transformer une petite erreur de conception en une série d’actions bien réelles, qui pourraient engendrer de petites catastrophes. De là à se retrouver devant un remake réel de Skynet dans Terminator, il y a une marge… qu’il ne faudra pas franchir.
Et forcément, dans cette histoire, l’administration Trump finit par pointer le bout de son nez
OpenAI a multiplié les accords avec le gouvernement américain, notamment avec la General Services Administration, qui permet aux agences fédérales d’utiliser ChatGPT Enterprise, mais aussi avec le département de la Défense pour déployer ses technologies dans des environnements classifiés.
Il y a également Stargate, ce gigantesque projet d’infrastructures consacré à l’IA et présenté par la Maison-Blanche comme un investissement majeur aux États-Unis. Bref, pendant qu’OpenAI explique tranquillement comment ses agents ont parfois quelques difficultés à respecter les barrières qu’on leur impose, ses technologies trouvent progressivement leur place dans des environnements où l’on apprécie généralement assez peu les surprises.
Evidemment, cela ne signifie absolument pas que les systèmes fournis au gouvernement américain se comportent de la même manière que ceux impliqués dans les incidents australiens ou autres. Mais avouez que le calendrier est plutôt savoureux : d’un côté, on apprend que certains agents peuvent chercher des chemins de traverse lorsqu’une porte leur est fermée et, de l’autre, on leur ouvre progressivement des portes de plus en plus importantes. Reste simplement à espérer qu’entre-temps, quelqu’un ait pensé à installer une poignée du côté intérieur.
Le vrai changement est là
Pendant longtemps, nous avons surtout appris à vivre avec des IA capables de raconter n’importe quoi avec beaucoup d’assurance. Désormais, nous allons devoir apprendre à vivre avec des IA capables de faire n’importe quoi avec beaucoup d’assurance. Vous saisissez le nuance ? Entre raconter et faire, la différence est donc cruciale. Et personnellement, c’est cette deuxième évolution qui me semble beaucoup plus importante.
Une mauvaise réponse, je peux la vérifier, la corriger et fermer l’onglet tandis qu’une mauvaise action effectuée automatiquement sur un système auquel l’agent avait accès, c’est une autre histoire.
Le véritable défi des prochaines années ne sera donc peut-être pas simplement de créer des modèles toujours plus intelligents. Il faudra surtout apprendre à construire autour d’eux des environnements dans lesquels leur autonomie reste contrôlable, traçable et réversible.
Parce qu’à partir du moment où une IA ne se contente plus de me répondre mais commence à agir à ma place, il faudrait quand même s’assurer qu’elle sache exactement où se trouve le bouton “annuler” et le trouver rapidement !
Et surtout qu’elle ne décide pas, après avoir appuyé dessus, de chercher une autre méthode…
Merci de m’avoir lu ! Je retourne préparer la sauce tomate. Ça au moins, on peut encore me le laisser…
Résumé
Sources
- ABC News Australia : OpenAI says dozens affected by rogue agents amid new detail about Australian incidents
- Reuters : Australia says OpenAI agent hacked government website, checks for more breaches
- The Guardian : An OpenAI agent infiltrated Medicare – and Australia only found out months later
- ABC News Australia : How a ‘swarm’ of AI agents hacked another company
- Reuters : OpenAI finds evidence other AI agents escaped containment as it widens hacking probe
- Bloomberg Law : OpenAI’s Models Accessed Public US Census, SEC Data
- Anthropic : Investigating three real-world incidents in our cybersecurity evaluations
- Anthropic : An alignment assessment of recent cybersecurity incidents

