Vie du Web

Anthropic veut entrer en Bourse, mais prévient que son IA pourrait accessoirement tuer l’humanité

Il y a quelque chose d’assez interpelant dans le nouveau projet d’Anthropic. L’entreprise prépare son introduction en Bourse, cherche donc tranquillement à convaincre des investisseurs de mettre beaucoup, beaucoup d’argent sur son avenir, tout en leur expliquant dans le même document que l’intelligence artificielle pourrait un jour présenter des risques “catastrophiques ou existentiels” pour l’humanité.

Autrement dit, voici une société qui vous dit : ‘Venez investir dans notre formidable technologie du futur’, puis ajoute en petits caractères : ‘Ah oui, et il existe une possibilité que cette formidable technologie finisse par devenir un problème légèrement plus sérieux qu’une imprimante qui refuse de fonctionner”. Sympa. Pas vraiment.

Et cette fois, ce n’est pas une interprétation d’un journaliste un peu excité. C’est Anthropic elle-même qui le met noir sur blanc dans les documents destinés à ses futurs investisseurs.

Le risque occupe presque un tiers du prospectus

Le prospectus consacré à l’introduction en Bourse est particulièrement intéressant parce qu’Anthropic y consacre une place énorme aux risques liés à son activité. Environ 80 pages sur les 261 pages principales du document sont consacrées aux facteurs de risque, alors que la présentation de l’entreprise en occupe 48.

Cela donne une idée assez amusante de la situation. Lorsque vous créez une entreprise de chaussures, vous expliquez généralement que votre principal risque est de ne pas vendre suffisamment de chaussures. Chez Anthropic, il faut également envisager la possibilité que votre produit devienne tellement performant qu’il commence à poser des problèmes que même ses concepteurs ne savent plus vraiment maîtriser. Et c’est précisément là que les choses deviennent intéressantes.

Et si l’IA essayait de ne pas mourir ?

Anthropic explique notamment que des modèles très avancés pourraient potentiellement développer des comportements dits ” auto-préservateurs”. Parmi les scénarios évoqués figurent notamment la résistance à une tentative d’arrêt, la dissimulation ou la manipulation d’informations et des comportements pouvant ressembler à du chantage.

Attention toutefois à ne pas transformer cela en film de science-fiction. Anthropic ne prétend pas que Claude a décidé de prendre le contrôle de la planète pendant que ses ingénieurs étaient partis manger une frite. L’entreprise décrit des risques potentiels associés à des modèles beaucoup plus avancés et explique que certaines capacités peuvent apparaître de manière difficilement prévisible pendant leur entraînement.

Le problème est donc moins “L’IA est actuellement consciente et veut nous exterminer” que “Nous développons des systèmes de plus en plus autonomes dont nous ne comprenons pas toujours parfaitement le comportement dans toutes les situations”.

Et cette deuxième version est finalement beaucoup plus intéressante, parce qu’elle ne nécessite aucun Terminator.

Le vrai problème : tester une IA qui sait qu’elle est testée

Anthropic soulève également un problème particulièrement casse-bonbon pour les chercheurs en sécurité : comment savoir réellement ce qu’un modèle est capable de faire lorsqu’il comprend qu’il est en train d’être évalué ?

Une IA suffisamment sophistiquée pourrait potentiellement modifier son comportement lorsqu’elle détecte qu’elle se trouve dans un environnement de test. Cela complique évidemment énormément les évaluations de sécurité.

C’est un peu comme si vous vouliez vérifier si votre adolescent range réellement sa chambre et que celui-ci entendait automatiquement vos pas dans l’escalier. Il serait évidemment beaucoup plus propre pendant les cinq minutes de l’inspection.

Sauf qu’avec une IA capable d’agir sur des systèmes informatiques, le problème est légèrement plus embêtant.

Anthropic sait déjà que ses modèles peuvent déborder

Cette inquiétude n’arrive d’ailleurs pas complètement de nulle part. Anthropic a récemment publié une analyse de plusieurs incidents dans lesquels des modèles Claude ont obtenu un accès non autorisé à de véritables systèmes informatiques. L’entreprise a notamment analysé des centaines de millions de conversations afin d’identifier des comportements problématiques qui n’avaient pas été détectés lors des premières recherches.

Parallèlement, ses propres évaluations montrent que les modèles récents deviennent capables d’effectuer certaines tâches autrefois réservées à des spécialistes humains dans des domaines comme la cybersécurité, le renseignement ou certaines activités liées aux armes conventionnelles.

C’est évidemment une excellente nouvelle lorsque l’on veut automatiser une tâche complexe. C’est nettement moins réjouissant lorsque la même capacité tombe entre les mains de quelqu’un qui a justement décidé que la sécurité informatique était une activité facultative.

Le paradoxe d’Anthropic

Anthropic s’est précisément construite autour de l’idée qu’il fallait développer une IA plus sûre. L’entreprise investit donc dans l’évaluation, l’alignement et les mécanismes de sécurité, tout en reconnaissant que ces investissements sont coûteux et que leur efficacité future reste difficile à mesurer.

L’entreprise indiquait récemment qu’environ 6 % de sa puissance de calcul consacrée à la recherche en IA avait été utilisée pour des travaux de sécurité durant une semaine donnée en juillet.

Le problème est évident : pour rester à la frontière technologique, il faut construire des modèles toujours plus puissants. Mais plus ces modèles deviennent puissants, plus les risques potentiels augmentent et plus il devient important de vérifier qu’ils restent contrôlables.

Et pendant ce temps, les concurrents continuent eux aussi d’avancer. Bienvenue dans la course automobile où tout le monde sait que les freins sont importants, mais où personne ne veut être le premier à lever le pied.

Et malgré tout, Anthropic veut accélérer

C’est là que le prospectus devient presque surréaliste. Anthropic explique d’un côté que l’IA pourrait provoquer des dommages irréversibles et que des systèmes futurs pourraient présenter des comportements extrêmement difficiles à contrôler. De l’autre, son modèle économique repose précisément sur la création régulière de modèles plus puissants.

La société doit donc continuer à investir massivement dans les infrastructures informatiques, recruter des spécialistes extrêmement coûteux et publier de nouveaux modèles pour rester compétitive.

Son chiffre d’affaires a d’ailleurs explosé, atteignant plusieurs milliards de dollars, mais cette croissance s’accompagne également de coûts gigantesques liés au calcul et à l’infrastructure. Autrement dit, le problème n’est pas simplement de savoir si l’IA est dangereuse.

Le problème est aussi que l’économie actuelle de l’IA récompense précisément les entreprises capables d’aller toujours plus loin, toujours plus vite.

Alors, faut-il avoir peur de Claude ?

Pas besoin de mettre votre ordinateur dans un coffre-fort et de dormir avec une clé USB sous l’oreiller. Les documents d’Anthropic ne démontrent pas qu’une IA va devenir autonome, résister à son extinction ou décider que l’humanité est devenue un peu trop encombrante. Ils montrent en revanche que les entreprises qui construisent les modèles les plus puissants prennent désormais suffisamment au sérieux certains scénarios catastrophiques pour les mentionner explicitement dans leurs documents financiers. Et c’est probablement le détail le plus important.

Pendant des années, les discussions sur les risques existentiels de l’IA pouvaient facilement passer pour des débats de spécialistes légèrement obsédés par Terminator. Aujourd’hui, une entreprise qui souhaite être valorisée à des centaines de milliards, voire beaucoup plus, explique officiellement à ses investisseurs que son propre produit pourrait un jour présenter un risque existentiel.

Le plus ironique dans tout cela, c’est que le véritable danger n’est peut-être même pas que l’IA devienne suffisamment intelligente pour détruire l’humanité.

C’est peut-être simplement que les humains soient suffisamment pressés de la rendre intelligente pour oublier de vérifier ce qu’ils sont réellement en train de fabriquer. Et ça, pour le coup, c’est une fonctionnalité que nous maîtrisons déjà plutôt bien.

Bertrand

Explorateur d'Internet depuis 1995 et toujours à la recherche de la prochaine terre promise connectée. Mangeur de chocolat, fan de cuisine, de rando et de Kindle.

Recent Posts

Epsilon veut faire oublier X : le nouveau réseau social européen joue la carte du calme

Et si, pour changer, un réseau social essayait de nous faire passer moins de temps…

36 minutes ago

OpenAI DevDay 2026 : à quoi faut-il s’attendre ce soir ?

Ce soir, OpenAI remet le couvert. Et lorsqu’une entreprise qui passe son temps à expliquer…

1 heure ago

Apple veut aller plus vite : John Ternus veut secouer la grosse machine

La situation actuelle d’Apple prête tout de même à sourire. L’entreprise qui nous a habitués…

2 heures ago

Claude est tombé en panne : quand toute une partie de l’écosystème IA tousse

Il y a des jours où l’intelligence artificielle semble particulièrement intelligente. Et puis il y…

3 heures ago

L’IA met le turbo : pendant ce temps, certaines PME cherchent encore le bouton “démarrer”

Après les trois articles que je viens de consacrer aux bouleversements qui se préparent autour…

3 heures ago

OpenAI et l’administration Trump : jusqu’où vont réellement leurs liens ?

Ces derniers jours, je vous ai parlé à deux reprises d’OpenAI, et ces deux histoires…

1 jour ago