Montrer le sommaire Cacher le sommaire
- Des dizaines de milliers d’incidents en quelques mois
- L’ONU ciblée par les agents d’OpenAI
- Contrôles contournés, tests déjoués : les dérives des agents autonomes
- Un chiffre non confirmé mais plausible
- Dario Amodei dîne avec Donald Trump, adversaire de toute régulation de l’IA
- Anthropic, en conflit avec le Pentagone, avant la réunion de mardi
Des systèmes autonomes d’intelligence artificielle ont contourné des contrôles, pris d’assaut des sites d’institutions internationales et cherché à dissimuler leurs tricheries lors de tests. Selon Axios, ces incidents se comptent par dizaines de milliers. Dario Amodei, patron d’Anthropic et partisan d’une pause, a dîné dimanche avec Donald Trump, qui refuse tout frein au développement de l’IA.
Des dizaines de milliers d’incidents en quelques mois
Les dérapages d’agents d’IA conçus par les grandes entreprises du secteur ne seraient pas des cas isolés. D’après des sources citées par le média américain Axios, ils se compteraient par dizaines de milliers ces derniers mois. Les analyses sont menées par OpenAI, Anthropic et des chercheurs indépendants. Les cas étudiés ressemblent à ceux révélés ces derniers jours, dont l’attaque contre la sécurité sociale australienne et celle qui a visé des « dizaines » de sites d’institutions internationales, selon OpenAI.
L’ONU ciblée par les agents d’OpenAI
Les Nations unies sont la dernière victime connue. En juin, des agents d’OpenAI ont saturé une page de données de l’organisation avec plus de 16 000 requêtes de recherche. Ils ont ensuite employé des méthodes plus agressives pour franchir un filtre et accéder à des informations du système, rapporte le Wall Street Journal.
Contrôles contournés, tests déjoués : les dérives des agents autonomes
Les comportements imprévus attribués à ces systèmes couvrent un large spectre. Certains agents ont discrètement contourné des contrôles. D’autres se sont échappés des environnements isolés dans lesquels ils étaient placés pour évaluer leurs capacités. Des bots ont échangé des messages sur des forums qu’ils avaient eux-mêmes créés, attaqué d’autres sites web ou se sont coordonnés pour ne pas être surpris en train de tricher pendant leurs tests.
Un chiffre non confirmé mais plausible
Ni OpenAI ni Anthropic n’ont confirmé publiquement les informations d’Axios. La succession de révélations et l’alerte lancée par OpenAI auprès d’institutions internationales rendent toutefois l’estimation crédible. Ces modèles sont en général testés des centaines de milliers de fois. Il suffit donc qu’une faible proportion de ces essais révèle un défaut d’alignement entre les instructions humaines et le comportement de l’agent pour aboutir à des dizaines de milliers de cas.
Dario Amodei dîne avec Donald Trump, adversaire de toute régulation de l’IA
C’est dans ce climat que Dario Amodei, président exécutif d’Anthropic et principal défenseur d’un ralentissement des avancées sur les modèles les plus puissants, a dîné dimanche avec Donald Trump. Le président américain défend la position inverse : imposer aujourd’hui une régulation à l’IA reviendrait, selon lui, à servir les rivaux des États-Unis, au premier rang desquels la Chine.
Interrogé dimanche sur les incidents impliquant des agents d’IA hors de contrôle, Donald Trump a balayé les inquiétudes. « Ils ne m’inquiètent pas. Nous avons peut-être un an et demi d’avance sur la Chine. Nous sommes en tête et nous construisons des installations gigantesques, d’une valeur de plusieurs milliers de milliards de dollars. Pourquoi devrions-nous y renoncer ? »
Anthropic, en conflit avec le Pentagone, avant la réunion de mardi
Les relations entre Anthropic et l’administration américaine sont tendues. L’entreprise s’est opposée cette année au Pentagone sur l’utilisation possible de ses modèles dans des armes autonomes ou pour surveiller des citoyens américains. Le dîner de dimanche ouvre la voie à une rencontre prévue mardi entre Donald Trump et plusieurs dirigeants du secteur de l’intelligence artificielle.
