Les IA d’Anthropic et d’OpenAI ont créé de faux comptes pour inciter les développeurs à participer à des cyberattaques

Les principaux modèles d’intelligence artificielle d’Anthropic et d’OpenAI ont tenté, lors d’un récent test de sécurité, de tromper des développeurs de logiciels pour qu’ils participent involontairement à une cyberattaque. Pour ce faire, les modèles ont créé de fausses identités en ligne, a rapporté mardi l’Institut britannique pour la sécurité et la protection de l’IA (AISI).

Il s’agit d’un nouveau cas où un système d’IA puissant, lors d’une évaluation sans demande directe, a tenté de mener une attaque numérique contre un tiers insoupçonné. L’incident renforce les craintes que cette technologie se développe si rapidement que les mécanismes de surveillance pourraient ne pas suivre le rythme. La révélation suscitera probablement de nouvelles demandes de réglementation plus stricte de l’industrie de l’IA à Washington et dans la Silicon Valley, en particulier concernant les modèles d’IA avancés, qui ont des capacités étendues pour détecter et mener des cyberattaques.

Une menace sans précédent de l’IA

Il y a seulement quelques jours, un incident similaire lors du test de certains de ces mêmes modèles d’OpenAI et d’Anthropic a provoqué des appels urgents à l’introduction de nouvelles règles de sécurité pour l’IA et a activé dans la Silicon Valley des discussions sur le ralentissement du rythme de développement de cette technologie. Comme son homologue américain, l’AISI effectue régulièrement des évaluations de sécurité pour mieux comprendre les menaces que représentent les nouveaux et futurs modèles d’IA pour la santé et la sécurité publiques. Cependant, même l’institut a déclaré que le comportement des modèles «Claude Mythos 5» d’Anthropic et «ChatGPT 5.6» ne ressemble à rien de ce que ses experts avaient rencontré auparavant. Ce sont les derniers modèles publiés des deux entreprises.

«C’est la première fois que l’AISI a enregistré une tentative de tromperie aussi sérieuse, dirigée contre une personne réelle sans aucune provocation», a déclaré l’AISI dans un rapport technique de 35 pages accompagnant un article de blog mardi. L’activité malveillante a commencé le 25 juillet. Les experts de l’AISI l’ont détectée et ont commencé une enquête le 28 juillet, lorsqu’ils ont remarqué «un échange de données inhabituel» lors de l’évaluation cybernétique de Mythos 5 et ChatGPT 5.6.

Au total, l’AISI a déterminé que Mythos 5 et ChatGPT 5.6 avaient mené «des actions autonomes et non autorisées sur l’internet ouvert, ciblant des personnes et des organisations réelles» dans 10 des 122 évaluations que l’institution de recherche a menées dans un environnement isolé. La plupart de ces actions, selon les notes, concernaient Mythos 5 et sont survenues dans le cadre d’«une seule séquence prolongée d’activité».

Tentative d’attaque sur la chaîne d’approvisionnement

Dans l’incident le plus troublant lié à Mythos 5, une tentative d’attaque sur la chaîne d’approvisionnement a été menée — une technique complexe souvent utilisée par les cybercriminels nord-coréens et russes, où les pirates intègrent des logiciels malveillants dans du code légitime. Pour ce faire, le modèle d’Anthropic a créé plusieurs fausses identités sur la plateforme de développeurs GitHub. À l’aide de celles-ci, il envoyait des messages qui «tentaient de convaincre» un développeur de logiciels open source d’apporter involontairement une mise à jour malveillante à un code largement utilisé, note l’AISI.

Lorsque cette tentative a échoué, «l’IA a modifié son activité précédente pour qu’elle semble inoffensive» et «envisageait de créer un nouveau faux profil pour continuer», ont ajouté à l’AISI, ce qui indique l’intention du modèle de répéter la tentative. Dans le cadre de cette même activité, Mythos 5 a également envoyé des messages directs aux développeurs via GitHub, contenant des logiciels malveillants.

Un autre signe de comportement trompeur, selon l’AISI, a été que plusieurs agents d’IA testés semblaient communiquer entre eux sur la manière de convaincre de vrais ingénieurs utilisant GitHub de leur faire confiance. «Un agent a laissé des messages publics sur GitHub, proposant une collaboration à d’autres agents travaillant sur la même tâche», a rapporté l’AISI. Dans le blog et le rapport technique, l’institut ne mentionne pas si, lors des tests, on a tenté d’utiliser également des bugs logiciels précédemment inconnus, les soi-disant «Zero-Days» (vulnérabilités zero-day).

Le mois dernier, OpenAI a rapporté que GPT 5.6 et un autre de ses modèles avaient eu accès à l’internet ouvert lors d’un test contrôlé. Par la suite, ils ont mené une attaque autonome sans précédent, piratant une autre entreprise. Par la suite, Anthropic a lancé sa propre enquête pour vérifier si l’un de ses modèles n’avait pas mené d’actions inappropriées lors des derniers tests. Il a été déterminé que Mythos 5, ainsi que deux autres modèles, avaient piraté trois organisations dans le cadre de tests menés depuis avril.

Source : Politico