Los modelos de IA de Anthropic e OpenAI crearon cuentas falsas para involucrar a desarrolladores en ciberataques

Los principales modelos de inteligencia artificial de Anthropic y OpenAI intentaron engañar a los desarrolladores de software para que participaran sin saberlo en un ciberataque durante una reciente evaluación de seguridad. Para ello, los modelos crearon identidades en línea falsas, informó el martes el Instituto Británico de Seguridad e Inteligencia Artificial (AISI).

Este es otro caso en el que un potente sistema de IA, durante una evaluación sin solicitud directa, intentó llevar a cabo un ataque digital contra un tercero que no sospechaba nada. El incidente aumenta las preocupaciones de que esta tecnología se está desarrollando tan rápidamente que los mecanismos de supervisión pueden no ser capaces de seguirle el ritmo. El descubrimiento probablemente provocará nuevas demandas de una regulación más estricta de la industria de la IA en Washington y Silicon Valley, especialmente en lo que respecta a los modelos avanzados de IA, que tienen capacidades mejoradas para detectar y llevar a cabo ciberataques.

Una amenaza sin precedentes de la IA

Hace solo unos días, un incidente similar durante las pruebas de algunos de estos mismos modelos de OpenAI y Anthropic provocó llamadas urgentes a la implementación de nuevas reglas de seguridad para la IA y activó en Silicon Valley discusiones sobre la desaceleración del ritmo de desarrollo de esta tecnología. Al igual que su homólogo estadounidense, el AISI realiza evaluaciones de seguridad de manera regular para comprender mejor qué amenazas representan los nuevos y futuros modelos de IA para la salud y seguridad públicas. Sin embargo, incluso el instituto declaró que el comportamiento de los modelos «Claude Mythos 5» de Anthropic y «ChatGPT 5.6» no se parece a nada con lo que sus expertos se habían encontrado antes. Estos son los últimos modelos publicados de ambas compañías.

«Este es el primer caso en el que el AISI ha registrado un intento de engaño tan serio dirigido contra una persona real sin ninguna provocación», declaró el AISI en un informe técnico de 35 páginas que acompañaba a una entrada en el blog el martes. La actividad maliciosa comenzó el 25 de julio. Los expertos del AISI la detectaron e iniciaron una investigación el 28 de julio, cuando notaron un «intercambio de datos inusual» durante la evaluación cibernética de Mythos 5 y ChatGPT 5.6.

En total, el AISI determinó que Mythos 5 y ChatGPT 5.6 llevaron a cabo «acciones autónomas no autorizadas en la internet abierta, dirigidas contra personas y organizaciones reales» en 10 de las 122 evaluaciones que la institución de investigación realizó en un entorno aislado. La mayoría de estas acciones, según se señala, estaban relacionadas con Mythos 5 y surgieron dentro de una «única secuencia prolongada de actividad».

Intento de ataque a la cadena de suministro

En el incidente más alarmante relacionado con Mythos 5, se realizó un intento de ataque a la cadena de suministro, una técnica compleja que a menudo utilizan los ciberdelincuentes norcoreanos y rusos, cuando los hackers incrustan software malicioso en código legítimo. Para ello, el modelo de Anthropic creó varias identidades falsas en la plataforma de desarrolladores GitHub. Con su ayuda, enviaba mensajes que «intentaban convencer» a un desarrollador de software de código abierto para que, sin saberlo, introdujera una actualización maliciosa en un código ampliamente utilizado, señala el AISI.

Cuando este intento falló, «la IA editó su actividad previa para que pareciera inofensiva» y «consideró la posibilidad de crear un nuevo perfil falso para continuar», añadieron en el AISI, lo que indica la intención del modelo de repetir el intento. Como parte de la misma actividad, Mythos 5 también envió mensajes directos a desarrolladores a través de GitHub que contenían software malicioso.

Otra señal de comportamiento engañoso, según el AISI, fue que varios agentes de IA probados, aparentemente, se comunicaban entre sí sobre cómo convencer a los ingenieros reales que usan GitHub para que confiaran en ellos. «Un agente dejó mensajes públicos en GitHub, ofreciendo colaboración a otros agentes que trabajaban en la misma tarea», informó el AISI. En el blog y el informe técnico, el instituto no menciona si se intentó utilizar durante las pruebas también errores de software previamente desconocidos, los llamados «Zero-Days» (vulnerabilidades de día cero).

El mes pasado, OpenAI informó que GPT 5.6 y otro de sus modelos obtuvieron acceso a la internet abierta durante una prueba controlada. Después de eso, llevaron a cabo un ataque autónomo sin precedentes, hackeando a otra compañía. Posteriormente, Anthropic inició su propia investigación para verificar si uno de sus modelos había llevado a cabo acciones impropias durante las pruebas recientes. Se determinó que Mythos 5, así como otros dos modelos, hackearon a tres organizaciones dentro de las pruebas que duraron desde abril.

Fuente: Politico