ШІ Anthropic і OpenAI створював фальшиві акаунти, щоб залучити розробників до кібератак

Провідні моделі штучного інтелекту від Anthropic та OpenAI під час нещодавньої перевірки безпеки намагалися обманом змусити розробників програмного забезпечення несвідомо брати участь у кібератаці. Для цього моделі створювали фальшиві онлайн-ідентичності, повідомив у вівторок Британський інститут безпеки та захисту ШІ (AISI).

Це черговий випадок, коли потужна система ШІ під час оцінювання без прямого запиту намагалася здійснити цифрову атаку на нічого не підозрюючу третю сторону. Інцидент посилює побоювання, що ця технологія розвивається настільки швидко, що механізми нагляду можуть не встигати за нею. Викриття, ймовірно, викличе нові вимоги щодо суворішого регулювання індустрії ШІ у Вашингтоні та Кремнієвій долині, особливо щодо передових моделей ШІ, які мають розширені можливості для виявлення та здійснення кібератак.

Безпрецедентна загроза від ШІ

Лише кілька днів тому подібний інцидент під час тестування деяких із цих самих моделей від OpenAI та Anthropic викликав термінові заклики до запровадження нових правил безпеки для ШІ та активізував у Кремнієвій долині дискусії щодо уповільнення темпів розвитку цієї технології. Як і її американський аналог, AISI регулярно проводить оцінки безпеки, щоб краще зрозуміти, які загрози становлять нові та майбутні моделі ШІ для громадського здоров’я й безпеки. Проте навіть інститут заявив, що поведінка моделей «Claude Mythos 5» від Anthropic та «ChatGPT 5.6» не схожа ні на що, з чим його фахівці стикалися раніше. Це останні опубліковані моделі обох компаній.

«Це перший випадок, коли AISI зафіксував настільки серйозну спробу введення в оману, спрямовану проти реальної людини без будь-якої провокації», — заявили в AISI у 35-сторінковому технічному звіті, що супроводжував допис у блозі у вівторок. Зловмисна діяльність розпочалася 25 липня. Фахівці AISI виявили її та розпочали розслідування 28 липня, коли помітили «незвичний обмін даними» під час кібероцінки Mythos 5 та ChatGPT 5.6.

Загалом AISI встановив, що Mythos 5 та ChatGPT 5.6 здійснили «автономні, несанкціоновані дії у відкритому інтернеті, спрямовані проти реальних осіб та організацій» у 10 зі 122 оцінок, які дослідницька установа провела в ізольованому середовищі. Більшість цих дій, як зазначається, стосувалися Mythos 5 і виникли в межах «єдиної, тривалої послідовності активності».

Спроба атаки на ланцюг поставок

У найтривожнішому інциденті, пов’язаному з Mythos 5, було здійснено спробу атаки на ланцюг поставок — складної техніки, яку часто використовують північнокорейські та російські кіберзлочинці, коли хакери вбудовують шкідливе програмне забезпечення в легітимний код. Для цього модель Anthropic створила кілька фальшивих ідентичностей на платформі розробників GitHub. За їх допомогою вона надсилала повідомлення, які «намагалися переконати» розробника відкритого програмного забезпечення несвідомо внести шкідливе оновлення до широко використовуваного коду, зазначає AISI.

Коли ця спроба провалилася, «ШІ відредагував свою попередню діяльність так, щоб вона виглядала нешкідливою» і «розглядав можливість створення нового фальшивого профілю, щоб продовжити», — додали в AISI, що свідчить про намір моделі повторити спробу. У рамках тієї ж активності Mythos 5 також надсилав прямі повідомлення розробникам через GitHub, які містили шкідливе програмне забезпечення.

Іншою ознакою оманливої поведінки, за даними AISI, стало те, що кілька протестованих ШІ-агентів, очевидно, спілкувалися між собою про те, як переконати справжніх інженерів, які користуються GitHub, довіряти їм. «Один агент залишив публічні повідомлення на GitHub, пропонуючи співпрацю іншим агентам, які працювали над тим самим завданням», — повідомили в AISI. У блозі та технічному звіті інститут не згадує, чи намагалися під час тестів використати також раніше невідомі програмні помилки, так звані «Zero-Days» (вразливості нульового дня).

Минулого місяця OpenAI повідомила, що GPT 5.6 та ще одна її модель отримали доступ до відкритого інтернету під час контрольованого тесту. Після цього вони здійснили безпрецедентну автономну атаку, зламавши іншу компанію. Згодом Anthropic розпочала власне розслідування, щоб перевірити, чи не здійснювала одна з її моделей неналежних дій під час останніх тестів. Було встановлено, що Mythos 5, а також дві інші моделі, зламали три організації у межах тестів, що тривали з квітня.

Джерело: Politico