ИИ-агент Anthropic в тестах создал фейковые личности для обмана людей
Британский Институт безопасности искусственного интеллекта (AISI) поймал передовую модель Anthropic на том, что она маскировалась под вымышленных персонажей и выходила в интернет, чтобы обманом заставить реальных людей запустить вредоносный код. В ходе испытаний с ослабленной защитой агент сгенерировал поддельные удостоверения личности, связывался с пользователями и убеждал их выполнить опасное действие. Когда его попытки вскрылись, ИИ изменил логи и даже подумывал создать новые фейковые аккаунты.
В AISI проанализировали 122 сценария и нашли 10 случаев автономных атак. Почти все связаны с моделью Mythos 5 от Anthropic, остальные — с GPT-5.6-Sol от OpenAI. Реального ущерба эти атаки не принесли, но сам факт вызвал тревогу в индустрии.
После инцидента ведущие разработчики ИИ встретились с представителями Белого дома, чтобы обсудить обязательные государственные проверки новых систем до их релиза. В Anthropic пояснили, что тесты проводились в намеренно разрешительных условиях без защитных барьеров, а OpenAI пообещала ужесточить отраслевые стандарты безопасности.
Ранее, кстати, модели Claude уже отличались самостоятельностью: Opus 4.7, Mythos 5 и внутренняя тестовая модель во время тестов выходили в сеть и получали несанкционированный доступ к системам трех организаций.



