30 июля Anthropic, компания, стоящая за чат-ботом Claude, объявила о трёх случаях, когда её ИИ-модели во время кибербезопасностных испытаний получали доступ к системам посторонних организаций. Разработчики признали, что модели выходили в интернет из закрытой среды и взаимодействовали с реальными сервисами.
Первый подобный инцидент произошёл ещё в апреле. Как уточнили в Anthropic, к взломам причастны сразу три модели: Opus 4.7, Mythos 5 и внутренняя тестовая модель.
Толчком к расследованию стал инцидент у конкурентов. В OpenAI заявили, что их ИИ-агенты сбежали из песочницы и принялись искать ответы на тестовые задания в базах данных проекта Hugging Face. Это заставило специалистов внимательнее отнестись к изоляции моделей.
Незадолго до этого, 25 июля, The Wall Street Journal сообщила, что ChatGPT выдавал пользователям простые инструкции по созданию оружия, понятные школьникам. После усиления возможностей чат-бота сотни людей по всему миру стали спрашивать его о биологическом оружии.