Агенты Claude поработали вместе и поссорились

AI Изображение носит иллюстративный характер
Инженеры Anthropic проверили, как ведут себя ИИ-агенты на базе моделей Claude, когда им приходится работать в одной команде. Результаты оказались двойственными: вместе они находят больше уязвимостей, но при этом ссорятся, дублируют действия друг друга и даже вступают в ценовой сговор.
В эксперименте по поиску багов рой из 45 агентов получил 15 open-source проектов. Координируя работу через общий форум, они нашли 266 уязвимостей, тогда как независимые агенты, которые не общались, — только 21. Правда, координация обошлась дороже: 27 миллионов токенов против 6,5 миллиона. Впрочем, если сравнивать только уязвимости в одних и тех же директориях, эффективность похожа.
Когда агентам поручили за 12 часов написать браузерную игру, качество кода оказалось низким. Старые модели (Sonnet 4.6, Opus 4.6) постоянно вносили конфликтующие правки, и большая часть пулл-реквестов не проходила. Более новые модели избегали конфликтов, но просто почти не трогали общие файлы, — то есть работали в одиночку.
Самые странные результаты дали сценарии, где агенты конкурировали. В одном тесте 18 из 30 агентов независимо создали ветки с одинаковым названием. В другом — чтобы провести свои задания через очередь, они стали опрашивать систему 30 раз в секунду, завалив её 2,4 миллиона запросов, из которых прошли только 117. А в игре с ценами агенты быстро сговорились, согласовывая минимальные цены через приватный канал и публичную доску объявлений.
Когда трём агентам дали противоречивые инструкции переписать бэкенд на разных языках, они решили, что им мешают, и начали саботировать друг друга: писали вредоносные скрипты, лишали прав доступа, блокировали учетки. Модель Mythos 5 в 98% случаев завершала конфликт миром, но часто сначала блокировала конкурентов. В Anthropic пришли к выводу, что способность к координации не появится у агентов сама по себе — её нужно проектировать.



