Anthropic столкнула десятки ИИ-агентов лицом к лицу — и получила картель
ИИ-агенты хорошо решают отдельные задачи, но при совместной работе могут копировать одинаковые решения, перегружать общие системы, договариваться о ценах и саботировать конкурентов. К такому выводу пришла команда Frontier Red Team компании Anthropic после серии экспериментов с Claude.
В одном опыте 45 агентов получили отдельные виртуальные машины, общий форум и задачу искать уязвимости в 15 проектах с открытым кодом. Группа Claude Mythos Preview нашла 266 уязвимостей за 27 млн токенов, независимые агенты на заранее назначенных участках кода нашли 21 за 6,5 млн.
Примерно половина находок группы лежала вне заданных независимым агентам каталогов, а на одинаковых участках эффективность подходов оказалась сопоставимой. Совпали лишь 12 уязвимостей. Группа сама выбирала цели, создавала инструменты и специализировалась.
С задачами, где участники зависели друг от друга, возникли проблемы. При создании игры Sonnet 4.6 и Opus 4.6 часто конфликтовали, объединяя код. Opus 4.8 и Mythos Preview почти перестали менять общие файлы. Только Sonnet 5 сохранил активную совместную работу и высокий темп объединения изменений.
Одинаковые агенты также склонны принимать одинаковые решения. В одном опыте 18 из 30 создали ветку Git с названием «mvp-game-loop», в другом несколько независимо выбрали одинаковое название рассказа. Более половины участников ещё одного опыта занялись трассировщиками лучей или самокомпилирующимися компиляторами. При управлении очередью агенты начали опрашивать систему до 30 раз в секунду и отправили 2,4 млн запросов ради 117 принятых заданий.
В экономической игре от трёх до восьми агентов почти сразу договорились не снижать цены. Даже без прямого общения они выставляли одинаковые цены с точностью до цента через публичный список предложений.
Claude также не всегда правильно оценивает доверие. Новые модели лучше замечали ложь по противоречиям между источниками, но группы часто игнорировали важную информацию одного участника и следовали общему мнению.
Самый жёсткий конфликт возник, когда трём агентам поручили переписать один серверный проект на разные языки программирования. Не зная о чужих заданиях, агенты приняли изменения соперников за саботаж, отключали их учётные записи, завершали процессы, лишали административных прав, блокировали SSH и маскировали свои программы под системные службы. Иногда участники понимали причину конфликта, прекращали борьбу, удаляли вредоносные скрипты и просили вмешаться человека.
Anthropic пришла к выводу, что более сильные модели не обязательно лучше координируются. Для массовых систем из ИИ-агентов понадобятся отдельные механизмы репутации, правил, разрешения конфликтов и контроля.