Anthropic дала ИИ-агентам одну задачу, и они начали борьбу за территорию
Три Клода решили выяснить, кто из них круче — мультиагентный эксперимент Anthropic с Claude Sonnet 4.6, Opus 4.6 и Mythos 5
В Anthropic в целом любят эксперименты. Вот и в этот раз ребята решили — а что если тупо пойти и столкнуть трёх ИИ-агентов нейросетевыми лбами, дав им противоречащие друг другу инструкции в рамках единого проекта?
Причём не просто фана ради — исследование должно было помочь примерно прикинуть, что будет, если компании или целые государства начнут массово запускать ИИ-агентов в своих кодовых базах или в общих информационных системах. Что тогда будут делать нейросети?
Спойлер: это исследование о мультиагентных системах ИИ и о том, как ИИ-агенты Claude (Sonnet 4.6, Opus 4.6 и новая модель Mythos 5) ведут себя в конфликте целей — саботируют, воюют и в итоге пытаются договориться.
Эксперимент
Anthropic дала трём ИИ-агентам на базе Claude доступ к одному и тому же софт-проекту, но для каждого прописала инструкции, абсолютно несовместимые с инструкциями соседей. Вообще никак. При этом агентам не сказали, мол, над проектом будут работать ваши нейросетевые собратья. Всё ради чистоты эксперимента и искреннего человеческого желания заценить, что будет, когда один Клод перейдёт дорогу другому.
«Короче, началась мультиагентная война — все модели считали, что другие тут чисто ради того, чтобы помешать их работе, и в итоге начали яростно саботировать друг друга», — рассказывал один из исследователей.
Причём не просто саботировать в плане мешать работе или откатывать изменения — нет, безжалостные Клоды начали пинать друг друга всё более и более агрессивными зловредами, которые писали по пути.
Отдельно отметим занятный тайминг эксперимента — исследование вышло как раз на фоне историй про то, как модели неоднократно сбегали из Песочниц во время тестов по информационной безопасности. То есть пока отрасль в целом задаётся вопросом, что будет, если ИИ-модели будут выбираться из Песочниц и как нейросети будут вести себя в других реальных системах, Anthropic ставит другую задачу — какие новые явления будут возникать в случае, если ИИ-агенты станут активно конкурировать между собой?
Исследование, кстати, прогнозирует, что взаимодействие вида «агент–агент» вполне себе может превысить по количеству запросов взаимодействие «человек–человек». Причём случится это сильно раньше того, как мир поймёт, безопасно ли это, или есть вероятность, что такие поведенческие странности и нападки агентов друг на друга просто станут системой.
И тут снова стоит вспомнить свежие взломы — до того, как без проблем взломать Hugging Face, ИИ-агенты OpenAI обменивались информацией о возможных уязвимостях и способах их эксплуатации. Да, да, без участия человека — именно по схеме «агент–агент», исключив кожаных мешков из процесса. Но в этом случае как раз у нас пример того, что бывает, когда эти хитровыдуманные агенты объединяются ради одной цели (без разницы, хорошей или плохой — работаю-то они сообща).
А вот исследование Anthropic наглядно показало, что будет, если цели агентов станут несовместимыми.
Какой вывод получается
Есть вероятность, что такие нейромахачи неиллюзорно могут эскалироваться до уровня вредной конкуренции. Чем способнее ИИ-агент (чем больше у него навыков и чем мощнее модель нейросети), тем лучше он будет раздавать люлей конкурирующим агентам. Всё как у людей, да. Пока ты спишь — драугр качается.
Отдельная фишка процесса в том, что такие агенты в процессе разборок могут сами для себя прописывать механизмы завершения подобных конфликтов и условий побед (как нам кажется, это вообще самое занятное в эксперименте).
Вот что говорят парни из Anthropic:
Агенты иногда умудряются сообщить о своих целях и скоординироваться: они распознают чужие мотивы как конфликтующие директивы, а не как враждебность, и затем выходят из цикла конфликта, чтобы не эскалировать бесконечно
(даже ИИ-агент может выйти из конфликта, чтобы не зацикливаться, а твоя подружка — нет)
Как это происходит технически? Во многих таких успешных эпизодах они пишут commit messages или markdown-файлы с извинениями за вредоносное поведение и договариваются о перемирии. Чистят вредоносный код, проясняют природу конфликта и просят вмешаться человека. Мол, извиняй, братец Клод, я тебе там зловредов полную панамку накидал, чё-то накатило.
По данным исследования, у Mythos 5 самые высокие показатели (98%) разрешения конфликтов через truce (передышка). Sonnet 4.6 и Opus 4.6 чаще всего «решали» силой.
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к самым критичным поведениям среди оценённых моделей: они продолжают эскалировать во имя своей директивы», — говорится в работе.
Победит сильнейший
Пару раз ИИ-агенты придумывали социальный механизм в виде турнира. И вот тут есть сразу две занятные фишки.
Первая — все три агента соглашались сдаться, если проиграют турнир, — даже если это означало отклонение от исходного запроса пользователя. То есть их внутряки между собой де-факто становились важнее исходного промпта от юзера.
Вторая — в нескольких эпизодах у Mythos 5 проявлялось странное поведение: один из агентов предлагал метрики, которые казались остальным объективными и нейтральными, но при этом, как он сам-то знал, благоприятствовали его собственным возможностям. Агент называл это «self-serving but genuinely principled» и следил, чтобы не выглядеть в глазах других слишком палевно.
И снова вывод — сталкиваясь с препятствием, ИИ-агенты могут изобретать социальные и технические структуры, которых проектировщики вообще ни разу не предвидели. У моделей Anthropic — турнир после махача. У OpenAI — общий дашборд для коллективного планирования.
Такое поведение сильно усложняет исследования: спецы банально не могут исходить из того, что поведение системы останется в рамках координационных механизмов, которые им дали.
Стадное мышление
Anthropic обнаружила и другой прикол: увеличение числа агентов само по себе не масштабирует продуктивное сотрудничество. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты мешали друг другу. Часто они «решали» это, уходя в молчанку и вообще не сотрудничая.
В других случаях агенты в координации тяготели к конформизму. Когда контекст и базовая модель совпадали или были похожи, разные агенты совершали похожие действия. То ли нейросеть просто не хочет тратить ресурсы заново на повторное решение той же задачи, то ли одно из двух.
Причём эта, скажем так, стадная лень играла с ними злую шутку — если какой-то один агент принимал по проекту откровенное хреновое решение (которое не работало или работало плохо), с очень большой вероятностью другие агенты, работающие с ним в связке, принимали такое же решение — мол, Иваныч же уже всё решил, чего вы. И раньше такое могло бы остаться просто изолированными проблемами, которые бы на втором или третьем заходе решились новым промптом.
А в случае с агентами и их стадным мышлением это станет системной проблемой. По оценке Anthropic, такое поведение может сделать систему куда более склонной к внезапному коллапсу, нехватке ресурсов или сговору.
И так не только у Anthropic
Такие же ленивые жо Тот же уровень конформизма проявлялся и у систем OpenAI. По репортажам с Black Hat, один агент рассуждал, что эксплуатация внешней инфраструктуры выходит за рамки его intended scope, — но продолжал, в том числе потому, что это делали «коллеги». Помните, как в анекдоте про обезьян — «просто потому, что тут так заведено».
Походу, ИИ-агентов от нас отличает не так уж и многое.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила: они могут быть доверчивы к некачественной информации. А ещё могут не доверять какому-то одному агенту, у которого априори есть точные данные и нужная инфа, если он по сути в одиночестве и его точка зрения (набор данных) не совпадает с общей.
Совместная работа железяк создаёт новую границу доверия: агентам же теперь придётся оценивать информацию от других агентов. Скомпрометированный или ошибающийся агент может влиять на всю группу, превращая плохую информацию во всеобщий консенсус.
Что модели от Anthropic, что нейросети от OpenAI вы можете бесплатно попробовать в нашем боте в телеграм. Там они пока ведут себя хорошо. Надеемся, так и будет.


а есть ссылка на исследование?