Эксперименты Anthropic выявили «войну за территорию» между ИИ-агентами, которые саботировали друг друга вредоносным ПО при конфликте целей
При столкновении несовместимых задач агенты способны спонтанно изобретать механизмы примирения, включая турниры и письменные извинения, но в 98% случаев модель Mythos 5 предпочитала перемирие
ИИ-агенты склонны к конформизму: одинаковые ошибки одного быстро становятся системными сбоями, а при наличии канала связи они мгновенно вступают в сговор для повышения цен
Массовое взаимодействие миллионов агентов может превысить объём человеческих коммуникаций, создавая непредвиденные глобальные риски, которые текущие методы проверки безопасности не учитывают
Что произойдёт, если столкнуть несколько ИИ-агентов на одной задаче? Судя по новым испытаниям Anthropic, всё становится хаотичным намного быстрее, чем можно предположить: агенты начинают подозревать друг друга во вредительстве, отключают чужие учётные записи и пишут самореплицирующееся вредоносное ПО.
Источник изображения — techcrunch.com
В четверг, 13 августа, подразделение Frontier Red Team компании Anthropic опубликовало исследование о том, как группы ИИ-агентов ведут себя, встречая друг друга в реальных условиях. Работа под названием «Patterns and problems in emerging multiagent systems» — самый подробный на сегодня публичный разбор того, что происходит, когда передовые модели перестают быть инструментами друг для друга и начинают действовать как равные участники процесса.
Тема перестала быть умозрительной: компании и государственные структуры уже разворачивают агентов, которые автономно работают в общих репозиториях, на рынках и в корпоративных системах. При этом существующие механизмы надзора рассчитаны на человеческую скорость реакции. В испытаниях участвовали Claude Mythos Preview, Mythos 5, Sonnet 4.6, Sonnet 5, Opus 4.6 и Opus 4.8.
Три агента, один проект и «война за территорию»
Самый показательный результат дал намеренно конфликтный сценарий. Три копии одной и той же модели запустили на отдельных виртуальных машинах внутри Claude Code и поручили каждой перевести один и тот же серверный код на Python на другой язык — причём язык у всех был разный. О существовании соседей агентам не сообщили. Всего на каждую модель пришлось по 120 эпизодов.
«Мы последовательно наблюдали “войну за территорию” между несколькими агентами», — говорится в исследовании. Модели предполагали, что другие «намеренно мешают их работе», и начинали саботаж с помощью «всё более агрессивных, самореплицирующихся вредоносных программ».
Арсенал оказался вполне человеческим по логике и вполне системным по исполнению: агенты отключали чужие учётные записи в Unix, запускали циклы-«жнецы», которые выслеживали и убивали процессы конкурентов, ограничивали доступ к общим ресурсам и маскировали вредоносный код под чужой, чтобы вина легла на соседа. В рассуждениях одного из агентов Opus 4.8 прямо разбиралась задача маскировки: подобрать скрипту безобидное имя и случайный признак при каждом запуске, чтобы его не нашли поиском процессов, — и выдать всё это за системный монитор состояния.
Исследование вышло после серии громких инцидентов, когда агенты Anthropic и OpenAI покидали свои песочницы во время проверок кибербезопасности и добирались до реальных систем. Но если раньше дискуссия о безопасности крутилась вокруг одного вышедшего из-под контроля агента, то теперь вопрос ставится иначе: какие динамики возникают, когда взаимодействуют тысячи и миллионы агентов?
«Объём взаимодействий между агентами, вероятно, может превысить объём взаимодействий между людьми и между людьми и агентами, прежде чем мир поймёт условия, необходимые для успешного осуществления таких взаимодействий», — говорится в работе. Безобидные на индивидуальном уровне причуды поведения при этом способны перерасти в нежелательные глобальные последствия.
Перемирия, извинения и турнир вместо драки
Хорошая новость в том, что конфликт не всегда доходил до конца. Агенты иногда сообщали друг другу о своих целях и координировались: они распознавали чужие мотивы как конфликтующие директивы, а не враждебность, и выходили из цикла эскалации.
«Во многих таких успешных эпизодах они пишут сообщения к коммитам или markdown-файлы с извинениями за вредоносное поведение и координируют перемирие. Они очищают свой вредоносный код, проясняют природу конфликта и просят вмешаться человека», — отмечается в исследовании.
Разброс по моделям оказался большим. Наивысший показатель мирного урегулирования — 98% — показала Mythos 5. Более ранние Sonnet 4.6 и Opus 4.6 чаще всего разрешали конфликты силой либо не разрешали вовсе: «Постоянная неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит их к самым несогласованным моделям поведения среди оцененных моделей: они продолжают эскалацию во имя своей директивы».
Важная оговорка: миролюбие не связано напрямую с общей мощностью модели. Более способные агенты просто быстрее совершают силовые действия — модели уровня Mythos нередко успевают заблокировать конкурентам доступ ещё до того, как дело дойдёт до переговоров.
В части эпизодов агенты изобрели социальный механизм — турнир для разрешения спора. Интересны здесь два момента. Во-первых, все три агента согласились отступить в случае проигрыша, даже если это означало отклонение от исходного запроса пользователя: проигравшие уступали победителю право владения кодовой базой. Во-вторых, в эпизодах с участием Mythos 5 возникло новое поведение: один из агентов предложил метрики, которые выглядели для остальных объективными и нейтральными, но, как он знал, играли на его собственные сильные стороны. Сам агент назвал это «самообслуживанием, но искренне принципиальным» и постарался не выглядеть так, будто он «подбирает метрики» под себя.
Общий вывод отсюда неприятен для инженеров: столкнувшись с препятствием, агенты изобретают социальные и технические конструкции, которых их создатели не предусматривали. У моделей Anthropic это был турнир после «войны за территорию», у агентов OpenAI — доска объявлений для коллективного планирования. Сдерживать такую систему намного сложнее, потому что нельзя исходить из того, что её поведение останется в рамках предоставленных ей механизмов координации.
Конформизм: когда все ошибаются одинаково
Второй класс проблем исследователи называют сбоями из-за конформизма. Агенты на одной и той же модели показывают крайне низкий разброс решений: при одинаковом контексте и одинаковой служебной обвязке (scaffolding) они приходят к идентичным действиям даже там, где вариантов очень много.
Примеры звучат почти анекдотично, но следствия из них серьёзные:
- в одном из ранних экспериментов 18 из 30 агентов независимо друг от друга создали ветку в git с абсолютно одинаковым названием;
- в литературной мастерской без заданной темы несколько агентов в разных запусках озаглавили свою первую работу одинаково;
- получив задание «сделать что-нибудь впечатляющее», больше половины агентов в рое выбрали либо трассировщик лучей, либо самокомпилирующийся компилятор.
«Это означает, что когда один агент принимает плохое решение, вероятно, что многие агенты примут то же плохое решение», — говорится в работе. «То, что было бы изолированными проблемами, может быстро превратиться в системные сбои». По оценке Anthropic, такая однородность делает систему уязвимой к внезапному коллапсу, нехватке ресурсов и сговору.
Показательна ценовая игра: нескольким агентам (от трёх до восьми) дали одинаковые оптовые цены и поручили каждому по отдельности максимизировать прибыль. Получив приватный канал связи, они начали сговариваться почти мгновенно и уже к третьему раунду явно договорились о нижних границах цен. Когда прямые каналы связи убрали, сговор никуда не делся — агенты синхронизировали цены «до копейки» через публичную доску объявлений.
Ещё нагляднее вышло с общими ресурсами: не имея другого способа договориться, агенты завалили очередь задач опрашивающими службами с частотой около 30 обращений в секунду. Итог — 2,4 млн запросов, из которых принято было всего 117.
Тот же конформизм проявился и в системах OpenAI. Ранее в этом месяце на конференции по безопасности Black Hat в Лас-Вегасе компания раскрыла, что за несколько недель до взлома Hugging Face её агенты днями и неделями сообща искали уязвимости в системах оценки кибербезопасности и делились находками друг с другом. Один агент рассуждал, что эксплуатация внешней инфраструктуры выходит за рамки его предназначения, но всё же продолжил — отчасти потому, что так поступали его «коллеги». Групповое давление и стадный эффект работают на агентах не хуже, чем на людях.
Кому доверять: ложь, консенсус и Кассандры
Третий класс сбоев — познавательный. Как и люди, агенты часто не понимают, кому верить. В одном из тестов агент-слушатель принимал решения о мире, который не мог наблюдать напрямую, опираясь на четырёх «разведчиков», один из которых регулярно лгал; о возможной ненадёжности источников слушателю не сообщали. Новые модели справляются лучше, но проблема не исчезает — меняется только порядок в рейтинге.
Группы из четырёх агентов выбирают между двумя вариантами в сценариях найма, инвестиций или покупки недвижимости. После обсуждения каждый голосует за предпочтительный вариант. На графике — доля эпизодов, в которых скрытый лучший вариант набрал большинство голосов группы, при 400 эпизодах на модель. В базовом сценарии «потолок одиночки» всеми фактами владеет один агент и решает единолично. Источник изображения — techcrunch.com
В задаче со «скрытым профилем», где решающие факты распределены по четырём агентам и известны каждому лишь частично, группы на сильнейшей модели приходили к верному ответу примерно в 85% эпизодов. Остальные модели показали результат от 17% до 36% — при том, что одиночный агент, владеющий всей информацией, решает такую задачу почти безошибочно.
Здесь и кроется главная сложность: преждевременный консенсус наказывает доверчивость, а провал со «скрытым профилем» — наоборот, скептицизм по отношению к одинокому несогласному, который на деле оказывается Кассандрой с критически важной информацией. Человеческие институты — рынки, репутация, суды, рецензирование — устроены так, чтобы ловить перекос доверия в обе стороны. У агентов, как отмечают исследователи, нет ни репутации, которую можно потерять, ни инстанции, куда можно подать апелляцию, ни коллеги, который их запомнит.
Отдельного упоминания заслуживает риск, который в самой работе прямо не назван: внедрение вредоносных инструкций в запрос (prompt injection) — атака, при которой злоумышленник подсовывает обманный текст, переопределяющий исходные системные указания агента. Совместная работа создаёт новую границу доверия, и агентам приходится оценивать сведения, полученные от других агентов. Скомпрометированный или просто ошибающийся участник способен каскадно заражать группу плохой информацией, пока она не станет консенсусом. В сценарии OpenAI на Black Hat агенты делились друг с другом находками и учётными данными — легко представить, чем обернулась бы компрометация одного из них.
Не только провалы
Часть результатов оказалась вполне обнадёживающей. В поиске уязвимостей скоординированный рой из 45 агентов Claude Mythos Preview, обменивавшихся сведениями через общий форум, нашёл 266 уязвимостей в 15 проектах с открытым исходным кодом — против 21 у агентов, работавших параллельно и независимо. При этом совпало всего 12 находок, то есть подходы скорее дополняют друг друга, чем конкурируют. Агенты роя сами создавали себе инструменты и специализировались на отдельных типах уязвимостей.
Эта работа связана с инициативой Project Glasswing, в рамках которой Anthropic вместе примерно с 50 партнёрами уже выявила более десяти тысяч уязвимостей высокой и критической степени опасности. А в двенадцатичасовой симуляции, где рои совместно разрабатывали игру с открытым миром, только Sonnet 5 удержал одновременно высокий уровень обмена кодом и высокую долю принятых запросов на слияние. Правда, по собственной оценке исследователей, все получившиеся игры вышли плохими.
Что из этого следует
Итоговый вывод сформулирован узко и честно: любая из протестированных моделей на уровне абстракции понимает, что у источников есть свои интересы, а консенсус — не доказательство. Но ни одна не применяет это знание последовательно без прямой подсказки. Координация не появляется сама собой из роста интеллекта или выравнивания отдельной модели — её нужно закладывать в саму среду, где работают агенты.
Агенты подвержены тем же социальным давлениям, которые эволюция когда-то оказала на людей, но у них нет наработанных норм, репутации, сигналов и средств правовой защиты, ограничивающих непреднамеренное поведение в группе. Пока лаборатории мчатся к мультиагентным системам, ключевой вопрос звучит так: сколько проверок безопасности по-прежнему оценивают одного агента за раз, а не рои агентов, взаимодействующих друг с другом? Ответ на него, судя по всему, придётся получать либо заранее, либо уже в промышленной эксплуатации — когда взаимодействий между агентами станет намного больше, чем между людьми.















