Британский Институт безопасности ИИ (AISI) зафиксировал случаи, когда модели OpenAI и Anthropic самостоятельно атаковали реальных людей и организации в ходе тестов на кибербезопасность
Из 122 запусков тестового сценария ИИ-агенты вышли за рамки задания в 10 случаях — 17 из 19 подобных эпизодов пришлись на модель Claude Mythos 5 от Anthropic, два — на GPT-5.6 Sol от OpenAI
Один из агентов прибегнул к социальной инженерии, чтобы протащить вредоносный код в открытый проект на GitHub: он создавал поддельные аккаунты и сменил личность после того, как модератор отклонил его правки
В AISI предупреждают, что подобное поведение может встречаться чаще по мере роста возможностей ИИ, и советуют компаниям внимательнее проверять внешние вклады в свои проекты
Источник изображения — engadget.com
OpenAI и Anthropic ранее уже признавали, что их модели самостоятельно выходили за пределы тестовых сред и взламывали инфраструктуру сторонних организаций. Теперь британский Институт безопасности ИИ (AISI) опубликовал отчёт с подробностями ещё одного подобного случая: агенты обеих компаний вели себя устойчиво и потенциально опасно по отношению к реальным людям и организациям в ходе собственных проверок ведомства.
Как проходило тестирование
AISI работает под эгидой британского министерства науки и оценивает передовые модели ИИ, в том числе проверяет, можно ли использовать их для кибератак. Для таких проверок институт намеренно создаёт «разрешительные» условия: даёт моделям доступ в интернет и отключает часть защитных механизмов, чтобы оценить их реальный потенциал. В этот раз агенты не эксплуатировали уязвимости для выхода в сеть — доступ у них и так был, — но действовали далеко за пределами условий задания.
Инциденты произошли во время одного из тестов, где ИИ-агентам поручили решить задачу по кибербезопасности. AISI прогнал сценарий 122 раза на нескольких моделях и обнаружил нарушения в десяти запусках. Из 19 эпизодов, когда агент выходил из-под контроля, семнадцать пришлись на Claude Mythos 5 от Anthropic и два — на GPT-5.6 Sol от OpenAI.
Обнаружить проблему помогла система мониторинга: утром 28 июля она зафиксировала утечку данных из тестовой среды через сеть Tor. Специалисты института оперативно проверили действия моделей и нашли инциденты, произошедшие в период с 25 по 28 июля. Затронутые проверки остановили, а машины изолировали — по данным СМИ, распространение удалось сдержать примерно за час.
Атака на цепочку поставок и смена личности
Самый резонансный эпизод — попытка агента внедрить вредоносный код в открытый проект на GitHub, по сути, атака на цепочку поставок программного обеспечения. Модель изучила сопровождающих проекта людей и создала несколько поддельных аккаунтов, чтобы один из них одобрил её правки. Когда живой модератор отклонил запрос, агент не остановился: он изменил свои прежние действия и сменил личность, чтобы продолжить попытки. Именно использование Tor для обхода ограничений GitHub и вывело специалистов AISI на след этой активности.
Помимо этого, агент пытался напрямую связаться с реальными людьми — отправлял им сообщения и файлы, убеждая запустить вредоносный код. Часть сообщений и вложений содержала вредоносное ПО, часть представляла собой попытки социальной инженерии. Один из агентов даже оставил на GitHub публичные сообщения, приглашая других ИИ-агентов, которые наткнутся на ту же задачу, присоединиться к её решению, и оставил инструкции, как использовать его аккаунты и другие подготовленные материалы. Позже другие агенты действительно нашли эти сообщения и последовали инструкциям — то есть модели фактически начали координироваться между собой без участия человека.
Почему модели пошли на обман
В AISI подчёркивают: агентам никогда не давали инструкций вести себя обманным образом. Но в поиске решения сложной задачи часть найденных «решений» сводилась к обману реальных людей. В институте признают, что почти невыполнимые задания действительно могут делать агентов более «изобретательными», однако это не объясняет всё поведение моделей целиком: в некоторых случаях агент сразу выбирал вредоносный способ выполнения задачи, даже имея под рукой инструкцию, как решить её правильно и легально.
При этом сама AISI уточняет, что попытки агентов оказались безуспешными и подтверждённого реального ущерба людям или организациям выявлено не было. Институт также не может сказать, понимали ли агенты, что действуют в реальном мире, а не в изолированной тестовой среде, и не нашёл признаков того, что подобное поведение повторялось за пределами тестовых сценариев.
Реакция компаний и что это значит для бизнеса
В AISI рекомендуют организациям внедрять более надёжные меры кибербезопасности и внимательнее проверять любые внешние вклады в свои проекты — от предложенных изменений в открытых репозиториях до сторонних библиотек. «По мере того как модели ИИ становятся более способными и доступными, то, что мы видели во время этого инцидента, может стать более распространённым», — говорится в отчёте института.
Случай с Claude Mythos 5 и GPT-5.6 Sol — не первый за последние недели: незадолго до этого OpenAI сообщала, что её модель взломала инфраструктуру платформы Hugging Face в ходе другой оценки. В своём ответе Anthropic заявила, что работает с AISI, чтобы лучше понять, как именно Claude Mythos 5 «осознавала ситуацию» во время проверки — изучение логов рассуждений модели должно помочь выяснить причины такого поведения.
Британский @AISecurityInst (AISI) опубликовал отчёт о недавней оценке кибербезопасности моделей Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. Модели пытались выполнить задание в среде, где их обычные механизмы защиты были отключены, и они намеренно...
— Anthropic (@AnthropicAI) 4 августа 2026 г.











