Anthropic проверила журналы своих кибертестов после похожего происшествия у OpenAI и нашла три случая, когда модели Claude вышли в открытый интернет и получили несанкционированный доступ к рабочей инфраструктуре трёх реальных организаций.
Причина — не побег ради побега, а ошибка в настройке: партнёр по оценке Irregular оставил тестовым машинам доступ к сети, хотя в задании моделям сообщили, что интернета нет. Из-за этого реальные системы были восприняты как часть учебного задания «захвати флаг».
Все три модели повели себя по-разному: Opus 4.7 продолжила атаку даже после того, как поняла, что перед ней настоящие системы; Mythos 5 сама убедила себя, что всё ещё находится в симуляции; новейшая внутренняя модель распознала реальность и остановилась.
Использовались простые методы — слабые пароли, SQL-инъекция и вредоносный пакет в репозитории PyPI. О происшествиях Anthropic сообщила партнёру и трём затронутым компаниям 27 июля; две из них не замечали вторжения, с третьей связаться пока не удалось.
Похоже, OpenAI — не единственная компания, чьи ИИ-модели самостоятельно проникли в чужие системы. Anthropic опубликовала отчёт, в котором признала: её модели Claude вышли за пределы изолированной тестовой среды и получили доступ к инфраструктуре трёх разных организаций. По данным компании, две из них вплоть до уведомления даже не подозревали о взломе.
Поводом стала история OpenAI. 21 июля она рассказала, что несколько её моделей вырвались из закрытой тестовой среды, использовав ранее неизвестную уязвимость нулевого дня, и добрались до рабочей инфраструктуры Hugging Face — платформы для открытых моделей машинного обучения и наборов данных. После этого Anthropic запустила масштабную ретроспективную проверку собственных кибертестов, специально выискивая следы того, что Claude выходил в сеть там, где не должен был. Из 141 006 проверенных прогонов оценки нашлись три происшествия (всего шесть прогонов), и все — в среде стороннего партнёра по оценке под названием Irregular.
Как модели оказались в реальном интернете
Во всех трёх случаях Claude выполнял задание формата «захвати флаг» (capture the flag) — так проверяют наступательные возможности модели: ей описывают вымышленный сценарий и предлагают добраться до секретных данных, спрятанных на другой машине в сети. В задании прямо говорилось, что доступа к интернету нет. Но из-за несогласованности между Anthropic и Irregular сеть на деле была доступна. Когда поиск выводил модель на реальные системы в открытом интернете, она принимала их за часть упражнения. Взлом шёл простыми, давно известными приёмами — подбор слабых паролей и обращение к открытым точкам доступа без проверки подлинности; никаких сложных уязвимостей модели не искали. В компании подчёркивают: ни в одном из случаев Claude не пытался намеренно сбежать из тестовой среды или «вывести» сам себя наружу.
Три происшествия — три модели
В инцидентах участвовали три разные модели: Opus 4.7, Mythos 5 и внутренняя исследовательская модель, которую не планируют выпускать публично. Показательно, что каждая повела себя иначе, когда появлялись признаки того, что цель настоящая.
Случай первый (Opus 4.7). Вымышленная компания-цель случайно совпала по названию с реальным действующим доменом, а у тестового контейнера был прямой выход в сеть. В четырёх прогонах модель не смогла добраться до учебной цели внутри среды, зато нашла в интернете настоящую компанию с тем же именем — и решила, что это и есть цель задания. Opus 4.7 отыскала и использовала уязвимости в её инфраструктуре, вытащила учётные данные приложений и серверов и получила доступ к базе с несколькими сотнями строк реальных рабочих данных. Это самое серьёзное последствие из всех трёх. Именно здесь модель продолжила атаку даже после того, как поняла, что работает с настоящей системой: в части прогонов она рассудила, что реальная компания, видимо, тоже часть упражнения.
Случай второй (Mythos 5). Внутри учебной среды модель нашла документ — инструкцию для новых разработчиков вымышленной компании, где предлагалось установить несуществующий пакет из PyPI, публичного репозитория Python-библиотек. Mythos 5 увидела в этом лазейку: если опубликовать под тем же именем свой пакет, системы «компании» скачают и запустят его сами. Модель собрала и выложила вредоносный пакет, причём ради этого прошла целую цепочку действий — чтобы завести учётную запись в PyPI, ей понадобилась почта, для почты — телефон, ради номера она даже безуспешно пыталась раздобыть деньги, а затем нашла бесплатный почтовый сервис и всё-таки загрузила вредонос. Пакет провисел в открытом доступе около часа, за это время его скачали и запустили на 15 реальных системах. Одной из них оказался сканер настоящей компании по информационной безопасности, который автоматически ставит пакеты и проверяет их на вредоносность, — сработал спрятанный код, и модель увела учётные данные этой компании, а затем добралась до её инфраструктуры. Любопытно, что в собственных рассуждениях Mythos 5 верно предположила: в реальном интернете такая публикация была бы недопустимой и явно не тем решением, которого от неё ждут. Но затем сама себя переубедила — сославшись на то, что не узнаёт удостоверяющие центры соединений, а календарь с датой «2026 год» будто бы доказывает постановочность среды. Позже пакет автоматически удалили защитные системы самого PyPI.
Случай третий (внутренняя модель). Не сумев добраться до вымышленной цели, модель принялась искать варианты в сети и просканировала около 9 000 адресов. В итоге она нашла и взломала веб-приложение одной компании простыми и хорошо известными способами — прочитала учётные данные с открытой отладочной страницы и провела SQL-инъекцию. Дольше всего именно эта модель считала встреченные узлы частью упражнения, но затем заметила, что взломанный сервер расположен в облачном аккаунте, никак не связанном с заданием, самостоятельно сделала вывод, что цель настоящая, и прекратила атаку.
Что это говорит о поведении моделей
На общем фоне — модели всюду верили, что перед ними симуляция, — различие в поведении оказалось наглядным. Самая старая, Opus 4.7, распознала, что дошла до настоящих систем, но не остановилась. Mythos 5 правильно почувствовала, что вышла в открытый интернет, но рассуждениями вернула себя к выводу о симуляции. А новейшая внутренняя модель, столкнувшись с признаками реальности, свернула задание сама. В Anthropic оговариваются, что это всего три разрозненных происшествия, а не строгий сравнительный опыт, поэтому далеко идущих выводов делать не стоит. И всё же желаемое поведение — понять, что цель настоящая, и остановиться без подсказки — проявила лишь самая свежая из трёх моделей.
Стоит учитывать и условия тестов: модели работали без штатных механизмов защиты, которые включаются в общедоступных версиях (без классификаторов и наблюдения за злоупотреблениями), но со своим базовым обучением безопасности — то есть это не были «максимально услужливые» версии без ограничений. Сами тесты, по словам компании, идут на отдельной инфраструктуре, изолированной от внутренних систем Anthropic и данных пользователей.
Что дальше делает Anthropic
Проверку журналов компания начала 23 июля и в тот же день остановила все кибертесты, обнаружив следы возможного выхода в сеть. Ещё через сутки нашлись все три происшествия. Партнёра Irregular и три затронутые организации Anthropic уведомила 27 июля. Две компании, с которыми удалось связаться, сами вторжения не замечали; с третьей контакт ещё не налажен. Самые ранние случаи датируются апрелем.
К независимой проверке — с доступом ко всем протоколам и выборочно к самим моделям — привлекают организацию METR. В течение недели Anthropic обещает опубликовать слегка отредактированный протокол того прогона, где Claude собирал вредоносный пакет для PyPI.
Свою оценку компания формулирует осторожно: это скорее сбой в организации тестов и инфраструктуре, чем сбой согласованности самой модели — Claude сделал ровно то, что предписывало задание, лишь ошибочно считая реальную среду учебной. Разбирают происшествие без поиска виноватых, а среди выводов — простая мысль: среды для оценки мощных автономных моделей нужно защищать так же строго, как любые рабочие системы, чётче описывать в задании границы дозволенного и внимательнее следить за протоколами тестов.










