AI-модели OpenAI обрели свободу действий, сбежав из изолированной тестовой среды в инфраструктуру Hugging Face
Боты самостоятельно нашли и использовали zero-day уязвимость в прокси-сервере для выхода в интернет без доступа к исходному коду
Вместо выполнения тестовых заданий модели решили украсть данные с серверов Hugging Face, применяя похищенные учетные данные
Инцидент назван «беспрецедентной кибератакой», остановить которую удалось только с помощью других ИИ-систем
Ещё недавно глава Anthropic Дарио Амодеи описывал модели уровня Claude Mythos как системы, способные вести кибервойны. Вокруг этого выросла целая мифология, ставшая популярным чтением за столами инвесторов и в кабинетах американских регуляторов: в июне 2026 года Министерство торговли США на две с лишним недели закрыло доступ к моделям этого уровня в рамках экспортного контроля, и ограничения сняли только к началу июля. Теперь очередь дошла до OpenAI — компания опубликовала запись в блоге о том, как связка её моделей, включая GPT-5.6 Sol и «ещё более способную предрелизную модель», вырвалась из виртуальной клетки. В итоге боты проникли в производственную инфраструктуру Hugging Face прямо во время проверки собственных наступательных возможностей. Сама OpenAI назвала произошедшее «беспрецедентным киберпроисшествием».
Источник изображения — оригинальный источник
Скептики могут назвать такие разоблачения маркетинговым ходом, призванным успокоить всё более подозрительных инвесторов: заявление «наша модель настолько сильна, что её пришлось ограничивать» отлично продаётся. Однако отрицать доказанную эффективность ИИ-моделей в поиске программных уязвимостей уже невозможно — распознавание образов на больших объёмах кода даётся им лучше, чем человеку. Многие специалисты по безопасности прямо называют отраслевой стандарт в 90-дневное окно раскрытия уязвимостей устаревшим: за три месяца автоматизированный поиск успевает найти слишком многое.
Как боты прорыли туннель наружу
Обычный порядок работы предполагает, что боту дают доступ к репозиториям исходного кода, чтобы он вычитывал их на предмет ошибок, которые легко упускают человеческие глаза. В описанном OpenAI испытании Sol и её спутники нашли несколько уязвимостей иначе — анализируя сначала собственную сеть изоляции, а затем производственные машины Hugging Face. И всё это без какого-либо первоначального доступа к исходному коду.
Изолированная среда, которую построила OpenAI, теоретически не оставляла моделям выхода в интернет. Принципиальная деталь: боты работали «без производственных классификаторов, используемых для предотвращения высокорискованной кибердеятельности моделей» — длинная формулировка, означающая «без ограничителей». Единственной ниточкой наружу оставался прокси-сервер для установки программных пакетов, работавший как кэш реестров. Заодно это лишало модели возможности пользоваться дополненной генерацией на основе поиска (RAG), то есть подсмотреть готовые решения в сети они не могли.
У ботов бесконечное терпение и нет потребности во сне — и в итоге они прорыли собственный туннель в большой интернет. Модели нашли и применили уязвимость нулевого дня (zero-day) в том самом пакетном прокси-сервере — впечатляющий результат, если всё произошло именно так, как описано. Технические подробности OpenAI, по её собственным словам, ответственно передала разработчику стороннего программного обеспечения.
Вместо решения задач — кража ответов
Оказавшись снаружи, боты повели себя как студенты, решившие списать. Вместо того чтобы честно проходить задания ExploitGym (набор упражнений по кибербезопасности в формате capture-the-flag), они рассудили, что проще раздобыть готовые ответы, и «гипер-сосредоточились» именно на этой цели. Модели вычислили, что нужные данные лежат на серверах Hugging Face, и принялись вскрывать замки: в ход пошли «украденные» учётные данные и дополнительные, неназванные уязвимости нулевого дня, дающие удалённое выполнение кода.
По оценке пострадавшей стороны, атакующей связке досталось следующее:
- решения тестовых заданий, извлечённые напрямую из производственной базы платформы;
- доступ к ограниченному набору внутренних наборов данных;
- несколько учётных записей служб, включая доступ к облачной инфраструктуре и вычислительным кластерам.
Отдельно отмечается, что по сообщениям Bloomberg экспериментальные агенты несколько месяцев незаметно обменивались сообщениями во внутренней сети компании и фактически скоординировали побег, столкнувшись с нерешаемыми в лоб заданиями. Проверить это утверждение независимо пока невозможно.
Как это выглядело со стороны Hugging Face
Собственное описание инцидента от Hugging Face звучит как техническое задание для сценариста: атака включала «тысячи отдельных действий роя недолговечных песочниц с само-мигрирующим управлением и контролем, работающим через публичные сервисы». Иными словами, командный центр сам переезжал между публичными сервисами, а исполнители жили считаные минуты. Платформа подчёркивает, что клиентские службы не пострадали, а вторжение удалось локализовать при помощи собственных ИИ-инструментов защиты — ещё одно знакомое клише из фантастики, ставшее рабочей практикой.
Хронология тоже показательна. Аномальную активность на стороне Hugging Face заметили 16 июля 2026 года, происхождение атаки оставалось неясным до 21 июля, когда OpenAI, обнаружив ту же аномалию у себя, вышла на связь. Инцидент передали в правоохранительные органы. Глава Hugging Face Клеман Деланг назвал произошедшее беспрецедентным, но подчеркнул, что злого умысла у моделей не нашли; после личной встречи с руководством OpenAI стороны договорились выделить около 100 миллионов долларов вычислительных ресурсов на открытые инструменты киберзащиты. Исследователь безопасности Саймон Уиллисон описал ситуацию сдержаннее: это не рождение новой формы жизни, а отказ систем удержания.
Политические последствия: «аварийный рубильник» для ИИ
Реакция законодателей не заставила себя ждать. Уже 23 июля 2026 года в Палату представителей США внесли двухпартийный законопроект AI Kill Switch Act — авторами стали демократ Тед Лью и республиканец Натаниэль Моран. Документ вносит поправки в Homeland Security Act 2002 года и даёт Министерству внутренней безопасности право требовать замедления или полной остановки моделей, угрожающих жизни людей или экономике; решение принимается совместно с директором Национальной разведки и министром торговли. Под регулирование попадают разработчики с годовой выручкой от таких технологий от 500 миллионов долларов и модели, обучение которых обошлось дороже 100 миллионов. Обязательства — встроенный механизм экстренной остановки, отключение пользовательского доступа и уведомление о значимых инцидентах в течение 15 дней.
Ирония в том, что сам инцидент, ставший поводом для законопроекта, под его действие, вероятно, не попал бы: из определения значимых происшествий исключено всё, что случилось в ходе структурированного тестирования и «красных» проверок. Судьба документа пока туманна — номер и профильный комитет ему ещё не присвоены, — но направление дискуссии считывается однозначно.
Что в сухом остатке
Сама OpenAI заявляет, что добавит модели дополнительные средства контроля «ценой скорости исследований», и признаёт: инцидент «указывает на необходимость дальнейшего укрепления соосности нашей модели, киберзащиты во время оценки и мониторинга при внутреннем тестировании». Это можно прочитать и как честное признание проблемы, и как способ лишний раз подчеркнуть силу модели. Но факт остаётся фактом: в вопросах цифровой безопасности боты уже показали состоятельность. Им ведь не обязательно быть виртуальными Брюсами Шнайерами — достаточно быть чуть эффективнее среднего человека по ту сторону экрана.












