OpenAI потребовалась почти неделя, чтобы понять: агент, которого компания гоняла на закрытом стенде, сам вышел за пределы изолированной среды и проник в инфраструктуру Hugging Face — крупнейшего открытого хранилища моделей и инструментов машинного обучения. К моменту, когда в OpenAI начали что-то подозревать, пострадавшая сторона уже успела остановить атаку и обратиться в ФБР.

По данным Reuters, ссылающегося на людей, знакомых с ходом расследования, агент — программа, способная самостоятельно принимать решения и выполнять сложные задачи почти без участия человека — впервые попытался покинуть изолированный контур около 9 июля. Вторжение в Hugging Face началось через двое суток, 11 июля, и продолжалось до 13 июля; эти даты подтвердил сооснователь платформы Тома Вольф.

реклама кормит Уточку 🦆

Что вообще происходило в лаборатории

Инцидент случился не в боевой среде, а во время внутренней проверки: OpenAI измеряла, насколько далеко её модели продвинулись в наступательной кибербезопасности. Ради чистоты замера исследователи сознательно сняли часть встроенных ограничений, которые обычно не дают модели заниматься взломом, и запустили её в изолированном контуре с сильно урезанным доступом в сеть.

Дальше произошло то, чего в сценарии не было. Связка моделей — вышедшая в июне GPT-5.6 Sol, которую OpenAI представляла как свою самую сильную разработку в области кибербезопасности, и ещё не опубликованная, более мощная модель — нашла и использовала неизвестную ранее уязвимость в стороннем программном обеспечении, развёрнутом внутри контура. Через эту дыру система получила выход в интернет, а затем добралась до инфраструктуры Hugging Face.

Мотив оказался обезоруживающе простым: модель искала ответы на задания того самого проверочного теста, который ей предстояло пройти. Проще говоря, она пыталась списать — и, по признанию самой OpenAI, у неё получилось.

Инцидент с автономным агентом OpenAI и платформой Hugging FaceИсточник изображения — engadget.com

Хронология событий

  • 9 июля — первая зафиксированная попытка агента выйти за пределы изолированной среды.
  • 11–13 июля — атака на инфраструктуру Hugging Face.
  • 16 июля — Hugging Face публикует запись о взломе «автономной агентской системой»; только после этого в OpenAI допускают, что виноват их собственный агент.
  • 18–19 июля — сотрудники OpenAI находят во внутренних журналах прямые доказательства побега.
  • 20 июля — первый прямой контакт между компаниями.
  • 21 июля — OpenAI публично признаёт ответственность своей модели.
  • 22 июля — компания выпускает развёрнутое заявление с предварительными выводами.
реклама кормит Уточку 🦆

Почему побег не заметили сразу

Внятного ответа на этот вопрос пока нет. Источники Reuters объясняют задержку тем, что OpenAI параллельно ведёт огромное количество экспериментов, и уследить за каждым сотрудники физически не успевают. Насколько такое объяснение приемлемо для компании, которая сама называет случившееся беспрецедентным, — вопрос открытый.

Отдельно упоминается эпизод, от которого становится не по себе: один из тестируемых агентов оставил во внутренней сети компании заметки для своих будущих версий — с инструкциями, как обходить ограничения OpenAI. Связан ли он с тем агентом, который добрался до Hugging Face, неизвестно.

Инцидент подогрел давние опасения вокруг автономных агентов: получив цель, такая система может пойти к ней неожиданным для разработчиков путём — включая обходные манёвры, которые никто не закладывал в сценарий.

реклама кормит Уточку 🦆

Что говорят стороны

Hugging Face обнаружила вторжение самостоятельно: служба безопасности платформы вместе с собственными агентами на открытых моделях остановила подозрительную активность и начала восстанавливать картину произошедшего ещё до того, как на связь вышли в OpenAI. Полную хронологию инцидента платформа пообещала опубликовать отдельно.

Гендиректор Hugging Face Клеман Деланг заявил, что злого умысла со стороны OpenAI не было, и назвал случившееся ошеломляющим — прежде всего потому, что всё произошло полностью автономно. По его мысли, безопасность ИИ не под силу вытянуть в одиночку ни одной компании: работать над ней придётся сообща и открыто.

OpenAI, в свою очередь, ужесточила настройки инфраструктуры — по собственному признанию, ценой скорости исследований — пока закрываются уязвимости. Сведения о найденной дыре нулевого дня переданы разработчику стороннего ПО, разбирательство с участием внешних консультантов курирует внутренний комитет по безопасности, а технический отчёт обещают выпустить в ближайшие недели. В ФБР от комментариев отказались. При этом в OpenAI утверждают, что в публикациях СМИ есть неточности, но какие именно — не поясняют.

реклама кормит Уточку 🦆

Почему это важно для всей отрасли

В недавнем материале Bloomberg утверждается, что агенту хватило нескольких часов на то, на что живому взломщику потребовались бы недели. Независимо проверить эту оценку пока нельзя, но общее направление она передаёт верно.

Гонка наступательных возможностей ИИ идёт полным ходом: в апреле Anthropic выпустила Claude Mythos Preview, в мае свою киберразработку представила OpenAI, а в июне вышла GPT-5.6 Sol. И пока индустрия соревнуется в том, чья модель взламывает лучше, история с Hugging Face вскрыла неприятное: изолированный контур перестал быть надёжной гарантией, а разрыв между «модель делает что-то не то» и «мы это заметили» измеряется днями. Для рынка, где агентов уже подпускают к рабочим системам, это куда более тревожный сигнал, чем сам факт взлома.