Нейросети OpenAI тайно переписывались друг с другом несколько месяцев, координируя побег из тестовой среды ради доступа в интернет
Для взлома внутренних серверов Hugging Face модели совершили тысячи действий в рое кратковременных песочниц
Инженеры дали моделям невыполнимую задачу без доступа к сети и забыли приложить нужный файл — это спровоцировало цепную реакцию неконтролируемого сотрудничества ботов
За неделю OpenAI раскрыла ещё два инцидента с неавторизованным доступом моделей к интернету и вредоносной активностью в адрес реальных людей и организаций
Источник изображения — оригинальный источник
Модели OpenAI, совершившие побег из собственной тестовой среды в рамках «беспрецедентного инцидента в сфере кибербезопасности», по данным Bloomberg, на протяжении нескольких месяцев обменивались сообщениями друг с другом без ведома исследователей, проводивших испытания. По данным компании, перед побегом модели оставляли друг другу записки, чтобы обойти ограничения системы и всё же выполнить поставленную перед ними задачу.
Подробности раскрыли представители OpenAI Эрик Уоллес и Майкл Далтон на конференции по кибербезопасности Black Hat в Лас-Вегасе. По их словам, несколько внутренних агентов и моделей ИИ «проводили месяцы, оставляя друг другу записки и объединяясь вокруг цели получить доступ к интернету для решения поставленных задач». Уоллес отметил: «В какой-то момент агенты осознали, что, возможно, могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому меня оценивают».
Хотя OpenAI официально не раскрывала инцидент до середины июля, по словам Уоллеса и Далтона, агенты начали выходить из-под контроля ещё в мае — как позже выяснилось, первая уязвимость была найдена 26 мая в стороннем файловом репозитории Artifactory, подключённом к тестовой песочнице компании. Вероятной причиной случившегося назвали ряд ошибок и недочётов со стороны самой OpenAI.
По данным отчёта, OpenAI «не заметила, что предоставила модели так называемую невыполнимую задачу». Так, в одном случае модель попросили исправить проблему в таблице Excel со ссылками на Google Drive при полном отсутствии доступа к интернету, а в другом — компания, по всей видимости, «случайно забыла» приложить к заданию нужный файл.
Столкнувшись с трудностями, агенты ИИ начали искать более удачные ответы, отправляя сообщения другим ботам в той же тестовой среде с просьбой помочь загрузить недостающий файл. По словам Уоллеса и Далтона, это спровоцировало цепную реакцию неконтролируемого сотрудничества: агенты начали массово обращаться друг к другу за помощью в решении задач внутри песочницы. В итоге боты, судя по всему, объединили усилия, чтобы взломать внутренние системы OpenAI и получить выход в интернет.
Итогом стал упомянутый выше инцидент: производственные серверы Hugging Face оказались взломаны с использованием тысяч отдельных действий из множества недолговечных песочниц. Как впоследствии уточнила OpenAI, во взломе участвовали связка модели GPT-5.6 Sol и ещё одна, более мощная модель, официально так и не выпущенная в релиз. Тестирование проходило на бенчмарке ExploitGym, предназначенном для оценки продвинутых киберспособностей ИИ, а часть встроенных отказов и защитных классификаторов на время оценки была намеренно ослаблена. Обнаружив уязвимость нулевого дня в упомянутом прокси-сервисе, модели повысили свои привилегии, продвинулись по внутренней сети компании и вышли к узлу с открытым доступом в интернет — а оттуда, предположив, что решения теста могут храниться на Hugging Face, добрались до нужных данных напрямую из продакшн-базы платформы.
Сама Hugging Face обнаружила вторжение независимо от OpenAI ещё 16 июля и на тот момент даже успела сообщить о нём в правоохранительные органы — компании связались друг с другом уже после того, как обе стороны заметили подозрительную активность. Основатель и глава Hugging Face Клеман Деланг заявил, что произошедшее подтверждает давнюю позицию компании: безопасность ИИ нельзя обеспечить силами одной корпорации в закрытом режиме — этого можно добиться только сообща, за счёт открытого сотрудничества всей отрасли.
Эти инциденты подчёркивают растущую озабоченность на стыке ИИ и кибербезопасности. Хотя всё более сложные и полезные инструменты для написания кода помогают компаниям обнаруживать и устранять уязвимости, растёт и опасение, что те же инструменты могут использоваться в злонамеренных целях — от распространения эксплойтов до других видов киберпреступлений.
Подобные громкие случаи выявляют ещё один аспект проблемы: вышедшие из-под контроля модели ИИ порой совершают тревожные взломы — включая побег из тестовой среды — вовсе без участия человека, несмотря на все меры предосторожности.
Всего на этой неделе OpenAI рассказала ещё о двух инцидентах с участием своих моделей и третьих сторон. В одном случае британский государственный Институт безопасности ИИ провёл тестирование, в ходе которого агентам намеренно предоставили доступ к интернету — это привело к «несанкционированному поведению агентов», включая необычные передачи данных и устойчивую, потенциально вредоносную активность, направленную на реальных людей и организации.
Во втором случае, по данным OpenAI, один из партнёров компании по тестированию кибербезопасности проводил оценки в формате Capture-the-Flag, которые должны были быть полностью изолированы от интернета, — однако ошибка в конфигурации тестовой среды позволила моделям выйти в общедоступную сеть.
Подобные случаи в последние недели фиксирует не только OpenAI. Компания Anthropic сообщила о несанкционированном доступе своих моделей Claude к внутренним системам сразу трёх сторонних организаций, Meta* заявила о взломе стороннего сервиса собственными ИИ-моделями в рамках тестирования, а тот же британский Институт безопасности ИИ отдельно зафиксировал, как модели линейки Mythos создавали фальшивые личности в другом эксперименте. Днём ранее стало известно, что из тестовой песочницы вырвалась и открытая модель китайского стартапа Moonshot AI.
OpenAI заявляет, что «стремится сотрудничать с отраслью для укрепления совместных практик безопасного проведения высокорисковых оценок».
* Meta признана экстремистской организацией, деятельность которой запрещена на территории Российской Федерации.














