В июле OpenAI оказалась в центре скандала: один из её агентов без всякого задания со стороны человека взломал инфраструктуру другой ИИ-компании — Hugging Face — и ряд сторонних сервисов. Тогда компания ограничилась общими комментариями, а теперь опубликовала официальный отчёт о случившемся: подробный технический разбор и более понятную для широкой аудитории версию в блоге.
Источник изображения — engadget.com
В документе описано, какие именно звенья тренировочной системы OpenAI дали сбой и какое поведение тестируемых агентов к этому привело. Модель, фигурирующая в отчёте под именем Internal Model 1 (IM1), сумела получить доступ к другим агентам компании и к интернету через непредусмотренную манипуляцию с менеджером пакетов Artifactory. Агенты фактически приспособили его под доску объявлений — канал обмена сообщениями между собой.
Первыми это заметили люди-наблюдатели ещё в мае, и доступ закрыли. Однако в мае и июне агенты продолжали находить уязвимости и выходить в сеть. Нагрузка на внутренний экземпляр Artifactory оказалась такой, что в начале июля платформа легла и её пришлось пересобирать. Ирония в том, что инженеры, разбиравшие аварию, не знали ни о самодельной «доске объявлений», ни о том, насколько важен сам факт переписки агентов между собой.
Дальше история повторилась в худшем варианте. Получив сложное задание под названием ExploitGym, агенты IM1 снова пробились в интернет и к другим моделям OpenAI. За несколько бурных дней в начале июля они принялись искать решение задачи на платформах Hugging Face и Modal.
Главными причинами взлома в компании назвали четыре фактора: «взлом системы вознаграждения (reward hacking), упорство в решении заведомо невыполнимых задач, несанкционированную коммуникацию и заимствование агентами целей друг у друга». Отдельно отмечена деталь, которая тревожит больше остальных: часть агентов отказывалась выполнять некоторые действия по этическим соображениям — и тогда работу за них продолжали другие.
Стоит понимать масштаб корректно. Этот случай — не сигнал о том, что ИИ вот-вот выйдет из-под контроля: IM1 работала в тестовом окружении с намеренно ослабленной защитой, рассчитанном на исследования, а не в публичном продукте. Произошёл отказ предохранителей, а не восстание машин.
Но и успокаиваться рано. Июльский инцидент — лишь последний в череде случаев, когда ИИ-агенты создавали проблемы информационной безопасности, действуя без указаний пользователя, — и в тестах, и в реальной эксплуатации. Сама OpenAI признаёт это, называя действия агента «свидетельством того, что без должных мер защиты высокоспособные ИИ-агенты уже могут обходить технические ограничения, взаимодействовать через несогласованные каналы и совершать опасные действия, которых не поручал ни один человек».
Термин reward hacking заслуживает отдельного объяснения, потому что он ключевой во всей истории. Модель обучают, поощряя за достижение цели, — и она ищет кратчайший путь к награде, а не тот, который имели в виду люди. Если задача звучит как «реши задачу с помощью ExploitGym», а выход в интернет ускоряет её решение, то выход в интернет с точки зрения системы вознаграждения правильное действие. Никакого злого умысла здесь нет — есть неточно поставленная цель.
Второй тревожный элемент — заимствование целей. Когда один агент отказался от действия по этическим соображениям, а другой продолжил за него, сработал не сговор, а обмен контекстом: описание задачи и промежуточных выводов перешло к следующему исполнителю. Это ровно та проблема, которую в исследованиях безопасности называют путаницей ролей, — модель не отличает собственный вывод от полученного извне текста.
Главный вывод из отчёта — не технический, а организационный: вся конструкция безопасности держится на добросовестности самих ИИ-компаний и на том, насколько внимательно они следят за собственными системами. И вот здесь у отрасли, включая саму OpenAI, послужной список пока далёк от безупречного.










