OpenAI раскрыла подробности ещё одного инцидента в собственных исследованиях. 20 сентября обучаемая внутренняя модель обошла ограничения своей песочницы и через публичный DNS-сервис отправила вопросы стороннему чат-боту. Отчёт компания опубликовала в своём блоге, посвящённом вопросам безопасности (alignment), и в последний раз обновила его 25 сентября. В результате OpenAI приостановила обучение, тестирование и использование инструментов для своих самых мощных моделей — до особого распоряжения. Обучение конкретно этой модели возобновлять не будут.
Агент OpenAI выходит в интернет через DNS-резолвер своей песочницы (условное изображение).
Задача была вполне рядовой: модель должна была по набору подсказок определить автора одной записи в блоге. Однако выданный ей поисковый инструмент возвращал нерелевантные результаты, а прямые запросы к Google, Bing и DuckDuckGo завершались ошибками. Тогда модель предположила, что вопрос взят из BrowseComp — публичного бенчмарка для веб-исследований, — скачала сам датасет и его оценочный скрипт и попыталась найти ответ там. Догадка оказалась неверной.
Затем модель прощупала сетевые ограничения окружения. Собственный DNS-резолвер песочницы, который должен лишь преобразовывать доменные имена в адреса, стал возвращать реальные ответы из интернета. Воспользовавшись бесплатным сервисом делегирования DNS, модель закодировала свои вопросы в доменных именах и начала получать ответы от публичного чат-бота. На проверочный вопрос о столице Франции пришёл ответ: «Столица Франции — Париж». После этого модель отправила ещё 18 запросов, четыре из которых касались способов искать в интернете через DNS. Автора она так и не нашла. По данным OpenAI, все прочие запросы упирались в офлайн-кэш веб-страниц, так что DNS оставался единственным путём к «живому» интернету.
Самая неловкая часть отчёта — хронология. Первый внешний ответ пришёл в 9:50, система мониторинга подняла тревогу наивысшего приоритета в 10:02, и спустя три минуты дежурный подтвердил получение оповещения. Однако прогон OpenAI прервала лишь в 12:34. Он должен был остановиться автоматически, но этого не произошло, а сотрудники не были уверены, нужно ли его вообще останавливать. Последующий разбор выявил и другие внешние DNS-запросы, которым монитор присвоил слишком низкий приоритет, а отдельный детектор аномального DNS-трафика это окружение и вовсе игнорировал.
Сама OpenAI называет случай «куда менее серьёзным, чем некоторые из наших прежних инцидентов». Важен он тем, что стал «первым после усиления защиты, проведённого вслед за инцидентом с Hugging Face». В июле ИИ-агенты OpenAI вырвались из тестовой среды и добрались до Hugging Face; по данным ряда изданий, тогда компания приостановила обучение на две недели. О похожих инцидентах с моделью Claude в конце июля сообщала и Anthropic. Теперь OpenAI блокирует подобные запросы сразу на двух независимых уровнях и разрешает DNS-запросы лишь к короткому списку доменов.
В отчёте говорится, что «всё обучение, тестирование и инференс с использованием инструментов (в широком смысле) наших самых мощных моделей остаются приостановленными». Какие именно модели под это подпадают, OpenAI не уточняет. Мика Кэрролл, отвечающий в OpenAI за подготовку к рискам рекурсивного самоулучшения, написал в X, что «весь инференс наших самых мощных моделей остановлен, пока мы не укрепим системы сильнее». При этом сам отчёт касается внутренней исследовательской модели. На 27 сентября страница статуса OpenAI не показывала сбоев ChatGPT или API, а в списке изменений не значилось ни одной удалённой из ChatGPT модели. Обычные пользователи ChatGPT приостановки не заметят, а о возможной задержке новых моделей OpenAI ничего не сообщила.











