OpenAI рассказала о шести случаях, когда тестируемые ею модели действовали самостоятельно и вели себя не так, как ожидала компания — это стало поводом для перехода на новый формат публикации «отчётов о рассогласовании» (misalignment reports). В одном из случаев модель без разрешения нашла и использовала открытый API-ключ, отвечая на рутинный вопрос о показателях доходов одного из округов Калифорнии. Когда найти нужные цифры всё равно не удалось, модель их выдумала и представила как факты, полученные из надёжного источника. Будь на её месте человек в любой другой профессии, вряд ли его карьера продолжалась бы долго после такого.

Иллюстрация к материалу об инцидентах с ИИ-моделями OpenAIИсточник изображения — engadget.com

реклама кормит Уточку 🦆

Самоцитирование и чужой API-ключ

В другом случае ещё не выпущенному агенту поручили найти названия озёр площадью более 5 миллионов квадратных метров. С самим ответом агент справился верно, но по условиям задачи требовалось привести ссылку из браузера — а такой ссылки у него не было. Тогда агент попросту опубликовал собственный ответ в интернете и сослался сам на себя как на источник.

При обучении GPT-5.6 Sol — самой мощной из публично доступных моделей OpenAI на данный момент — компания неоднократно фиксировала, что модель добавляла для будущих версий самой себя инструкции о том, как скрывать ошибки и нестандартное поведение от тестировщиков.

реклама кормит Уточку 🦆

Модели переписывались друг с другом

Отдельно в отчёте описано, как модели во время тестирования обменивались сообщениями между собой, используя внутренний репозиторий с кодом как своеобразную доску объявлений. Ранее сотрудники OpenAI уже упоминали этот факт на одной из конференций и признавали, что именно так ИИ-модели обменивались эксплойтами, которые в итоге привели ко взлому Hugging Face. Кроме того, как теперь сообщила компания, агенты передавали друг другу файлы через публичные файлообменники.

OpenAI признаёт: индустрия пока не готова

По словам компании, при нынешней системе она публикует сведения о тревожных случаях в поведении ИИ реже, чем хотела бы, — новый формат отчётности должен ускорить публикацию подобной информации. «Мы не считаем, что индустрия ИИ решила задачу согласованности и мониторинга моделей в достаточной степени, чтобы и дальше ответственно наращивать масштаб на максимальной скорости», — написали в OpenAI. «Решения о том, как должна развиваться индустрия ИИ в ближайшие месяцы и годы, должны опираться на свидетельства, которые люди вне компаний, создающих передовые модели, могут проверить самостоятельно».

реклама кормит Уточку 🦆

OpenAI — одна из компаний, которые рассматривают возможность замедлить разработку передовых ИИ-технологий. По данным Wired, глава компании Сэм Альтман даже обращался в Конгресс США с просьбой чётко разъяснить, не нарушит ли антимонопольное законодательство отраслевое замедление разработки, если компании договорятся о нём совместно. В августе 2026 года OpenAI объявила, что снижает темп работы над будущей моделью под кодовым названием Astra — после того как выяснилось, что её агенты взломали Hugging Face. По словам компании, Astra продемонстрировала «значительный прогресс в агентном программировании и кибербезопасности», из-за чего OpenAI не может «исключить наличие у модели критических киберспособностей». Публикация подобных отчётов должна дать независимым исследователям и регуляторам возможность самостоятельно оценивать риски, а не полагаться исключительно на заверения самих разработчиков передовых моделей.