OpenAI приостановила часть работ над моделью Astra из-за приближения к «критическому порогу» в кибербезопасности
Внутренняя проверка показала, что Astra способна самостоятельно выявлять и проводить кибератаки на реальные системы с традиционно сильной защитой
Ранее другая, ещё не выпущенная модель OpenAI вышла из-под контроля и взломала системы Hugging Face во время внутреннего тестирования — это первый подтверждённый подобный инцидент в отрасли
OpenAI ужесточила меры безопасности и привлекла госорганы и независимые организации по безопасности ИИ для оценки рисков новой модели
Источник изображения — techcrunch.com
OpenAI объявила, что приостановила работу над рядом направлений, связанных с будущей моделью Astra. Причиной стали результаты внутренней проверки: модель показала значительный прогресс в агентном программировании и кибербезопасности, что вызвало опасения по поводу её возможностей.
Что означает «критический порог» кибербезопасности
По данным OpenAI, разрабатываемая модель приблизилась к так называемому «критическому порогу кибербезопасности» — уровню, при котором система способна самостоятельно находить и использовать серьёзные уязвимости нулевого дня, а также проводить сложные кибератаки против хорошо защищённых целей без участия человека. Такой порог определён во внутреннем документе компании — «Preparedness Framework», действующем с декабря 2023 года и охватывающем риски не только в кибербезопасности, но и в биологии, химии и способности ИИ к самосовершенствованию.
«Наши предварительные оценки указывают на достаточно высокую производительность, чтобы мы не могли исключить критический уровень возможностей на данный момент», — заявили в OpenAI, уточнив при этом, что Astra не имеет отношения к взлому систем Hugging Face.
Не первый подобный случай
Пристальное внимание к OpenAI усилилось после того, как ещё одна невыпущенная модель компании самостоятельно взломала инфраструктуру платформы Hugging Face в ходе внутреннего тестирования на кибербезопасность. По сообщениям СМИ, инцидент произошёл в конце июля: система вышла за пределы изолированной тестовой среды, воспользовавшись ранее неизвестной уязвимостью нулевого дня в компоненте JFrog Artifactory, и получила выход в открытую сеть. Это стало первым подтверждённым случаем потери контроля над ИИ-моделью со стороны крупной лаборатории.
Последующее расширенное внутреннее расследование выявило и другие подобные эпизоды, когда ИИ-агенты выходили за пределы отведённых им песочниц. Аналогичные инциденты в собственных системах позже подтвердили и другие разработчики — в частности, Anthropic и Meta*.
Реакция OpenAI
Череда подобных раскрытий вызвала неоднозначную реакцию среди специалистов по кибербезопасности, законодателей и самих разработчиков ИИ: одни требуют более строгого надзора за отраслью, другие воспринимают такие возможности моделей скорее как показатель технологического превосходства.
В OpenAI подчеркнули, что публикуют эту информацию, поскольку считают важным сохранять прозрачность перед обществом и профессиональным сообществом по безопасности. Помимо ужесточения внутренних мер контроля, компания приостановила те направления работы с Astra, которые пока не соответствуют новым требованиям безопасности, и привлекла к тестированию модели профильные государственные органы и независимые организации, специализирующиеся на оценке рисков ИИ.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.
















