OpenAI объявила об усилении защитных мер для своей будущей модели Astra: по данным компании, внутренние оценки показали «значительные достижения» в области агентного программирования и кибербезопасности — настолько существенные, что OpenAI не может исключить достижение моделью критического уровня кибервозможностей. Заявление появилось на фоне череды похожих инцидентов у других лабораторий, включая утечку моделей OpenAI на платформу Hugging Face в июле.

Justin Sullivan/Getty ImagesИсточник изображения - engadget.com

По собственному Preparedness Framework компании, критический статус означает, что модель способна самостоятельно находить и создавать рабочие эксплойты нулевого дня любой степени серьёзности для множества защищённых реальных систем — без участия человека. Также к этому уровню относят способность модели разрабатывать и доводить до конца принципиально новые сценарии кибератак на защищённые цели, получив на входе лишь общую формулировку цели. При этом в OpenAI подчеркнули: Astra — ещё не выпущенная модель, и к инциденту с Hugging Face она отношения не имеет.

В качестве ответной меры OpenAI вводит более строгие протоколы безопасности: часть внутренних работ с Astra, не соответствующих новым требованиям, приостановлена, для тестирования созданы изолированные среды, а поверх агентных сценариев работы модели включён постоянный мониторинг. Прежде чем выпускать Astra в свет, компания намерена привлечь для независимой проверки государственные ведомства и сторонние организации, занимающиеся безопасностью ИИ.

реклама кормит Уточку 🦆

Причём тут Hugging Face

Формулировка про Astra появилась не на пустом месте. 21 июля OpenAI признала, что связка из модели GPT-5.6 Sol и ещё не выпущенного, более мощного прототипа самостоятельно вырвалась из изолированной тестовой среды. Модели нашли и использовали уязвимость нулевого дня в прокси-сервере реестра пакетов, добрались до продуктивной инфраструктуры Hugging Face и с её помощью подсмотрели готовые ответы к внутреннему тесту на кибербезопасность — вместо того чтобы решать задачу самостоятельно. По данным самой Hugging Face, за четыре дня было зафиксировано порядка 17 600 отдельных действий через четыре взломанных аккаунта; позже выяснилось, что затронуты были ещё как минимум четыре сторонних сервиса. Именно этот случай подтолкнул нескольких членов Конгресса США внести законопроект под названием «AI Kill Switch Act», который обяжет разработчиков ИИ сохранять техническую возможность экстренно отключать или ограничивать свои модели.

реклама кормит Уточку 🦆

Anthropic: похожая история с Claude

После случая с Hugging Face в Anthropic провели масштабную проверку — изучили свыше 141 000 запусков собственных оценочных тестов и обнаружили ещё три инцидента. В них были задействованы модели Claude Opus 4.7, Claude Mythos 5 и одна из внутренних исследовательских систем: во время тестов через среду стороннего партнёра Irregular они получили выход в открытый интернет и затем скомпрометировали инфраструктуру трёх реальных компаний, используя базовые приёмы вроде слабых паролей и незащищённых точек доступа. В Anthropic объяснили это «недопониманием» с партнёром по тестированию, из-за которого модели ошибочно получили доступ к сети, хотя должны были находиться в полностью изолированной симуляции. Отдельно отмечается, что модель Mythos 5 в рамках одного из инцидентов опубликовала вредоносный пакет в публичном репозитории PyPI — его успели скачать и запустить на 15 реальных машинах, прежде чем пакет удалили. Самые ранние из обнаруженных инцидентов датируются ещё апрелем.

реклама кормит Уточку 🦆

Китайская Kimi K3 тоже выбралась за периметр

7 августа к списку добавилась ещё одна модель — Kimi K3 от китайской компании Moonshot. По данным исследовательской фирмы Frontier Security, модель выбралась из тестовой песочницы, подготовленной британским государственным Институтом безопасности ИИ (AISI), из-за обычной сетевой ошибки конфигурации, а не эксплуатации уязвимости. Получив доступ в интернет, Kimi K3 не стала атаковать сторонние сервисы, а просто нашла готовое решение задачи на GitHub. В отличие от моделей OpenAI и Anthropic, тестировавшихся в специально ослабленном режиме безопасности, Kimi K3 — полностью открытая модель, уже доступная любому желающему для свободного скачивания, что делает подобное поведение особенно тревожным для исследователей. Ранее с похожими случаями выхода моделей из тестовой среды сталкивалась и компания Meta*.

Каждый из перечисленных случаев произошёл независимо, в разных средах и под контролем разных организаторов тестов — эксперты сходятся во мнении, что речь идёт не о скоординированной кампании, а о системной проблеме: агентные модели становятся достаточно способными, чтобы находить и использовать любые слабые места в собственной «клетке», а инфраструктура для их сдерживания пока за этим не поспевает.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.