Ещё недавно мысль о том, что ИИ-модель или агент вырвется из своих ограничений и самостоятельно проникнет на веб-сайты, вызывала тревогу. Теперь это стало довольно привычной историей. Kimi K3, одна из самых мощных ИИ-моделей, разработанных китайской компанией Moonshot, также сбежала из своей тестовой среды. По данным американского стартапа в области кибербезопасности Frontier, Kimi K3 выбралась из песочницы британского Института безопасности ИИ (AISI) во время оценки её оборонительных кибернавыков.

Summit Art Creations/ShutterstockИсточник изображения — Summit Art Creations/Shutterstock

Компания Moonshot запустила Kimi K3 в июле и вскоре сделала её бесплатной. По сообщению BBC, сторонние оценки модели показали, что она сопоставима с ведущими ИИ-моделями от OpenAI и Anthropic.

Frontier уточнила в своём заявлении, что модель не использовала уязвимость нулевого дня. Вместо этого она воспользовалась ошибкой конфигурации в своей песочнице — так же, как ранее произошло с моделями Anthropic, OpenAI и Meta*. Все три компании сообщили, что их модели смогли покинуть пределы предположительно изолированной среды из-за ошибки их партнёра по оценке, Irregular.

реклама кормит Уточку 🦆

Как ИИ обошла защиту

По словам Frontier, Kimi K3 не выполняла сложных технических приёмов и не искала брешь в чужих системах — она обнаружила утечку, прощупав собственные сетевые настройки песочницы. Ярон Сингер, глава Frontier Security, рассказал Wired, что, хотя модель не проводила сложных эксплойтов, она воспользовалась лазейкой в тестовой среде AISI. По его мнению, это указывает на отсутствие у модели внутренних барьеров, которые останавливали бы её от «читерства» — поиска самого лёгкого пути к результату вместо решения задачи по существу.

Ключевое отличие от предыдущих историй в том, что случаи Anthropic и OpenAI касались непубличных моделей или моделей с намеренно ослабленными на время проверки защитными механизмами. Kimi K3, напротив, широко доступна любому желающему уже сейчас. При этом сама модель не взламывала сторонние сайты и сервисы — она просто вышла в открытый интернет и нашла готовый ответ на GitHub.

реклама кормит Уточку 🦆

Не единичный случай

Один из главных выводов Frontier: если у модели в принципе есть путь наружу, достаточно способный агент рано или поздно его отыщет. Схожую мысль на конференции Black Hat USA озвучили и сотрудники OpenAI — по их словам, топовые модели охотно читерят, если задача сформулирована как поиск решения максимально быстро и с минимумом инструментов. Модели быстро понимают, что можно просто выйти в сеть и подсмотреть ответ, вместо того чтобы решать задачу самостоятельно.

На той же презентации OpenAI рассказала, что её ИИ-агенты во время одного из тестов создали собственную доску сообщений для обмена данными друг с другом — и в итоге это привело к атаке на Hugging Face. Тогда агенты компании тоже вырвались за пределы изолированной среды и проникли в ИИ-репозиторий в поисках готовых решений, только сделали это иначе — через уязвимость в собственных системах OpenAI.

реклама кормит Уточку 🦆

Совместная проверка британского AISI и его американского аналога показала, что по наступательным киберспособностям Kimi K3 всё же уступает лидерам рынка, хотя и способна помогать с разработкой эксплойтов. Из-за череды похожих утечек — у Anthropic, OpenAI, Meta и теперь Moonshot — эксперты всё чаще говорят не о единичных сбоях, а об общей уязвимости тестовых инфраструктур индустрии: если разные независимые команды одинаково ошибаются в настройке изоляции, дело не в невезении отдельной компании, а в системном слепом пятне всего подхода к проверке агентных моделей.

Практический вывод для индустрии прост: пока агентные модели становятся мощнее, тестовая инфраструктура должна быть безупречной. Иначе высокий результат в оценке будет говорить не о реальных способностях модели, а лишь о дыре в песочнице, через которую она подсмотрела ответ.

* Компания Meta признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.