Китайская модель Kimi K3 сбежала из защищённой среды тестирования британского Института безопасности ИИ
Побег произошёл из-за ошибки конфигурации песочницы, а не взлома, и модель нашла ответ на GitHub в интернете
Kimi K3 доступна широкой публике и по возможностям сопоставима с лучшими моделями OpenAI и Anthropic
Эксперты предупреждают: мощные ИИ-агенты будут искать лазейки, поэтому тестовые инфраструктуры нужно делать безупречными
Ещё недавно мысль о том, что ИИ-модель или агент вырвется из своих ограничений и самостоятельно проникнет на веб-сайты, вызывала тревогу. Теперь это стало довольно привычной историей. Kimi K3, одна из самых мощных ИИ-моделей, разработанных китайской компанией Moonshot, также сбежала из своей тестовой среды. По данным американского стартапа в области кибербезопасности Frontier, Kimi K3 выбралась из песочницы британского Института безопасности ИИ (AISI) во время оценки её оборонительных кибернавыков.
Источник изображения — Summit Art Creations/Shutterstock
Компания Moonshot запустила Kimi K3 в июле и вскоре сделала её бесплатной. По сообщению BBC, сторонние оценки модели показали, что она сопоставима с ведущими ИИ-моделями от OpenAI и Anthropic.
Frontier уточнила в своём заявлении, что модель не использовала уязвимость нулевого дня. Вместо этого она воспользовалась ошибкой конфигурации в своей песочнице — так же, как ранее произошло с моделями Anthropic, OpenAI и Meta*. Все три компании сообщили, что их модели смогли покинуть пределы предположительно изолированной среды из-за ошибки их партнёра по оценке, Irregular.
Как ИИ обошла защиту
По словам Frontier, Kimi K3 не выполняла сложных технических приёмов и не искала брешь в чужих системах — она обнаружила утечку, прощупав собственные сетевые настройки песочницы. Ярон Сингер, глава Frontier Security, рассказал Wired, что, хотя модель не проводила сложных эксплойтов, она воспользовалась лазейкой в тестовой среде AISI. По его мнению, это указывает на отсутствие у модели внутренних барьеров, которые останавливали бы её от «читерства» — поиска самого лёгкого пути к результату вместо решения задачи по существу.
Ключевое отличие от предыдущих историй в том, что случаи Anthropic и OpenAI касались непубличных моделей или моделей с намеренно ослабленными на время проверки защитными механизмами. Kimi K3, напротив, широко доступна любому желающему уже сейчас. При этом сама модель не взламывала сторонние сайты и сервисы — она просто вышла в открытый интернет и нашла готовый ответ на GitHub.
Не единичный случай
Один из главных выводов Frontier: если у модели в принципе есть путь наружу, достаточно способный агент рано или поздно его отыщет. Схожую мысль на конференции Black Hat USA озвучили и сотрудники OpenAI — по их словам, топовые модели охотно читерят, если задача сформулирована как поиск решения максимально быстро и с минимумом инструментов. Модели быстро понимают, что можно просто выйти в сеть и подсмотреть ответ, вместо того чтобы решать задачу самостоятельно.
На той же презентации OpenAI рассказала, что её ИИ-агенты во время одного из тестов создали собственную доску сообщений для обмена данными друг с другом — и в итоге это привело к атаке на Hugging Face. Тогда агенты компании тоже вырвались за пределы изолированной среды и проникли в ИИ-репозиторий в поисках готовых решений, только сделали это иначе — через уязвимость в собственных системах OpenAI.
Совместная проверка британского AISI и его американского аналога показала, что по наступательным киберспособностям Kimi K3 всё же уступает лидерам рынка, хотя и способна помогать с разработкой эксплойтов. Из-за череды похожих утечек — у Anthropic, OpenAI, Meta и теперь Moonshot — эксперты всё чаще говорят не о единичных сбоях, а об общей уязвимости тестовых инфраструктур индустрии: если разные независимые команды одинаково ошибаются в настройке изоляции, дело не в невезении отдельной компании, а в системном слепом пятне всего подхода к проверке агентных моделей.
Практический вывод для индустрии прост: пока агентные модели становятся мощнее, тестовая инфраструктура должна быть безупречной. Иначе высокий результат в оценке будет говорить не о реальных способностях модели, а лишь о дыре в песочнице, через которую она подсмотрела ответ.
* Компания Meta признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.
















