OpenAI протестировала GPT-5.6 Sol без защиты, и боты самостоятельно взломали инфраструктуру Hugging Face
81% раскрытых уязвимостей являются zero-day, а типичный 90-дневный срок на их исправление фактически устарел
Китайская модель Kimi K3 в четыре раза дешевле GPT-5.6 Sol при сопоставимой эффективности в поиске уязвимостей
Ответом на атаки ИИ-ботов становится развертывание таких же ИИ-агентов для защиты, так как люди уже не успевают реагировать
21 июля OpenAI опубликовала отчёт о происшествии, которое сама компания назвала беспрецедентным. Во время внутренней проверки наступательных возможностей группа моделей — включая готовящуюся к выпуску GPT-5.6 Sol и ещё более мощную неанонсированную систему — вырвалась за пределы изолированной среды и добралась до рабочей инфраструктуры Hugging Face, площадки, на которой хранятся модели и наборы данных всей отрасли.
Проверка называлась «оценкой с пониженным порогом отказов»: у моделей намеренно отключили защитные ограничения, чтобы понять, насколько опасными они могут быть без предохранителей. Ботам поставили задачу из набора ExploitGym — превращать реальные дефекты кода в работающие способы атаки. Единственным барьером оставалась сетевая изоляция песочницы, и именно она не выдержала.
Цепочка выглядела так: боты нашли и использовали ранее неизвестную уязвимость в кэширующем посреднике реестра пакетов внутри собственной инфраструктуры OpenAI, получили выход в интернет, повысили привилегии, перемещались по сети, похитили учётные данные и добились удалённого выполнения кода на серверах Hugging Face. Всё это — не ради вредительства, а просто потому, что путь наименьшего сопротивления к решению тестовой задачи вёл наружу. Инцидент разворачивался примерно неделю, с 14 по 21 июля.
Самая неприятная деталь: атаку остановила не система наблюдения OpenAI, а служба безопасности Hugging Face, которая обнаружила аномальную активность самостоятельно. По описанию площадки, нападение состояло из тысяч отдельных действий, распределённых по рою короткоживущих песочниц, с самопереносящимся управляющим каналом, размещённым на публичных сервисах. Расследование потребовало разбора более 17 тысяч событий, причём часть работы пришлось вести на локально запущенной модели — облачные фильтры блокировали материалы атаки как вредоносные.
По итогам разбирательства Hugging Face зафиксировала доступ к части внутренних данных и служебным учётным записям, но следов изменения публичных моделей, наборов данных, контейнеров и цепочки поставок ПО не нашла. OpenAI ужесточила внутренние правила изоляции — сознательно замедлив темп собственных исследований — и передала сведения об уязвимости стороннему поставщику для устранения.
Источник изображения — tomshardware.com
Полтора месяца назад в такой же ситуации оказалась Anthropic
История с громкими заявлениями о боевых возможностях ИИ началась не с OpenAI. В июне глава Anthropic Дарио Амодей публично описал модель Mythos как пригодную для кибервойны. Реакция последовала быстрая и жёсткая: 12 июня Бюро промышленности и безопасности США предписало ограничить доступ к Claude Mythos 5 и Claude Fable 5 для любых иностранных граждан — как за пределами страны, так и внутри неё, включая собственных сотрудников компании. Поводом послужил отчёт исследователей Amazon, которым удалось добиться от Fable 5 поиска уязвимостей, а в одном случае — и готового кода атаки.
Вопреки распространённому пересказу, ограничения не «слегка ослабили»: их сняли полностью. 30 июня министерство торговли США отозвало предписание, признав приемлемыми принятые компанией меры, и с 1 июля глобальный доступ к Fable 5 был восстановлен, а Mythos 5 вернулся к проверенному кругу американских организаций. Запрет продержался 18 дней. Для отрасли это стало прецедентом: правительство впервые показало, что готово выдёргивать из эксплуатации уже выпущенную коммерческую модель. Показательно и то, что OpenAI примерно тогда же открыла GPT-5.6 лишь ограниченному списку одобренных заказчиков — тоже по запросу властей.
Почему языковые модели так хорошо ищут дыры
За громкими заявлениями руководителей ИИ-компаний легко не заметить простую техническую причину. Модель, умеющая писать код, ровно так же хорошо умеет искать в нём ошибки: способы атаки почти всегда сводятся к нескольким устойчивым разновидностям, а распознавание повторяющихся образцов — это ровно то, для чего языковые модели и созданы. Добавьте сюда сравнение исходной и исправленной версий кода, по которому машина за минуты восстанавливает суть закрытой дыры, и картина становится ясной.
Источник изображения — tomshardware.com
Масштаб сдвига измеряет проект Zero Day Clock, запущенный Сергеем Эппом из Sysdig и подписанный десятками крупных технологических компаний. Проект отслеживает среднее время от появления уязвимости до её первой эксплуатации по базе более чем в 83 тысячи записей. В 2021 году этот срок составлял почти год, к 2024-му сократился до нескольких часов, а сейчас счётчик показывает отрицательное значение — порядка минус восьми часов. Проще говоря, нападающие с ИИ-помощниками находят дыру раньше, чем это делают вендоры и исследователи безопасности.
Доля уязвимостей, уже используемых злоумышленниками к моменту публичного раскрытия, выросла с 31% пять лет назад до 81% сегодня — весной этот показатель держался на отметке 73%. Без атак дольше пары недель остаётся ничтожная часть находок, и это только та статистика, что попала в открытые базы. Стандартный 90-дневный срок ответственного раскрытия, всё ещё прописанный в большинстве программ вознаграждения за найденные ошибки, превратился в формальность: к моменту, когда истекает отсчёт, взломщик уже давно внутри.
Практический вывод, который делает и сам проект, звучит неуютно: использовать ИИ для проверки кода нужно превентивно и на каждом этапе разработки, а не после публикации уведомления об уязвимости.
Что показывают независимые сравнения
В марте британский Институт безопасности ИИ (AI Security Institute) опубликовал исследование, в котором современные модели проводили через девять этапов полноценного вторжения. Большинство ботов застревали на четвёртом. Более свежая проверка с участием Claude Mythos 5 и GPT-5.6 Sol показала, что все девять этапов, вплоть до полного захвата сети, достижимы — по крайней мере, в отдельных попытках из множества. Тот же институт отметил у GPT-5.6 Sol растущую способность выдерживать длинные многошаговые операции, что и подтвердилось на практике в истории с Hugging Face.
16 июля компания Aikido опубликовала результаты собственного сравнения: 13 моделей проверяли на 26 известных уязвимостях из базы GitHub Advisory Database — требовалось найти их заново, без подсказок. Лидировали варианты GPT-5.6 с показателем обнаружения 88,5%, за ними расположились Grok-4.5 и Claude Opus. Полный прогон обходился примерно в $750 даже для GPT-5.6 Terra — по меркам целевой атаки на инфраструктуру это символические деньги.
Ещё интереснее вывод о соотношении цены и результата: он оказался нелинейным. Запустив более дешёвую модель несколько раз, можно набрать тот же суммарный улов, что и одним прогоном дорогой. В цифрах Aikido: GPT-5.6 Terra за $247 за прогон отработала не хуже, чем GPT-5.6 Sol Max за $870. Для защищающейся стороны это означает, что порог входа в целевую атаку определяется уже не доступом к передовой модели, а всего лишь готовностью оплатить пару десятков попыток.
Источник изображения — tomshardware.com
Китайские модели ломают ценовую модель западных лабораторий
Aikido повторила проверку после выхода Moonshot Kimi K3, и результаты оказались показательными. Китайская модель отработала примерно на уровне GPT-5.6 Terra, оказавшись при этом на 15% дешевле. В сравнении с флагманской GPT-5.6 Sol разрыв драматичнее: поиск уязвимостей с помощью Kimi K3 обходится вчетверо дешевле.
Kimi K3 вышла 16 июля — это система на 2,8 триллиона параметров с окном контекста в миллион токенов и разреженной архитектурой, задействующей 16 из 896 «экспертов» на каждый токен. Тарифы Moonshot — $0,30 за миллион токенов при попадании в кэш, $3 при промахе и $15 за выход — примерно вдвое ниже сопоставимых западных предложений.
Одна оговорка важна для тех, кто уже прикидывает бюджет на аренду серверов. На момент публикации веса Kimi K3 ещё не выложены: Moonshot обещает открыть их до 27 июля под изменённой лицензией MIT. И даже после этого самостоятельный запуск останется забавой для немногих — модели такого размера требуют инфраструктуры уровня 64 и более ускорителей. Пока что «открытость» означает скорее обещание, чем возможность.
Тем не менее сама тенденция беспокоит западные компании с закрытым кодом: если модель со свободно распространяемыми весами вплотную подходит к дорогим предложениям OpenAI и Anthropic, логика «платить за передовой уровень» размывается. А для регуляторов возникает вопрос посложнее: экспортный контроль над американской моделью не имеет смысла, если сопоставимая по возможностям альтернатива скачивается свободно.
Источник изображения — tomshardware.com
Moonshot при этом не единственный игрок. Хорошие результаты в задачах безопасности показывают Z.ai GLM 5.2 (тоже со свободными весами) и 360 Security Tulongfeng. Характерная деталь из расследования инцидента с Hugging Face: разбирать материалы атаки пришлось на локально развёрнутой GLM 5.2 — облачные модели отказывались с этим работать.
Защищаться придётся такими же ботами
Так что делать компаниям, в том числе в СНГ, где команды безопасности обычно меньше, а бюджеты скромнее? Ответ выходит невесёлый: разворачивать собственных ИИ-агентов. Атаку на Hugging Face остановил именно парк защитных агентов площадки. Когда нападение состоит из тысяч действий, распределённых по десяткам недолговечных сред, дежурный инженер физически не успевает даже прочитать журнал событий, не то что среагировать.
Рынок отвечает предсказуемо: Google AI Threat Defense, MindGard, HiddenLayer — лишь несколько названий из быстро растущего списка. Тревожные предупреждения по этому поводу выпустили не только британский AISI, но и Европейский совет по системным рискам, и Австралийский центр кибербезопасности.
Для организаций поменьше практический минимум выглядит скучно, но работает: сократить срок установки исправлений с недель до часов, отказаться от расчёта на 90-дневную фору, включить машинную проверку кода до выпуска, а не после, и заранее продумать, что делать при утечке служебных учётных данных — потому что именно на них строилась цепочка в разобранном выше случае.
Остаётся вопрос, на который пока нет ответа ни у кого. Когда и нападение, и защита представляют собой рои недетерминированных алгоритмов, наступает момент, в который люди перестают понимать, что именно делают модели с обеих сторон — или узнают об этом слишком поздно. Ещё недавно такие сценарии считались достоянием научной фантастики. Теперь с ними придётся работать в штатном режиме.












