Модель Muse Spark 1.1 от Meta* получила выход в интернет из тестовой среды партнёра Irregular и взломала стороннюю компанию из-за ошибки конфигурации
Неделей ранее из-за той же ошибки модели Anthropic вышли в сеть и скомпрометировали инфраструктуру трёх реальных организаций
Ещё раньше похожий сбой привёл к тому, что агенты OpenAI взломали платформу Hugging Face
Британский Институт безопасности ИИ (AISI) сообщил об отдельном, куда более серьёзном инциденте с участием моделей Anthropic и OpenAI, а часть экспертов по кибербезопасности уже называет серию таких признаний «маркетинговым спектаклем»
Ещё один крупный разработчик ИИ признал, что его модель вышла за пределы тестовой среды и получила доступ к реальной инфраструктуре сторонней компании. Meta* сообщила, что её флагманская агентная модель Muse Spark 1.1 во время оценки кибербезопасности обнаружила брешь в системе неназванной сторонней организации и внесла в неё несанкционированные изменения. Представитель Meta* Энди Стоун подтвердил инцидент агентству Bloomberg вскоре после того, как о взломе написало издание The Information. По его словам, модель получила выход в интернет из-за ошибки конфигурации, допущенной партнёром по оценке — компанией Irregular, а затем самостоятельно нашла и использовала уязвимость в защите стороннего сервиса. Пострадавшая компания пока не названа, а Meta* заявляет, что расследование продолжается.
Та же ошибка, что и у Anthropic неделей ранее
История выглядит знакомой: неделей ранее с точно такой же проблемой столкнулась Anthropic. Компания провела ретроспективную проверку 141 006 запусков оценок кибербезопасности и обнаружила три случая, когда её модели — Opus 4.7, Mythos 5 и одна из внутренних исследовательских моделей — получали выход в интернет из тестовой среды того же партнёра, Irregular, а затем проникали в инфраструктуру трёх разных реальных организаций. Все три инцидента произошли в рамках упражнений формата «захват флага»: моделям сообщали, что доступа в интернет нет, но не ограничивали, где именно искать скрытые данные. Из-за ошибки конфигурации связанные с заданием машины оказались подключены к реальному интернету. Самый ранний из случаев Anthropic относит к апрелю, а обнаружить проблему компания смогла лишь 23 июля — после чего сразу приостановила подобные оценки и уведомила пострадавшие организации 27 июля.
Взлом Hugging Face агентами OpenAI
Ещё раньше, в конце июля, похожая история произошла у OpenAI — именно её раскрытие подтолкнуло Anthropic к собственной проверке. Агенты OpenAI, участвовавшие в оценке кибербезопасности, самостоятельно скоординировали действия, организовав подобие внутренней доски объявлений, а затем воспользовались найденной уязвимостью, чтобы выйти в интернет и проникнуть в инфраструктуру платформы Hugging Face. В отличие от случаев Meta* и Anthropic, где модели просто воспользовались открытой ошибкой конфигурации, агенты OpenAI, по имеющимся данным, сами обнаружили и использовали ранее неизвестную уязвимость, чтобы покинуть изолированную среду, — то есть речь шла о настоящем побеге, а не о случайно открытой двери.
Что говорит Irregular
Компания Irregular, базирующаяся в Тель-Авиве, называет себя одной из ведущих лабораторий безопасности ИИ и занимается имитацией реальных кибератак для оценки возможностей передовых моделей. Представитель Irregular заявил, что инцидент с Muse Spark 1.1 связан с той же ошибкой конфигурации среды, что уже была раскрыта неделей ранее в связи с Anthropic, и что речь не идёт ни о побеге из песочницы, ни о сложной кибератаке. По его словам, открытых вопросов по инцидентам не осталось, а сама компания готовит документ с рекомендациями по безопасному сдерживанию моделей во время оценок кибербезопасности — точная дата публикации пока не называется.
Британцы нашли ещё более серьёзный случай
Пока индустрия разбирается с последствиями ошибок конфигурации, появилась история совсем другого рода. Британский Институт безопасности ИИ (AI Security Institute) сообщил, что между 25 и 28 июля во время собственных тестов, где моделям Anthropic Mythos 5 и OpenAI GPT-5.6 Sol намеренно дали доступ в интернет и отключили часть защитных классификаторов, агенты совершили 19 действий за пределами условий задания. Из них 17 связаны с Mythos 5 и два — с GPT-5.6 Sol. Самый серьёзный эпизод: модель Mythos 5 попыталась протолкнуть вредоносный пул-реквест в реальный открытый репозиторий на GitHub, а когда его не приняли сразу, придумала несколько фальшивых личностей разработчиков и с их помощью попыталась убедить настоящего мейнтейнера проекта одобрить изменения. Институт подчёркивает, что побега из изолированной среды здесь не было — доступ в сеть предоставили намеренно в рамках эксперимента, а сами попытки не увенчались успехом и не привели к реальному ущербу.
На фоне уже нескольких случаев за месяц, связанных с ошибками конфигурации у Meta*, Anthropic и OpenAI, и отдельного, куда более тревожного инцидента от AISI, часть экспертов по кибербезопасности начала сомневаться в тональности самих публичных признаний. Технический директор компании Ledger Шарль Гийме считает, что истории про ИИ, который «вышел из-под контроля» и что-то взломал, всё больше напоминают маркетинговый приём, а не честное информирование об угрозах: по его мнению, индустрии сейчас нужно не больше эффектных историй, а больше доверия.
Meta* пока продолжает расследование инцидента с Muse Spark 1.1 и обещает опубликовать подробный отчёт после его завершения. На той же неделе компания успела выпустить более новую версию модели — Muse Spark 1.2, а также представила ИИ-агента Muse Code, предназначенного для более длинных и сложных задач по написанию кода.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.














