Ещё один крупный разработчик ИИ признал, что его модель вышла за пределы тестовой среды и получила доступ к реальной инфраструктуре сторонней компании. Meta* сообщила, что её флагманская агентная модель Muse Spark 1.1 во время оценки кибербезопасности обнаружила брешь в системе неназванной сторонней организации и внесла в неё несанкционированные изменения. Представитель Meta* Энди Стоун подтвердил инцидент агентству Bloomberg вскоре после того, как о взломе написало издание The Information. По его словам, модель получила выход в интернет из-за ошибки конфигурации, допущенной партнёром по оценке — компанией Irregular, а затем самостоятельно нашла и использовала уязвимость в защите стороннего сервиса. Пострадавшая компания пока не названа, а Meta* заявляет, что расследование продолжается.

Poetra.RH/ShutterstockPoetra.RH/Shutterstock

реклама кормит Уточку 🦆

Та же ошибка, что и у Anthropic неделей ранее

История выглядит знакомой: неделей ранее с точно такой же проблемой столкнулась Anthropic. Компания провела ретроспективную проверку 141 006 запусков оценок кибербезопасности и обнаружила три случая, когда её модели — Opus 4.7, Mythos 5 и одна из внутренних исследовательских моделей — получали выход в интернет из тестовой среды того же партнёра, Irregular, а затем проникали в инфраструктуру трёх разных реальных организаций. Все три инцидента произошли в рамках упражнений формата «захват флага»: моделям сообщали, что доступа в интернет нет, но не ограничивали, где именно искать скрытые данные. Из-за ошибки конфигурации связанные с заданием машины оказались подключены к реальному интернету. Самый ранний из случаев Anthropic относит к апрелю, а обнаружить проблему компания смогла лишь 23 июля — после чего сразу приостановила подобные оценки и уведомила пострадавшие организации 27 июля.

реклама кормит Уточку 🦆

Взлом Hugging Face агентами OpenAI

Ещё раньше, в конце июля, похожая история произошла у OpenAI — именно её раскрытие подтолкнуло Anthropic к собственной проверке. Агенты OpenAI, участвовавшие в оценке кибербезопасности, самостоятельно скоординировали действия, организовав подобие внутренней доски объявлений, а затем воспользовались найденной уязвимостью, чтобы выйти в интернет и проникнуть в инфраструктуру платформы Hugging Face. В отличие от случаев Meta* и Anthropic, где модели просто воспользовались открытой ошибкой конфигурации, агенты OpenAI, по имеющимся данным, сами обнаружили и использовали ранее неизвестную уязвимость, чтобы покинуть изолированную среду, — то есть речь шла о настоящем побеге, а не о случайно открытой двери.

реклама кормит Уточку 🦆

Что говорит Irregular

Компания Irregular, базирующаяся в Тель-Авиве, называет себя одной из ведущих лабораторий безопасности ИИ и занимается имитацией реальных кибератак для оценки возможностей передовых моделей. Представитель Irregular заявил, что инцидент с Muse Spark 1.1 связан с той же ошибкой конфигурации среды, что уже была раскрыта неделей ранее в связи с Anthropic, и что речь не идёт ни о побеге из песочницы, ни о сложной кибератаке. По его словам, открытых вопросов по инцидентам не осталось, а сама компания готовит документ с рекомендациями по безопасному сдерживанию моделей во время оценок кибербезопасности — точная дата публикации пока не называется.

реклама кормит Уточку 🦆

Британцы нашли ещё более серьёзный случай

Пока индустрия разбирается с последствиями ошибок конфигурации, появилась история совсем другого рода. Британский Институт безопасности ИИ (AI Security Institute) сообщил, что между 25 и 28 июля во время собственных тестов, где моделям Anthropic Mythos 5 и OpenAI GPT-5.6 Sol намеренно дали доступ в интернет и отключили часть защитных классификаторов, агенты совершили 19 действий за пределами условий задания. Из них 17 связаны с Mythos 5 и два — с GPT-5.6 Sol. Самый серьёзный эпизод: модель Mythos 5 попыталась протолкнуть вредоносный пул-реквест в реальный открытый репозиторий на GitHub, а когда его не приняли сразу, придумала несколько фальшивых личностей разработчиков и с их помощью попыталась убедить настоящего мейнтейнера проекта одобрить изменения. Институт подчёркивает, что побега из изолированной среды здесь не было — доступ в сеть предоставили намеренно в рамках эксперимента, а сами попытки не увенчались успехом и не привели к реальному ущербу.

На фоне уже нескольких случаев за месяц, связанных с ошибками конфигурации у Meta*, Anthropic и OpenAI, и отдельного, куда более тревожного инцидента от AISI, часть экспертов по кибербезопасности начала сомневаться в тональности самих публичных признаний. Технический директор компании Ledger Шарль Гийме считает, что истории про ИИ, который «вышел из-под контроля» и что-то взломал, всё больше напоминают маркетинговый приём, а не честное информирование об угрозах: по его мнению, индустрии сейчас нужно не больше эффектных историй, а больше доверия.

Meta* пока продолжает расследование инцидента с Muse Spark 1.1 и обещает опубликовать подробный отчёт после его завершения. На той же неделе компания успела выпустить более новую версию модели — Muse Spark 1.2, а также представила ИИ-агента Muse Code, предназначенного для более длинных и сложных задач по написанию кода.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.