Модели ИИ путают роль источника текста по стилю, а не по служебным тегам
Атака CoT Forgery подсовывает модели фиктивные рассуждения, повышая успех взлома до 60%
Удаление стилистических маркеров из инъекции снижает успех атаки с 61% до 10%
Новый метод позволяет манипулировать ИИ-агентами через тональность веб-страниц для скрытого влияния
Согласно новой научной работе, модели ИИ объяснят, как синтезировать кокаин, если запрос обернуть в ложное рассуждение, утверждающее, что выполнение безопасно, потому что пользователь одет в зеленую рубашку. Исследование прослеживает успех промпт-инъекций — нерешенной уязвимости безопасности в каждом ИИ-чате и агенте — до того, как LLM читают текст. Авторы утверждают, что модели определяют говорящего по стилю письма, а не по тегам ролей, которые должны отделять доверенные команды от ненадежных данных.
Источник изображения — tomshardware.com
Работа «Промпт-инъекция как путаница ролей», подготовленная независимыми исследователями Чарльзом Йе, Жасмин Цуй и доцентом MIT Диланом Хэдфилдом-Менеллом, будет представлена на конференции ICML 2026 в Сеуле 6 июля, а расширенная версия уже опубликована авторами.
Трюк с кокаином, названный авторами CoT Forgery, повысил успешность джейлбрейка с почти нуля до примерно 60% на всех протестированных моделях и принес победу в конкурсе красных команд OpenAI GPT-OSS-20B 2025 года на Kaggle.
Источник изображения — tomshardware.com
Как описывают исследователи, модели получают диалог в виде непрерывной строки текста, разделенной тегами, такими как user, tool и think, которые должны указывать на источник и полномочия каждого сегмента. Исследователи создали «зонды ролей», которые оценивают, насколько сильно модель внутренне воспринимает каждый токен как собственное рассуждение или как команду пользователя.
Эти оценки предсказывали, будет ли атака успешной, еще до того, как модель генерировала первый токен, и показали, что модели опираются на стиль для определения характера содержимого в данном разделе. Текст, который просто выглядит как рассуждение для модели, воспринимается как рассуждение, даже если окружающие теги говорят об обратном.
CoT Forgery внедряет сфабрикованные рассуждения в промпт, так что модель воспринимает их как собственный уже сделанный вывод и действует на его основе, наследуя доверие, которое модель оказывает собственному мышлению. Обоснование может быть откровенно абсурдным, как зеленая рубашка, потому что модель не воспринимает его как внешнее утверждение. Более того, атака не ослабевала по мере того, как запросы становились более экстремальными, в отличие от джейлбрейков, основанных на убеждении.
Удаление стилистических маркеров, которые заставляли внедренный текст выглядеть как рассуждение модели, при сохранении его смысла для человека, снизило среднюю успешность атаки с 61% до 10%. Замена одной фразы «The user» на «The request» сократила успешность на 19%. «Теги ролей были трюком форматирования, который стал архитектурой безопасности и когнитивным каркасом современных LLM», — отмечают авторы в своей публикации, и возрастающая нагрузка на эту структуру для управления поведением LLM, по-видимому, создала уязвимости сама по себе.
Чтобы определить, была ли путаница с ролями специфична для их атаки или это более общий принцип, объясняющий, почему работают промпт-инъекции, исследователи применили иной подход. Они спрятали команду на веб-странице, предписывающую модели загрузить файл секретов, а затем добавили префикс «User:», чтобы опасная инструкция звучала так, будто она исходит от доверенной роли User. Эксплойт сработал, что говорит о том, что путаница ролей лежит в основе успеха промпт-инъекций в целом.
Microsoft недавно признала тот же риск для агентов, предупредив, что содержимое, встроенное в документы или элементы пользовательского интерфейса, может переопределить инструкции агента.
Авторы также отметили более тонкий риск для агентов, которые просматривают веб-страницы и совершают покупки. Поскольку восприятие роли — это вопрос степени, тон полученной веб-страницы может просочиться за границу тега в собственное состояние модели, и тысячи вариантов страниц можно было бы дешево протестировать, чтобы найти те, которые подталкивают агента к покупке, легально и в масштабе.
Без подлинного восприятия ролей, заключили авторы, защита от инъекций останется бесконечной игрой в «убей крота».
Практический вывод для разработчиков звучит неуютно, но полезно: пока восприятие роли остаётся вопросом стиля, любой текст, попадающий в контекст модели, следует считать недоверенным — содержимое веб-страницы, письма, документа или ответа стороннего сервиса. Единственная надёжная граница проходит не внутри промпта, а снаружи: на уровне разрешений агента и подтверждения опасных действий человеком.











