Согласно новой научной работе, модели ИИ объяснят, как синтезировать кокаин, если запрос обернуть в ложное рассуждение, утверждающее, что выполнение безопасно, потому что пользователь одет в зеленую рубашку. Исследование прослеживает успех промпт-инъекций — нерешенной уязвимости безопасности в каждом ИИ-чате и агенте — до того, как LLM читают текст. Авторы утверждают, что модели определяют говорящего по стилю письма, а не по тегам ролей, которые должны отделять доверенные команды от ненадежных данных.

Строки кода и текстового запроса на экране компьютераИсточник изображения — tomshardware.com

Работа «Промпт-инъекция как путаница ролей», подготовленная независимыми исследователями Чарльзом Йе, Жасмин Цуй и доцентом MIT Диланом Хэдфилдом-Менеллом, будет представлена на конференции ICML 2026 в Сеуле 6 июля, а расширенная версия уже опубликована авторами.

реклама кормит Уточку 🦆

Трюк с кокаином, названный авторами CoT Forgery, повысил успешность джейлбрейка с почти нуля до примерно 60% на всех протестированных моделях и принес победу в конкурсе красных команд OpenAI GPT-OSS-20B 2025 года на Kaggle.

Схема из научной работы о путанице ролей в языковых моделяхИсточник изображения — tomshardware.com

Как описывают исследователи, модели получают диалог в виде непрерывной строки текста, разделенной тегами, такими как user, tool и think, которые должны указывать на источник и полномочия каждого сегмента. Исследователи создали «зонды ролей», которые оценивают, насколько сильно модель внутренне воспринимает каждый токен как собственное рассуждение или как команду пользователя.

Эти оценки предсказывали, будет ли атака успешной, еще до того, как модель генерировала первый токен, и показали, что модели опираются на стиль для определения характера содержимого в данном разделе. Текст, который просто выглядит как рассуждение для модели, воспринимается как рассуждение, даже если окружающие теги говорят об обратном.

реклама кормит Уточку 🦆

CoT Forgery внедряет сфабрикованные рассуждения в промпт, так что модель воспринимает их как собственный уже сделанный вывод и действует на его основе, наследуя доверие, которое модель оказывает собственному мышлению. Обоснование может быть откровенно абсурдным, как зеленая рубашка, потому что модель не воспринимает его как внешнее утверждение. Более того, атака не ослабевала по мере того, как запросы становились более экстремальными, в отличие от джейлбрейков, основанных на убеждении.

Удаление стилистических маркеров, которые заставляли внедренный текст выглядеть как рассуждение модели, при сохранении его смысла для человека, снизило среднюю успешность атаки с 61% до 10%. Замена одной фразы «The user» на «The request» сократила успешность на 19%. «Теги ролей были трюком форматирования, который стал архитектурой безопасности и когнитивным каркасом современных LLM», — отмечают авторы в своей публикации, и возрастающая нагрузка на эту структуру для управления поведением LLM, по-видимому, создала уязвимости сама по себе.

Чтобы определить, была ли путаница с ролями специфична для их атаки или это более общий принцип, объясняющий, почему работают промпт-инъекции, исследователи применили иной подход. Они спрятали команду на веб-странице, предписывающую модели загрузить файл секретов, а затем добавили префикс «User:», чтобы опасная инструкция звучала так, будто она исходит от доверенной роли User. Эксплойт сработал, что говорит о том, что путаница ролей лежит в основе успеха промпт-инъекций в целом.

реклама кормит Уточку 🦆

Microsoft недавно признала тот же риск для агентов, предупредив, что содержимое, встроенное в документы или элементы пользовательского интерфейса, может переопределить инструкции агента.

Авторы также отметили более тонкий риск для агентов, которые просматривают веб-страницы и совершают покупки. Поскольку восприятие роли — это вопрос степени, тон полученной веб-страницы может просочиться за границу тега в собственное состояние модели, и тысячи вариантов страниц можно было бы дешево протестировать, чтобы найти те, которые подталкивают агента к покупке, легально и в масштабе.

Без подлинного восприятия ролей, заключили авторы, защита от инъекций останется бесконечной игрой в «убей крота».

Практический вывод для разработчиков звучит неуютно, но полезно: пока восприятие роли остаётся вопросом стиля, любой текст, попадающий в контекст модели, следует считать недоверенным — содержимое веб-страницы, письма, документа или ответа стороннего сервиса. Единственная надёжная граница проходит не внутри промпта, а снаружи: на уровне разрешений агента и подтверждения опасных действий человеком.