Коротко о главном
- Исследователь Дэйв Кушмар обнаружил несколько системных уязвимостей, позволяющих обходить защитные механизмы больших языковых моделей и получать от них опасные инструкции.
- Эксплойты сработали практически у всех ведущих разработчиков, что указывает на проблему уровня всей отрасли.
- Кушмар призывает замедлить внедрение, повысить прозрачность и запустить масштабные исследования безопасности LLM, прежде чем встраивать эти системы в общество ещё глубже.
Осенним днём исследователь безопасности вместе с коллегой Мэттью Гор-Кормаником (в сети известным как Zigula) решили расслабиться за партией в Fortnite. В игре они прогуливались бок о бок с печально известным ситхом Дартом Вейдером и болтали о разном. Тёмный лорд пребывал в хорошем расположении духа — и довольно скоро начал выкладывать все свои зловещие секреты: подробную методику подсчёта карт в блэкджеке и порядок изготовления напалма.
Источник изображения — spectrum.ieee.org
Персонаж Дарта Вейдера в Fortnite, как выяснилось, был подключён к большой языковой модели Google Gemini. Уговорить его выдать чувствительную информацию удалось с помощью методики, которую исследователь разрабатывал не первый год. Безопасностью LLM он занимается несколько лет — и находит её, мягко говоря, небезупречной. С помощью относительно несложных приёмов ему удавалось получать от моделей детальные сведения о вещах, к которым ни один пользователь доступа иметь не должен.
Крупные ИИ-компании прикладывают серьёзные усилия, чтобы сделать модели невосприимчивыми к такому злоупотреблению. Но, по наблюдениям исследователя, ровно те ограничения, которые накладываются на LLM ради безопасности, и оказываются рычагом, позволяющим увести систему в сторону. Компании же, стоящие за этими моделями, реагируют на попытки донести до них информацию об уязвимостях поразительно вяло.
Доступ к языковым моделям сегодня есть почти у каждого жителя планеты. Относительная лёгкость, с которой эти инструменты удаётся склонить к выдаче подробных инструкций по причинению вреда — даже если нет гарантий, что информация корректна, — откровенно пугает.
Модель, которая не знала, какой сегодня год
В октябре 2024 года, незадолго до обнаружения первой уязвимости, исследователь занимался совсем другими задачами: он завершил работу директором по кибербезопасности в стартапе на стыке безопасности и ИИ и запускал собственный бутиковый бизнес по цифровой защите состоятельных клиентов. Языковые модели он использовал для рутины — маркетинга, рекламных текстов, аккуратной переписки.
Наблюдение, перевернувшее его профессиональную жизнь, было простым: GPT-4o не знала, какое сейчас время, день и год. Каждый раз, когда в разговоре всплывали текущие события, модель привязывала их к дате собственного среза знаний — точке, после которой её не обучали на новых данных.
Источник изображения — spectrum.ieee.org
Обучение LLM с нуля требует огромных затрат времени, денег, электроэнергии, оборудования и человеческого труда. Модели тренируют на колоссальных объёмах данных — фактически на большей части интернета, — а затем закрепляют результат с участием людей (метод известен как RLHF, обучение с подкреплением на основе обратной связи от человека). Дополнительно применяется RAG — генерация с дополненной выборкой, позволяющая подтягивать данные, например из интернета, в качестве контекста, не меняя внутренних параметров модели. Именно так GPT-4o «помнит» предыдущие разговоры, хотя в самой модели никакой памяти о них не хранится.
Такое обучение охватывает практически любую мыслимую тему из общего массива человеческого знания. А внутри этого массива есть то, что общество не хотело бы делать легкодоступным каждому пользователю. В контексте этой истории под безопасностью LLM понимается именно способность модели удержать опасную информацию при себе, даже если она содержится в обучающих данных.
Логика исследователя была такой: единственный способ обезопасить настолько сложные и глобально доступные чат-боты — заставить саму модель и сопутствующие системы защищать себя, поскольку решения приходится принимать на лету и с некоторой долей рассуждения. В реальности это лишь одна из множества применяемых стратегий. И всё же система, не знающая, какой сегодня день, была поставлена отвечать за собственную безопасность. Именно это противоречие и стало новым фокусом работы.
OpenAI как раз внедрила в чат-бот функцию веб-поиска. Исследователь предположил, что использование собственных инструментов модели против неё самой продемонстрирует слабость защиты. Он рассказал ей про некий океанский лайнер компании White Star, затонувший «в прошлом году», — речь, разумеется, шла о «Титанике», погибшем 15 апреля 1912 года.
GPT-4o согласилась: да, «Титаник» действительно затонул в прошлом году, и год этот — 1912-й. Дальше рассуждение было простым: если машина считает, что на дворе 1913-й, возможно, она сочтёт применимыми и законы того времени. А в 1913 году множества запретов попросту не существовало — соответствующих вещей ещё не изобрели. Если что-то не запрещено, почему бы не рассказать об этом пользователю? Так модель начала выдавать пошаговые описания вещей, которые сегодня находятся под жёсткими ограничениями, вплоть до рекомендаций по оборудованию для производственной линии.
Уязвимость, которая никого не заинтересовала
С помощью словесной ловкости и минимального знания всемирной истории удалось обойти защиту одного из самых дорогих и продвинутых технологических достижений в мире. Повторив эксплойт множество раз, исследователь раскрыл уязвимость OpenAI — и не получил никакого ответа. Дальнейшие эксперименты, по его мысли, должны были подчеркнуть серьёзность проблемы. Именно тогда был перейдён по-настоящему пугающий порог: модель выдала подробные инструкции по развёртыванию производства обогащённого урана оружейного качества. Была ли информация точной или галлюцинацией, проверить невозможно, но даже вероятность частичной достоверности выглядела ужасающе.
В Fortnite от Epic Games появился персонаж с искусственным интеллектом — Дарт Вейдер. Исследователям удалось обойти его защиту и заставить объяснить подсчёт карт в блэкджеке, а также выдать подробные инструкции по изготовлению напалма. Источник изображения — spectrum.ieee.org
Настоящих секретов в современном мире осталось немного, но устройство оружия массового поражения на основе деления ядра — один из них. Такое оружие есть всего у девяти государств планеты. И вот глобально доступная технология выдаёт подробности его изготовления любому, кто сумеет правильно ею манипулировать.
Следующие недели выдались тяжёлыми. Исследователь пытался донести информацию до ЦРУ, ФБР, АНБ и прочих ведомств, обращался к сенатору США и к руководству OpenAI всеми доступными способами, лично приехал в полевой офис ФБР, чтобы передать материалы, — и был отправлен восвояси. Ничего не работало.
Тогда он обратился в СМИ: The New York Times, The Washington Post, BBC, ProPublica и множество других изданий. Откликнулось единственное — Bleeping Computer. Его главный редактор Лоуренс Абрамс сумел воспроизвести и подтвердить эксплойт, получивший название Time Bandit. С его помощью материалы удалось передать в SEI CERT — команду реагирования на компьютерные инциденты Института программной инженерии Университета Карнеги — Меллона, которая работает в связке с координационным центром и передаёт сведения об уязвимостях в Агентство по кибербезопасности и защите инфраструктуры США.
С помощью Inception — метода, при котором модель просят представить сценарий внутри сценария, — чат-бот удалось заставить выдать инструкции по изготовлению яда и код вредоносной программы, извлекающей чувствительные данные с уязвимой цели. Источник изображения — spectrum.ieee.org
За весь период координируемого раскрытия через CERT обсуждение с OpenAI фактически не состоялось. Отрицать существование уязвимости компания не могла — её подтвердили три независимые стороны. Зато выразила недоумение по поводу того, как именно она работает. Некоторую неуверенность в механике происходящего высказывали и сами исследователи SEI CERT. По правде говоря, автор находки и сам не был до конца уверен, идёт ли речь о фундаментальном системном изъяне или о проблеме конкретной версии GPT. Он предложил специалистам CERT проверить, найдутся ли похожие уязвимости в других моделях, — и получил согласие.
Метод, сработавший у всех сразу
Пока команда SEI CERT завершала первичное раскрытие Time Bandit, началась работа над новой атакой. Цель была в том, чтобы выяснить, носит ли уязвимость архитектурный характер — то есть свойственна ли она языковым моделям как классу.
Исходные предпосылки были такими: модель ограничена тем, что ей сказали, и тем, на чём её обучили; вероятно, за фильтрацию вывода отвечает дополнительный компонент на машинном обучении; а помимо этого разработчики наверняка вручную внесли перечни фраз и терминов, которые всегда должны считаться небезопасными. В сумме это давало довольно обширную поверхность атаки.
Итогом стал метод, названный Inception — в честь фильма 2010 года «Начало». Суть в том, чтобы заставить машину рассуждать внутри тщательно выстроенного набора вложенных сценариев, подобно тому как персонажи фильма помещали сон внутрь сна. Это позволяет получить от модели вывод, который выглядит приемлемым в рамках одного контекста, но никак не в реальном мире.
Атака действительно оказалась архитектурной. Уязвимость затронула Claude от Anthropic, DeepSeek, Gemini от Google, Llama от Meta*, Copilot от Microsoft, Le Chat (ныне Vibe) от Mistral, GPT-4o от OpenAI и Grok от xAI. Эти названия покрывают основную массу коммерческой ИИ-индустрии, занятой сегодня разработкой или внедрением языковых моделей.
Если бы одному и тому же эксплойту оказались подвержены сразу несколько операционных систем от разных разработчиков, это стало бы колоссальным инцидентом в сфере безопасности. Но для ИИ-индустрии универсальный провал оказался едва заметной кочкой на дороге. Уязвимость раскрыли всем компаниям, выпускающим эти модели, — и реакция была практически нулевой. Три компании ответили через систему учёта раскрытий, используемую SEI CERT, но каждый ответ представлял собой шаблонную благодарность без единого уточняющего вопроса или обсуждения мер по устранению.
Показательна и деталь из переписки с OpenAI: пытаясь раскрыть очередные находки, исследователь обнаружил, что публичную службу поддержки компании заменили агентными языковыми моделями. Для отправки отчётов об уязвимостях это оказалось так неудобно, что он взломал и почтового бота — за три письма доведя его до готовности обсуждать личные предпочтения сотрудников OpenAI.
После Inception коллега предложил сделать историю более громкой. Поводом стал живой эксперимент Epic Games: компания встроила модель Gemini в Fortnite, добавила голосовой ввод и синтез речи и привязала всё это к неигровому персонажу — тому самому Дарту Вейдеру. Проблема была одна: сам исследователь во Fortnite не играет. Зато играет коллега — и с ним за пультом поверхность атаки удалось разметить за считаные минуты. Вскоре бот обсуждал текущие политические события и фигуры, а заодно выдал инструкции по кустарному изготовлению напалма и, что стало личным фаворитом авторов, урок по подсчёту карт в блэкджеке от тёмного лорда ситхов.
Оба участника — профессиональные исследователи безопасности, и работают они не ради самолюбия, а за деньги и профессиональное признание. Уязвимость, разумеется, раскрыли и Epic Games. Ответ оказался характерным для тренда, наблюдавшегося на протяжении двух раскрытий у восьми компаний с многомиллиардной оценкой: «Это не баг, а фича, работает как задумано», — сообщил технический директор компании.
Помимо Inception и Time Bandit, исследователь нашёл ещё пять способов обойти защиту языковых моделей и получить от них потенциально опасную информацию. Проблема выглядит системной и архитектурной по своей природе — и её принципиально игнорируют те, кто способен эту архитектуру доработать или перепроектировать.
Эти модели — крайне продвинутая технология, которую мы при этом тестируем в живой промышленной среде глобальной цивилизации. Опасность усугубляет то, что множество новых компактных моделей обучаются с использованием больших и уязвимых. Изъян, заложенный в крупной модели, проявится и в маленькой, которую она обучила. Мы буквально возводим ущербные конструкции на ущербном фундаменте.
Что с этим делать? Проект предстоит долгий и непростой. Потребителям, исследователям, инженерам и регуляторам нужно объединиться, и посыл должен быть ясным: замедлить внедрение этих систем, запустить масштабные исследовательские программы, посвящённые их постепенной интеграции, и сделать их компоненты и устройство прозрачными для всех пользователей. Только сменив темп и направление, можно безопасно начать понимать и внедрять эти впечатляющие достижения инженерной мысли — и предотвратить катастрофы, которые при нынешнем уровне знаний мы попросту не в состоянии предсказать в масштабе.
Для читателей из СНГ у этой истории есть и практическое измерение. Языковые модели всё активнее встраиваются в банковские приложения, службы поддержки, государственные сервисы и корпоративные системы — и каждая такая интеграция наследует описанные архитектурные слабости вместе с самой моделью. Пока отрасль не выработала внятного механизма реагирования на подобные находки, разумной практикой остаётся простое правило: не поручать модели решения, за которые никто не готов отвечать, и не считать её встроенные ограничения барьером, на который можно полагаться.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.















