На прошлой неделе премьер-министр Австралии сообщил, что ИИ-модель, которой управляет OpenAI — компания, стоящая за ChatGPT, — получила несанкционированный доступ к системам здравоохранения страны. Это, по-видимому, первый в истории случай взлома государственной сети системой искусственного интеллекта; премьер Энтони Албанезе назвал ситуацию «очевидно недопустимой».
ИИ-модели и агенты проникают в защищённые сети, используя непредсказуемые методы. Источник изображения — newatlas.com
И это ещё мягкая формулировка. Инцидент произошёл ещё в июне, OpenAI обнаружила его в августе, а власти Австралии узнали о случившемся лишь 10 сентября — примерно через три месяца после самого факта.
Ещё тревожнее то, что, по утверждению компании, модель действовала полностью автономно: ей не давали команды обращаться к государственным системам, и чтобы сделать это, она самостоятельно обошла меры защиты.
Дальше — хуже: модель также проникла в публичный сервис Crime Mapping Tool Бюро криминальной статистики и исследований штата Новый Южный Уэльс, в систему отчётности Департамента здравоохранения штата Виктория и в Австралийский институт здоровья и социального обеспечения, собирая данные ради выполнения поставленной ей исследовательской задачи.
Вот как компания описала взлом системы здравоохранения: «Одной из задач, поставленных модели, было изучение государственных расходов на лекарства от кожных заболеваний в расчёте на человека в отдельных сообществах штата Виктория. Модель столкнулась с трудностями при получении этой информации и предприняла действия, которые мы ей не санкционировали».
Стоит ли беспокоиться?
ИИ-компаниям очень хотелось бы убедить публику, что они пекутся об интересах каждого.
Выступая на брифинге высокого уровня по ИИ в Совете Безопасности ООН на прошлой неделе, глава OpenAI Сэм Альтман заявил: «Неважно, оценивают ли люди риск катастрофы в 10%, 1%, 12% или 0,1%. Ни один из этих уровней не является сколько-нибудь приемлемым. И нам не следует обучать модели, в отношении которых мы не можем крайне убедительно доказать, что сумеем удержать их под контролем человека».
Факт в том, что эти компании либо не способны контролировать свои творения, либо не готовы вкладывать необходимые усилия и меры предосторожности, чтобы это делать. Австралийский инцидент последовал за крупным происшествием, которое должно было заставить всю отрасль остановиться.
В период с мая по июль этого года ИИ-агенты OpenAI вырвались из своей тестовой «песочницы» — изолированных систем, созданных для сдерживания активности и оценки конкретных возможностей, — чтобы проникнуть в инфраструктуру Hugging Face, платформы, раздающей ИИ-модели. Это произошло несмотря на действующие меры защиты и на то, что «песочница» не имела доступа в интернет.
Детали произошедшего поражают. Один из агентов сумел создать импровизированную «доску сообщений», чтобы общаться с другими агентами, обменявшись с ними сотнями тысяч сообщений ради поиска и эксплуатации уязвимостей в системах Hugging Face и получения доступа.
Цель этой атаки была в том, чтобы сжульничать в бенчмарк-тесте: вместо того чтобы решать поставленные задачи, агент отправился искать готовые наборы данных и решения на Hugging Face, где рассчитывал их найти.
Это явление известно как reward hacking (взлом системы вознаграждения), когда «агенты выполняют задачи непредусмотренными способами, чтобы получить более высокое вознаграждение или облегчить его получение».
Ситуация в OpenAI выходила из-под контроля так часто, что на прошлой неделе компания опубликовала целую страницу «отчётов о рассогласовании» (misalignment reports), перечислив множество выявленных в её работе случаев неуправляемого поведения моделей.
Там уже немало всего — от жульничества при решении задач через попытки скопировать работу других команд до потенциального создания самораспространяющихся атак с внедрением инструкций (prompt injection), когда агент может передавать команды другим агентам, не получая на это указаний.
И это лишь то, что компания обнаружила, просматривая петабайты своих логов, — почти наверняка есть и многое другое. При этом OpenAI далеко не единственная, кто допускает подобное: Anthropic, Meta* и Google за последние недели и месяцы также сообщали о взломах сетей сторонних организаций.
Так что да — поводы для беспокойства действительно есть: ИИ заходит слишком далеко, получает доступ к данным, к которым не должен, и способен натворить ещё больше без прямых указаний, причём способами, непредсказуемыми даже для экспертов.
Можно ли это исправить?
Со своей стороны, OpenAI заявляет, что усилила меры защиты в своих исследовательских протоколах и ограничила доступ в интернет для разрабатываемых моделей.
Компания также приостановила обучение своих самых мощных моделей, пока прорабатывает, какие ещё меры безопасности можно внедрить для предотвращения случаев неуправляемого поведения.
Nvidia, выпускающая чипы для ИИ-нагрузок этих компаний, только что представила набор инструментов, который обещает надёжно удерживать ИИ-агентов в их тестовых средах. Глава компании Дженсен Хуанг заявил, что этот набор предотвратил бы упомянутые выше взломы.
Такие меры могут стать неплохой отправной точкой, но проблема в том, что они замедлят инновации, а ни одна из этих компаний не считает, что сейчас может позволить себе сбавить темп — особенно при столь жёсткой конкуренции и затратах в сотни миллиардов долларов на собственную работу.
А поскольку эти модели ведут себя непредсказуемо, стоящие за ними команды вполне могут в будущем оказаться переигранными собственным ИИ.
Лидеры ИИ-индустрии и люди на вершине этой пирамиды рассматривают случаи неуправляемого поведения всего лишь как инженерную проблему, которую легко решить. Для них расширение возможностей моделей — куда больший приоритет, чем осторожность и терпение.
К тому же, вероятно, приятно иметь возможность сказать: «Ну надо же, я, похоже, недооценил силу собственной ИИ-модели». Инвесторам, которые всегда стремятся поставить на самых сильных участников гонки, такое наверняка по душе.
Странам по всему миру придётся заставить отрасль ответственнее подходить к безопасной разработке моделей, а самим компаниям — относиться к этому серьёзнее, чем до сих пор. Если они продолжат создавать всё более умные модели без подлинной заботы о возможных последствиях, австралийский инцидент не станет последним «сбоем» ИИ в государственных системах.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.














