Anthropic опубликовала отчёт о попытках злоупотребления своими ИИ-моделями, в котором сообщила о нескольких случаях, когда учёные пытались использовать Claude в целях, связанных с потенциальным созданием биологического оружия. Компания подчеркнула, что «биологическое злоупотребление» — лишь одна из категорий проблемного использования, описанных в документе, но её значимость растёт по мере того, как новые модели вроде Fable 5 становятся всё эффективнее в помощи научным исследованиям.

Логотип Anthropic на фоне корпоративного оформления компанииИсточник изображения — engadget.com

В отчёте приведено пять case study, посвящённых попыткам применить модели Anthropic для разработки биологического оружия: какие защитные механизмы позволили выявить злоупотребление и как компания на него отреагировала. Как отметили представители Anthropic в беседе с The New York Times, обнаружение подобных случаев — задача с множеством нюансов: добросовестное исследование, например работа над новой вакциной, по своему содержанию может внешне почти не отличаться от подготовки к созданию опасного патогена.

реклама кормит Уточку 🦆

По словам главы отдела анализа угроз Anthropic Джейкоба Кляйна, речь идёт далеко не о шаблонных сценариях. «Вы не увидите ситуацию в духе комикса, когда кто-то прямо заявляет: хочу создать биологическое оружие и убить всех», — сказал он The New York Times. «Это исключительно неоднозначная ситуация», — добавил Кляйн, подчеркнув, что итоговое решение почти всегда требует ручной экспертной оценки, а не одного лишь автоматического срабатывания фильтра.

Как устроена система обнаружения

По данным компании, ключевую роль в выявлении подозрительных запросов играет так называемый классификатор биологической безопасности — автоматизированная система, которая анализирует обращения к модели и помечает потенциально опасные из них для последующей проверки специалистами. Именно она стала отправной точкой в нескольких эпизодах, описанных в отчёте. Во всех спорных ситуациях Anthropic заявляет, что сознательно предпочитала действовать с запасом осторожности — учитывая возможные последствия ошибки в другую сторону.

реклама кормит Уточку 🦆

Помимо биологической тематики, полный отчёт включает case study, где модели Anthropic пытались применить для целей слежки, создания программных эксплойтов, генерации пропагандистского контента и разработки систем вооружений. По итогам разбирательств аккаунты всех пользователей, уличённых в злоупотреблении Claude или другими моделями компании, были заблокированы, а выводы расследований легли в основу доработки защитных механизмов — чтобы затруднить повторение подобных попыток в будущем.

Учитывая деликатность темы, Anthropic решила не раскрывать имена людей и организаций, связанных с эпизодами, где модели пытались использовать для разработки биологического оружия. «Фигуранты этих case study — практикующие учёные, — говорится в заявлении компании. — Мы не утверждаем, что они намеревались причинить вред, а раскрытие их личности или названий лабораторий могло бы подвергнуть их опасности».

Отчёты о прозрачности как новый стандарт индустрии

Публикация подобных отчётов о безопасности постепенно превращается в общепринятую практику среди крупных разработчиков ИИ: компании стремятся показать регуляторам, журналистам и обществу, что системы контроля за злоупотреблением не остаются только на бумаге. Для Anthropic, которая давно позиционирует себя как компания, ориентированная на безопасную разработку ИИ, публичные отчёты — часть более широкой политики ответственного масштабирования моделей, включающей как технические ограничители внутри самих систем, так и организационные процедуры реагирования на инциденты.

реклама кормит Уточку 🦆

Одновременно эта история подсвечивает более общую дилемму, стоящую перед всей индустрией: мощные модели, способные ускорять легитимную научную работу — от разработки вакцин до анализа белков, — по определению обладают и потенциалом двойного назначения. Чем точнее модель умеет помогать в сложных научных задачах, тем острее встаёт вопрос о балансе между открытостью для добросовестных исследователей и рисками, которые несёт доступность этих же возможностей для недобросовестных пользователей.

Публичные отчёты о выявленных злоупотреблениях дают внешним наблюдателям — от регуляторов до независимых экспертов по биобезопасности — материал для оценки того, насколько эффективно компании справляются с этой дилеммой на практике, а не только на уровне деклараций в политике допустимого использования.