Компания Anthropic раскрыла, каким образом наносит водяные знаки на тексты, сгенерированные моделью Claude, чтобы соответствовать новым правилам прозрачности Европейского союза. Метод маркировки не предусматривает никаких видимых элементов, не заметен читателю и не добавляет в текст скрытых символов. Вместо этого в самом тексте формируется закономерность, которую способен распознать только тот, у кого есть соответствующий ключ.

Логотип Anthropic — компании, которая внедряет водяные знаки в тексты ClaudeИсточник изображения — engadget.com

Как устроена невидимая метка

Большие языковые модели подбирают слова по одному, выбирая из списка потенциально подходящих вариантов. Обычно выбор случаен — при условии, что слово вписывается в контекст. С включённым водяным знаком Claude использует ключ вместо произвольного генератора случайных чисел: последовательность цифр ключа определяет, какой именно вариант из списка будет взят на каждом шаге.

В своём примере Anthropic использовала цифры числа пи. Если ключ начинается с цифры 2 из последовательности 3,1415926535, следующее слово берётся шестым в списке, затем пятым, третьим и снова пятым. При проверке текста эта закономерность и выдаёт участие модели: сама по себе она статистическая, а не жёсткая, поэтому на читаемость и стиль не влияет.

Метод является адаптацией подхода Google DeepMind SynthID-Text, описанного в статье в журнале Nature. По утверждению компании, водяные знаки не влияют на качество ответов Claude и не замедляют его работу, не требуют дополнительных токенов и не делают генерацию дороже. Для читателя помеченный ответ ничем не отличается от непомеченного.

реклама кормит Уточку 🦆

Разумеется, у сгенерированных нейросетями текстов и без того есть характерные признаки: модели тяготеют к определённым конструкциям вроде «это не [X], а [Y]». Но такие приметы позволяют лишь заподозрить участие искусственного интеллекта — определить по ним конкретную модель невозможно. Anthropic обещает выпустить отдельный программный интерфейс с ключами для расшифровки меток, который подтвердит, была ли проверяемая часть текста создана её моделью.

Почему это происходит именно сейчас

Формальная причина — статья 50 Регламента ЕС об искусственном интеллекте (EU AI Act), требования которой вступили в силу 2 августа 2026 года. Летом Anthropic вместе с примерно двумя сотнями других подписантов, включая OpenAI, Google, Microsoft и Meta*, присоединилась к европейскому кодексу практики по прозрачности сгенерированных материалов. Он обязывает поставщиков моделей помечать создаваемые тексты машиночитаемым способом.

Цена вопроса высока: за несоблюдение требований предусмотрены штрафы до 15 млн евро или 3% мирового годового оборота — в зависимости от того, какая сумма окажется больше. Именно поэтому маркировка применяется ко всем пользователям сразу, а не только к европейским: у компании пока нет надёжного способа разграничивать поведение моделей по регионам.

реклама кормит Уточку 🦆

Важно и то, чего в метке нет. Водяной знак идентифицирует модель, а не человека: по нему невозможно восстановить сведения о пользователе, его организации или содержании переписки с ассистентом. Метка также сохраняется при обычном копировании и вставке текста в другой редактор.

Ограничения метода

Anthropic откровенно признаёт слабые места своего подхода:

  • метка не показывает, написал ли Claude текст целиком или лишь отредактировал чужой — отредактированный фрагмент тоже получит водяной знак;
  • переводы, выполненные моделью, также маркируются;
  • если модель только вычитала текст и внесла лёгкие правки либо фрагмент слишком короткий, знак может оказаться необнаружимым;
  • отсутствие метки ничего не доказывает: старые модели её не ставят, а сильный пересказ способен её разрушить.

Максимум, что позволяет утверждать проверка, — что модель вероятно участвовала в работе над текстом на каком-то этапе. При этом обратная задача решается плохо: лёгкая редактура сгенерированного текста водяной знак, скорее всего, не уберёт. Чтобы гарантированно избавиться от метки, текст придётся полностью переписать.

реклама кормит Уточку 🦆

Что будет с программным кодом и файлами

Отдельные опасения вызывает код: без существенного участия человека он может не подлежать авторско-правовой охране. Если бы удалось доказать, что целая кодовая база создана нейросетью, её можно было бы свободно скопировать и развивать дальше. Однако в Anthropic отмечают, что код «обычно содержит меньше водяных знаков, чем другие виды текста», поскольку требует точного вывода: там, где у модели нет свободы выбора слов, наносить метку попросту не на чем.

Файлы маркируются иначе — через криптографически подписанные сведения о происхождении в метаданных по открытому стандарту C2PA. Так помечаются в том числе изображения. Правда, эта защита хрупкая: снимок экрана или конвертация в другой формат стирают метаданные без следа.

реклама кормит Уточку 🦆

Критика подхода

Специалисты по распознаванию машинных текстов настроены скептически. В GPTZero — компании, которая продаёт собственные средства проверки и оценивает тексты по стилевым признакам, а не по меткам, — указывают, что водяные знаки в принципе обходятся: интенсивный пересказ разрушает закономерность, а для технологии SynthID уже появлялись бесплатные средства обхода. Ещё более серьёзное возражение звучит иначе: сигнал носит вероятностный характер и ничего не говорит об авторстве, но школы, работодатели и площадки рискуют начать воспринимать его как доказательство.

Нововведение затрагивает все продукты на основе моделей, выпущенных после 2 августа, — включая программный интерфейс, средства для разработчиков и облачных партнёров. Поддержку маркировки для более ранних версий Claude компания обещает добавить в ближайшие месяцы, в течение переходного периода европейского регламента.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.