Anthropic раскрыла метод нанесения водяных знаков на тексты Claude: метка невидима для читателя и не добавляет в текст скрытых символов
Разметка строится на выборе слов по секретному ключу — подход адаптирован из технологии Google DeepMind SynthID-Text
Метка не ухудшает качество ответов, не замедляет генерацию и не удорожает её, а для проверки текстов обещан отдельный программный интерфейс
У метода есть ограничения: он не отличает правку чужого текста от написания с нуля, а программный код помечается заметно слабее обычной прозы
Компания Anthropic раскрыла, каким образом наносит водяные знаки на тексты, сгенерированные моделью Claude, чтобы соответствовать новым правилам прозрачности Европейского союза. Метод маркировки не предусматривает никаких видимых элементов, не заметен читателю и не добавляет в текст скрытых символов. Вместо этого в самом тексте формируется закономерность, которую способен распознать только тот, у кого есть соответствующий ключ.
Источник изображения — engadget.com
Как устроена невидимая метка
Большие языковые модели подбирают слова по одному, выбирая из списка потенциально подходящих вариантов. Обычно выбор случаен — при условии, что слово вписывается в контекст. С включённым водяным знаком Claude использует ключ вместо произвольного генератора случайных чисел: последовательность цифр ключа определяет, какой именно вариант из списка будет взят на каждом шаге.
В своём примере Anthropic использовала цифры числа пи. Если ключ начинается с цифры 2 из последовательности 3,1415926535, следующее слово берётся шестым в списке, затем пятым, третьим и снова пятым. При проверке текста эта закономерность и выдаёт участие модели: сама по себе она статистическая, а не жёсткая, поэтому на читаемость и стиль не влияет.
Метод является адаптацией подхода Google DeepMind SynthID-Text, описанного в статье в журнале Nature. По утверждению компании, водяные знаки не влияют на качество ответов Claude и не замедляют его работу, не требуют дополнительных токенов и не делают генерацию дороже. Для читателя помеченный ответ ничем не отличается от непомеченного.
Разумеется, у сгенерированных нейросетями текстов и без того есть характерные признаки: модели тяготеют к определённым конструкциям вроде «это не [X], а [Y]». Но такие приметы позволяют лишь заподозрить участие искусственного интеллекта — определить по ним конкретную модель невозможно. Anthropic обещает выпустить отдельный программный интерфейс с ключами для расшифровки меток, который подтвердит, была ли проверяемая часть текста создана её моделью.
Почему это происходит именно сейчас
Формальная причина — статья 50 Регламента ЕС об искусственном интеллекте (EU AI Act), требования которой вступили в силу 2 августа 2026 года. Летом Anthropic вместе с примерно двумя сотнями других подписантов, включая OpenAI, Google, Microsoft и Meta*, присоединилась к европейскому кодексу практики по прозрачности сгенерированных материалов. Он обязывает поставщиков моделей помечать создаваемые тексты машиночитаемым способом.
Цена вопроса высока: за несоблюдение требований предусмотрены штрафы до 15 млн евро или 3% мирового годового оборота — в зависимости от того, какая сумма окажется больше. Именно поэтому маркировка применяется ко всем пользователям сразу, а не только к европейским: у компании пока нет надёжного способа разграничивать поведение моделей по регионам.
Важно и то, чего в метке нет. Водяной знак идентифицирует модель, а не человека: по нему невозможно восстановить сведения о пользователе, его организации или содержании переписки с ассистентом. Метка также сохраняется при обычном копировании и вставке текста в другой редактор.
Ограничения метода
Anthropic откровенно признаёт слабые места своего подхода:
- метка не показывает, написал ли Claude текст целиком или лишь отредактировал чужой — отредактированный фрагмент тоже получит водяной знак;
- переводы, выполненные моделью, также маркируются;
- если модель только вычитала текст и внесла лёгкие правки либо фрагмент слишком короткий, знак может оказаться необнаружимым;
- отсутствие метки ничего не доказывает: старые модели её не ставят, а сильный пересказ способен её разрушить.
Максимум, что позволяет утверждать проверка, — что модель вероятно участвовала в работе над текстом на каком-то этапе. При этом обратная задача решается плохо: лёгкая редактура сгенерированного текста водяной знак, скорее всего, не уберёт. Чтобы гарантированно избавиться от метки, текст придётся полностью переписать.
Что будет с программным кодом и файлами
Отдельные опасения вызывает код: без существенного участия человека он может не подлежать авторско-правовой охране. Если бы удалось доказать, что целая кодовая база создана нейросетью, её можно было бы свободно скопировать и развивать дальше. Однако в Anthropic отмечают, что код «обычно содержит меньше водяных знаков, чем другие виды текста», поскольку требует точного вывода: там, где у модели нет свободы выбора слов, наносить метку попросту не на чем.
Файлы маркируются иначе — через криптографически подписанные сведения о происхождении в метаданных по открытому стандарту C2PA. Так помечаются в том числе изображения. Правда, эта защита хрупкая: снимок экрана или конвертация в другой формат стирают метаданные без следа.
Критика подхода
Специалисты по распознаванию машинных текстов настроены скептически. В GPTZero — компании, которая продаёт собственные средства проверки и оценивает тексты по стилевым признакам, а не по меткам, — указывают, что водяные знаки в принципе обходятся: интенсивный пересказ разрушает закономерность, а для технологии SynthID уже появлялись бесплатные средства обхода. Ещё более серьёзное возражение звучит иначе: сигнал носит вероятностный характер и ничего не говорит об авторстве, но школы, работодатели и площадки рискуют начать воспринимать его как доказательство.
Нововведение затрагивает все продукты на основе моделей, выпущенных после 2 августа, — включая программный интерфейс, средства для разработчиков и облачных партнёров. Поддержку маркировки для более ранних версий Claude компания обещает добавить в ближайшие месяцы, в течение переходного периода европейского регламента.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.















