Чем больше в сети контента, сгенерированного нейросетями, тем сложнее — и тем важнее — отличать настоящее изображение, аудиозапись или видео от подделки. Чтобы у разработчиков детекторов появился честный измерительный инструмент, объединённая команда исследователей из Microsoft, Северо-Западного университета (Эванстон, штат Иллинойс) и некоммерческой организации Witness собрала новый набор данных из сгенерированной ИИ медиа-продукции.

Концептуальная иллюстрация к теме распознавания дипфейковИсточник изображения — spectrum.ieee.org

Witness — организация, которая помогает активистам и журналистам разбираться с проблемами, порождёнными синтетическим контентом, и именно её опыт «в поле» отличает эту работу от чисто лабораторных исследований. Набор данных получил название MNW — по первым буквам трёх участников (Microsoft-Northwestern-Witness), — а его описание опубликовано 10 апреля в журнале IEEE Intelligent Systems.

Ключевая идея — намеренное разнообразие. Выборка собиралась так, чтобы максимально полно отражать реальный ландшафт генеративных моделей, а не узкий срез из нескольких популярных сервисов.

реклама кормит Уточку 🦆

Почему подделки стало так трудно ловить

Томас Рока, ведущий научный сотрудник Microsoft, занимающийся вопросами безопасности генеративного ИИ, отмечает, что качество синтетического контента растёт непрерывно. Сегодня практически любой человек может с помощью обычного приложения на смартфоне сгенерировать голосовое сообщение, воспроизводящее чужой голос, либо изображение или видео, имитирующее чужую внешность.

Ущерб от таких материалов варьируется от кражи личности и мошеннических схем до создания интимных изображений без согласия человека и материалов с сексуализированным насилием над детьми. Для СНГ-аудитории особенно узнаваем первый сценарий: подделка голоса родственника или руководителя уже стала рабочим инструментом телефонных мошенников, и распознавание таких записей — не академическая задача, а вопрос прикладной безопасности.

При этом генераторы не идеальны. Они оставляют артефакты — мелкие следы и сигналы, по которым подделку можно опознать. «Артефактами могут быть распределения шума, несогласованность между соседними участками пикселей, разрывы в аудиосигнале и другие нерегулярности», — поясняет Рока.

реклама кормит Уточку 🦆

Гонка вооружений, в которой детекторы отстают

Исследовательские группы по всему миру создают детекторы — по сути, те же ИИ-модели, но обученные искать артефакты в синтетических материалах. Проблема в том, что это гонка вооружений, и генераторы в ней пока впереди.

«Подтверждение подлинности видео, изображений и аудио стало критически важным для общества, но системы детектирования пока не справляются с этой задачей. Мы считаем, что отчасти дело в том, как эти системы оцениваются», — говорит Рока.

Механика провала выглядит буднично. Разработчики берут много примеров, сгенерированных небольшим набором моделей, и обучают на них детектор. Такой детектор почти наверняка плохо обобщается на контент от других генераторов — а генеративный ИИ развивается настолько быстро, что «другие генераторы» появляются раньше, чем выходит статья.

В результате система отлично показывает себя на собственном обучающем наборе и на устоявшихся бенчмарках, но проваливается в реальных условиях. «ИИ в лаборатории — это не ИИ в дикой природе», — резюмирует Рока.

Примеры сгенерированных нейросетями изображений из бенчмарка MNWЭти сгенерированные ИИ изображения входят в бенчмарк Microsoft-Northwestern-Witness, задача которого — дать детекторам как можно более разнообразный материал для проверки. Источник изображения — spectrum.ieee.org

Что именно даёт бенчмарк MNW

Разделение ролей между участниками проекта авторы считают принципиальным. «Вместе эти точки зрения — академическая, индустриальная и практическая некоммерческая — дают более полный подход. В одиночку никто из нас этого бы не сделал», — говорит Марко Постильоне, постдок Северо-Западного университета.

Вторая особенность набора — учёт постобработки. Постильоне подчёркивает, что попавшие в сеть фальшивые видео, аудио и изображения почти всегда проходят через изменение размера, кадрирование и сжатие; кроме того, контент нередко правят намеренно, чтобы затруднить распознавание. Поэтому в MNW примеры от разных генераторов дополнительно прогоняются через разные варианты постобработки — детектор проверяется в условиях, приближенных к тому, что реально циркулирует в мессенджерах и соцсетях.

Третье и, возможно, самое важное — набор данных не статичен. Команда планирует обновлять его дважды в год, весной и осенью, чтобы отражать и артефакты новых генераторов, и свежие приёмы обмана детекторов.

реклама кормит Уточку 🦆

Почему детектор не выносит приговор

Есть и методологическая сложность, о которой редко говорят в пресс-релизах: практически любой детектор выдаёт не бинарный вердикт, а вероятность. Порог, на котором эта вероятность превращается в решение «подделка», выбирает разработчик, и от него напрямую зависит соотношение ложных срабатываний и пропусков. Для журналистики и тем более для юридической практики цена двух видов ошибок разная — назвать подлинную запись фальшивой не менее опасно, чем пропустить фейк.

Поэтому распознавание артефактов рассматривают не как самостоятельное решение, а как один слой защиты. Параллельно развивается противоположный по логике подход — маркировка происхождения контента, когда камера или редактор криптографически подписывают файл и историю его изменений; наиболее известная инициатива такого рода — стандарт C2PA. Детектор артефактов отвечает на вопрос «похоже ли это на генерацию», проверка происхождения — на вопрос «откуда это вообще взялось», и вместе они закрывают заметно больше сценариев, чем по отдельности.

Обратная сторона открытости

Исследователи признают риск: набор, созданный для честного тестирования детекторов, теоретически может быть использован и для разработки новых способов обхода распознавания. Это классическая дилемма публикаций по безопасности — открытость помогает защите, но одновременно снижает порог входа для атакующего.

Авторы считают, что проблема дипфейков слишком серьёзна, чтобы решать её в закрытом режиме. «Наша цель с MNW — внести вклад в общее дело: поднять стандарты, поощрить прозрачность и помочь тому, чтобы вместе с развитием генеративного ИИ развивалась и наша способность оценивать подлинность», — говорит Рока.

Практический вывод для тех, кто собирается внедрять готовый детектор: цифры точности из статьи или из рекламного материала почти ничего не говорят о поведении модели на реальном потоке. Осмысленная проверка — это прогон на материале, которого модель не видела, желательно сжатом и перекодированном так, как это делают мессенджеры. Именно такую проверку и пытается стандартизировать MNW.