Чем больше в сети контента, сгенерированного нейросетями, тем сложнее — и тем важнее — отличать настоящее изображение, аудиозапись или видео от подделки. Чтобы у разработчиков детекторов появился честный измерительный инструмент, объединённая команда исследователей из Microsoft, Северо-Западного университета (Эванстон, штат Иллинойс) и некоммерческой организации Witness собрала новый набор данных из сгенерированной ИИ медиа-продукции.
Источник изображения — spectrum.ieee.org
Witness — организация, которая помогает активистам и журналистам разбираться с проблемами, порождёнными синтетическим контентом, и именно её опыт «в поле» отличает эту работу от чисто лабораторных исследований. Набор данных получил название MNW — по первым буквам трёх участников (Microsoft-Northwestern-Witness), — а его описание опубликовано 10 апреля в журнале IEEE Intelligent Systems.
Ключевая идея — намеренное разнообразие. Выборка собиралась так, чтобы максимально полно отражать реальный ландшафт генеративных моделей, а не узкий срез из нескольких популярных сервисов.
Почему подделки стало так трудно ловить
Томас Рока, ведущий научный сотрудник Microsoft, занимающийся вопросами безопасности генеративного ИИ, отмечает, что качество синтетического контента растёт непрерывно. Сегодня практически любой человек может с помощью обычного приложения на смартфоне сгенерировать голосовое сообщение, воспроизводящее чужой голос, либо изображение или видео, имитирующее чужую внешность.
Ущерб от таких материалов варьируется от кражи личности и мошеннических схем до создания интимных изображений без согласия человека и материалов с сексуализированным насилием над детьми. Для СНГ-аудитории особенно узнаваем первый сценарий: подделка голоса родственника или руководителя уже стала рабочим инструментом телефонных мошенников, и распознавание таких записей — не академическая задача, а вопрос прикладной безопасности.
При этом генераторы не идеальны. Они оставляют артефакты — мелкие следы и сигналы, по которым подделку можно опознать. «Артефактами могут быть распределения шума, несогласованность между соседними участками пикселей, разрывы в аудиосигнале и другие нерегулярности», — поясняет Рока.
Гонка вооружений, в которой детекторы отстают
Исследовательские группы по всему миру создают детекторы — по сути, те же ИИ-модели, но обученные искать артефакты в синтетических материалах. Проблема в том, что это гонка вооружений, и генераторы в ней пока впереди.
«Подтверждение подлинности видео, изображений и аудио стало критически важным для общества, но системы детектирования пока не справляются с этой задачей. Мы считаем, что отчасти дело в том, как эти системы оцениваются», — говорит Рока.
Механика провала выглядит буднично. Разработчики берут много примеров, сгенерированных небольшим набором моделей, и обучают на них детектор. Такой детектор почти наверняка плохо обобщается на контент от других генераторов — а генеративный ИИ развивается настолько быстро, что «другие генераторы» появляются раньше, чем выходит статья.
В результате система отлично показывает себя на собственном обучающем наборе и на устоявшихся бенчмарках, но проваливается в реальных условиях. «ИИ в лаборатории — это не ИИ в дикой природе», — резюмирует Рока.
Эти сгенерированные ИИ изображения входят в бенчмарк Microsoft-Northwestern-Witness, задача которого — дать детекторам как можно более разнообразный материал для проверки. Источник изображения — spectrum.ieee.org
Что именно даёт бенчмарк MNW
Разделение ролей между участниками проекта авторы считают принципиальным. «Вместе эти точки зрения — академическая, индустриальная и практическая некоммерческая — дают более полный подход. В одиночку никто из нас этого бы не сделал», — говорит Марко Постильоне, постдок Северо-Западного университета.
Вторая особенность набора — учёт постобработки. Постильоне подчёркивает, что попавшие в сеть фальшивые видео, аудио и изображения почти всегда проходят через изменение размера, кадрирование и сжатие; кроме того, контент нередко правят намеренно, чтобы затруднить распознавание. Поэтому в MNW примеры от разных генераторов дополнительно прогоняются через разные варианты постобработки — детектор проверяется в условиях, приближенных к тому, что реально циркулирует в мессенджерах и соцсетях.
Третье и, возможно, самое важное — набор данных не статичен. Команда планирует обновлять его дважды в год, весной и осенью, чтобы отражать и артефакты новых генераторов, и свежие приёмы обмана детекторов.
Почему детектор не выносит приговор
Есть и методологическая сложность, о которой редко говорят в пресс-релизах: практически любой детектор выдаёт не бинарный вердикт, а вероятность. Порог, на котором эта вероятность превращается в решение «подделка», выбирает разработчик, и от него напрямую зависит соотношение ложных срабатываний и пропусков. Для журналистики и тем более для юридической практики цена двух видов ошибок разная — назвать подлинную запись фальшивой не менее опасно, чем пропустить фейк.
Поэтому распознавание артефактов рассматривают не как самостоятельное решение, а как один слой защиты. Параллельно развивается противоположный по логике подход — маркировка происхождения контента, когда камера или редактор криптографически подписывают файл и историю его изменений; наиболее известная инициатива такого рода — стандарт C2PA. Детектор артефактов отвечает на вопрос «похоже ли это на генерацию», проверка происхождения — на вопрос «откуда это вообще взялось», и вместе они закрывают заметно больше сценариев, чем по отдельности.
Обратная сторона открытости
Исследователи признают риск: набор, созданный для честного тестирования детекторов, теоретически может быть использован и для разработки новых способов обхода распознавания. Это классическая дилемма публикаций по безопасности — открытость помогает защите, но одновременно снижает порог входа для атакующего.
Авторы считают, что проблема дипфейков слишком серьёзна, чтобы решать её в закрытом режиме. «Наша цель с MNW — внести вклад в общее дело: поднять стандарты, поощрить прозрачность и помочь тому, чтобы вместе с развитием генеративного ИИ развивалась и наша способность оценивать подлинность», — говорит Рока.
Практический вывод для тех, кто собирается внедрять готовый детектор: цифры точности из статьи или из рекламного материала почти ничего не говорят о поведении модели на реальном потоке. Осмысленная проверка — это прогон на материале, которого модель не видела, желательно сжатом и перекодированном так, как это делают мессенджеры. Именно такую проверку и пытается стандартизировать MNW.












