Исследователи из University of California, Riverside вместе с инженерами YouTube и Google DeepMind разработали SAGA — систему, которая не только распознает сгенерированное видео, но и пытается определить, какой именно ИИ его создал. Для рынка это важный шаг: одной пометки «похоже на дипфейк» уже мало, если речь идет о мошенничестве, модерации или проверке личности.
Проект интересен не академической экзотикой, а практикой. Если система умеет связать ролик с конкретным генератором, версией модели и командой-разработчиком, у платформ и служб безопасности появляется не просто сигнал тревоги, а зацепка для расследования.
От бинарной детекции к атрибуции источника
Большинство инструментов на рынке решают базовую задачу: отвечают, настоящее видео или синтетическое. SAGA идет дальше и добавляет атрибуцию источника. В работе авторы описывают пять уровней анализа: проверку на подлинность, тип генерации, версию модели, команду-разработчика и конкретный генератор.
Именно это отличает проект от типичных детекторов дипфейков. Для платформы, которая борется с вредоносными роликами, разница принципиальная: одно дело понять, что видео поддельное, другое — увидеть, какой инструмент чаще всплывает в злоупотреблениях и где у него слабые места в защите.
Как работает SAGA
По данным авторов, систему обучали на публичных наборах данных с видео от 19 генераторов. В выборку вошли и text-to-video, и image-to-video модели. Архитектура построена на трансформерной модели для видео и использует признаки из устойчивой базовой модели компьютерного зрения, чтобы лучше переносить сжатие, перекодирование и другие типичные искажения.
Отдельная часть работы посвящена тому, почему атрибуция вообще возможна. Исследователи говорят о временных сигнатурах: разные генераторы оставляют свои паттерны в том, как меняются кадры во времени. Глаз этого обычно не замечает, но модель может уловить такие следы и использовать их как своего рода цифровой отпечаток.
Еще одна важная деталь: авторы заявляют, что SAGA показывает сильный результат даже при очень небольшом объеме размеченных данных для атрибуции — около 0,5% на класс. Если эта устойчивость подтвердится вне лаборатории, подход станет заметно практичнее для крупных платформ и корпоративных систем проверки.
Где это может пригодиться бизнесу
Наиболее очевидные сценарии — модерация контента, антифрод, KYC-проверки, внутренние расследования и удаленный найм. Если компания опирается на видеозвонок как на подтверждение личности, сама логика проверки уже меняется: теперь мало видеть человека в кадре, нужно понимать, можно ли доверять самому видеопотоку.
Для русскоязычного рынка это особенно актуально у распределенных команд, аутсорсинга и сервисов с удаленной идентификацией. ИБ-команды получают аргумент в пользу более жесткой многофакторной проверки, а разработчики генеративных моделей — дополнительное давление: от них будут ждать не только качества картинки, но и более внятных ограничений против злоупотреблений.
Почему одной детекции уже недостаточно
Индустрия долго жила по простой схеме: генераторы становятся лучше, значит детекторы тоже надо постоянно дообучать. Проблема в том, что эта гонка плохо масштабируется. Моделей много, релизы выходят быстро, а после сжатия и перезаливки видео часть следов вообще теряется.
SAGA предлагает более полезный для рынка поворот: смотреть не только на симптом, но и на источник. Если такой подход приживется, системы безопасности смогут строить вокруг генеративного видео не просто фильтр, а полноценную аналитику угроз.
Следующий шаг очевиден: перенести такие методы из исследовательских датасетов в реальные потоки платформ и корпоративных проверок, где видео уже проходит через монтаж, сжатие и повторные загрузки. Оригинал: ; первоисточник исследования: .