Синтетическое видео сыплется на границах и во времени. Генераторы хорошо создают правдоподобную поверхность, плохо держат согласованность там, где один объект встречается с другим, и ещё хуже сохраняют произвольные детали одинаковыми от секунды к секунде.

Отсюда практический метод: перестаньте вглядываться в лицо и начните проверять края и последовательности. Отдельный кадр может быть безупречен. Десять секунд одного плана — обычно нет.

Что проверять в первую очередь?

Порядок — по тому, как часто проверка даёт ясный ответ, а не по её очевидности.

Проверка На что смотреть Почему работает
Руки и пальцы Сосчитайте пальцы; следите за пальцами, которые перекрещиваются или что-то сжимают У кистей высокая подвижность и постоянное самоперекрытие — самая трудная геометрия для связности
Серьги и украшения Асимметрия между ушами, уплывающая форма, предметы, которые скрываются за волосами и возвращаются другими У мелких жёстких предметов нет сильного априорного представления, генератор придумывает их заново в каждом кадре
Пряди волос на фоне Отдельные волоски по краю силуэта; прядки, сливающиеся с фоном Тонкая полупрозрачная деталь на границе — там и скапливаются артефакты матирования
Зубы и язык при речи Число и форма зубов, меняющиеся посреди фразы; геометрия языка Внутренности рта часто перерисовываются от кадра к кадру
Согласованность во времени Остановите один план на 0-й, 2-й и 4-й секунде; сравните родинки, шрамы, татуировки, длину ногтей, рисунок ткани Детали без структурных ограничений уплывают, потому что ничто не заставляет их сохраняться
Кожа в точках контакта Там, где рука давит на кожу или кожа встречается с тканью Деформация при контакте требует физики, которую модель только приблизительно изображает
Текст в кадре Вывески, упаковка, экранные подписи Текст — классический провал: правдоподобные начертания букв, бессвязные слова
Отражения в глазах Блики, различающиеся между глазами или не отражающие ничего осмысленного Отражения требуют модели сцены, которой не существует

Строка про согласованность во времени — самый сильный отдельный приём и самый недоиспользуемый. Остановите один и тот же план в нескольких точках и сравните конкретную, произвольно выбранную деталь: точную форму родинки, рисунок на простыне, длину ногтя. Камера записывает один и тот же объект; генератор изобретает его заново.

Почему отдельные кадры теперь обманывают людей?

Потому что качество отдельного кадра — то, что исследования генерации оптимизируют упорнее всего, и для неподвижных изображений задача в основном решена.

Старые признаки — восковая кожа, неестественная симметрия, покорёженные уши — это артефакты прежних моделей, и их отсутствие даёт ложную уверенность. Судить о генерации 2026 года по артефактам 2022-го — верный способ уверенно ошибиться в обе стороны.

Что не решено так же основательно, так это устойчивость: удержать каждую ничем не связанную деталь одинаковой на протяжении сотен кадров, пока движутся камера и объект. Именно там и осталась доказательная база.

Как проверять согласованность на практике?

  1. Возьмите один непрерывный план — без склеек. Склейка сбрасывает всё и даёт генератору поблажку.
  2. Поставьте паузу в трёх-четырёх точках этого плана.
  3. Выберите произвольную, неструктурную деталь: родинку, скопление веснушек, край татуировки, принт на ткани, форму ногтя, звено украшения.
  4. Сравните её на всех паузах. Настоящая деталь неизменна. Синтетическая уплывает, меняет форму или исчезает и возвращается другой.
  5. Повторите со второй деталью в другой части кадра. Одна уплывающая деталь может быть сжатием; две — уже закономерность.
  6. Посмотрите, как рука проходит перед чем-нибудь, и пройдите этот момент покадрово. Границы перекрытия — там связность рвётся заметнее всего.

Может ли поиск по лицу сказать, синтетическое ли видео?

Напрямую — нет, и здесь важно быть точным в том, что он может и чего не может дать.

Поиск по лицу сравнивает ваш кадр с проиндексированными лицами и возвращает оценки сходства. Это даёт сигнал о происхождении, а не вердикт о синтезе:

  • Сильное совпадение с реальной, проиндексированной актрисой говорит, что лицо похоже на лицо реального человека. Это совместимо и с подлинным релизом, и с подменой лица на чужом материале. Вопрос сужается, но не закрывается.
  • Отсутствие совпадения не говорит почти ничего. В нашем каталоге 241,792 лица, из них 2,333 связаны с актрисой, у которой есть имя, со 106 сайтов (наш каталог, срез 2026-08), и у 2,246 из этих 2,333 представительная фотография взята из одного источника. Отсутствие гораздо чаще означает пробел в охвате или плохой кадр, чем признак синтеза.

Полезно сочетание: сильное совпадение по лицу плюс провал на перечисленных выше проверках во времени. Такая картина согласуется с тем, что внешность реальной актрисы наложили на сгенерированный или подменённый материал, — а это серьёзно, потому что делается без согласия.

Границу стоит проговорить: ни одна из этих проверок не является доказательством. Они сдвигают вероятность. Тот, кто обещает уверенность в синтетичности материала на основании одного визуального осмотра, говорит больше, чем позволяют данные.

А что с автоматическими детекторами?

Считайте их вывод одним из входных данных, а не приговором.

Детекторы обучаются на выходе конкретных семейств генераторов и теряют точность по мере смены этих семейств. Они также деградируют ровно на том материале, который вы, скорее всего, и будете рассматривать: перекодированном, изменённом по размеру, с водяными знаками, — там сжатие уже уничтожило тонкие статистические следы, на которые детекторы опираются. И ложные срабатывания, и пропуски встречаются часто.

Насколько сильно они деградируют, по крайней мере в исследовательской литературе, измерено. В независимой слепой оценке, проведённой при конференции по компьютерному зрению 2025 года, сильнейший участник набрал 0.93 AUC на нетронутом сгенерированном видео, 0.74 после обычной постобработки и примерно 0.62 на материале, снятом с экрана, — последнее уже недалеко от подбрасывания монетки. Другая работа показала, что детекторы, дающие больше 96% против генератора, на котором обучались, падают до середины пятого десятка против генератора, которого не видели.

Это исследовательские системы, оценённые в контролируемых условиях. Для потребительских инструментов в духе «это ИИ?», до которых вы реально можете дотянуться, независимо воспроизведённых цифр точности не существует вовсе: единственная оценка, куда всё же вошли коммерческие видеодетекторы, была по договору обязана анонимизировать поставщиков, что противоположно воспроизводимости. Поэтому на этой странице не приводится ни одной цифры точности для конкретного инструмента, а инструмент, который приводит такую цифру о себе сам, не сообщил вам ничего проверяемого.

Источники: видеотрек SAFE Challenge (ICCV 2025); оценки GenVidBench и Deepfake-Eval-2024; проверено 2026-08-03.

Почему это важно не только из любопытства?

Потому что синтетические изображения реальных людей без их согласия — это настоящий вред, а ошибочное опознание его усугубляет.

Если видео выглядит как изображение реального, узнаваемого человека и не проходит проверки на согласованность, ответственная реакция — считать его непроверенным и не распространять дальше, а не публиковать вывод. Ошибочное обвинение в том, что материал синтетический, бьёт по реальной актрисе; ошибочное допущение, что он подлинный, разносит сфабрикованное изображение. На другом конце обеих ошибок стоит человек.

Смежные вопросы


Если вам нужен ответ на ту половину вопроса, которая про происхождение, загрузите кадр здесь. Он покажет, совпадает ли лицо с проиндексированной актрисой, и с какой оценкой, — детекция идёт в браузере, а оригинал никогда не покидает ваше устройство.