合成视频会在交界处和时间轴上失守。生成模型很擅长做出看起来合理的表面,却不擅长维持两个物体相接处的一致性,更不擅长让那些没什么道理的细节从这一秒到下一秒长得一模一样。

这就给了你一个实用的方法:别再盯着脸看,改去检查边缘和连续片段。单帧画面可以毫无破绽,同一个镜头连续十秒通常就不行了。

哪些地方最值得优先检查?

下面按「多常能给出明确答案」排序,不是按「多明显」排序。

检查项 看什么 为什么有效
手和手指 数手指;看手指交叉或握东西的时候 手的关节活动度高、又经常自我遮挡——是最难保持连贯的几何结构
耳环和首饰 两耳不对称、形状漂移、从头发后面消失再出现时变了样 小型刚体没有强先验,生成模型是一帧一帧即兴编出来的
发丝与背景的交界 轮廓边缘上的单根发丝;融进背景的细碎发梢 交界处细微的透明度细节,正是抠像瑕疵最集中的地方
说话时的牙齿和舌头 一句话说到一半牙齿数目和形状变了;舌头的形状 口腔内部的结构经常被逐帧重新生成
时间一致性 把同一个镜头停在 0 秒、2 秒、4 秒;比对痣、疤、纹身、指甲长度、布料花纹 没有结构约束的细节会漂移,因为没有任何东西逼它保持不变
接触点的皮肤 手压在皮肤上的地方,或皮肤与布料相接的地方 接触造成的形变需要物理,而模型只是近似
画面里的文字 招牌、包装、屏幕上的字幕 文字是经典破绽——字形看着像样,拼起来却不成词
眼球反光 两眼的高光点不一致,或者反射的东西前后对不上 反射需要一个场景模型,而那个模型并不存在

时间一致性那一行是单项技巧里最强、也最被低估的。把同一个镜头停在几个不同的时间点,比对某个具体而任意的细节——一颗痣的确切形状、床单上的花纹、一片指甲的长度。摄像机记录的是同一个物体;生成模型则是把它重新发明一遍。

为什么现在单张画面骗得过人?

因为单帧画质正是生成技术研究最下力气优化的东西,而在静态图像上,它基本已经解决了。

那些老的判断依据——蜡像般的皮肤、诡异的对称、扭曲的耳朵——是更早期模型的瑕疵,拿它们去检查,在瑕疵不存在时只会给你错误的安心感。用 2022 年的瑕疵去判断 2026 年的生成结果,两个方向的错误答案都会下得很有信心。

还没被同样彻底解决的是持续性:在摄像机和被摄者都在动的情况下,让每一个不受约束的细节在几百帧之间保持完全相同。剩下的证据就藏在那里。

实际操作中怎么检查一致性?

  1. 挑一个连续的镜头——中间不能有剪辑。剪辑会把一切重置,等于直接放生成模型过关。
  2. 在那个镜头里暂停三到四次。
  3. 选一个任意的、非结构性的细节:一颗痣、一片雀斑、纹身的边缘、布料印花、指甲形状、一条首饰链。
  4. 在这几个暂停点之间比对它。 真实的细节是稳定的。合成的细节会漂移、变形,或者消失后以不同的样子回来。
  5. 换画面另一个区域的第二个细节再做一次。 一个细节漂移可能是压缩造成的;两个就是规律了。
  6. 找一段手从某个东西前面经过的画面,逐帧看过去。遮挡的交界处,正是连贯性崩得最明显的地方。

人脸搜索能告诉你一部视频是不是合成的吗?

不能直接告诉你——而且有必要把它能贡献什么、不能贡献什么讲精确。

人脸搜索是拿你的画面去和索引里的脸比对,返回相似度分数。它给你的是一个来源信号,不是一份合成与否的判决:

  • 和一位真实、已被索引的女优高度匹配,只说明这张脸长得像某个真实存在的人。这既符合「这是一部真实作品」,符合「有人把一张脸换到了别的画面上」。它缩小了问题,而不是回答了问题。
  • 找不到匹配结果几乎什么都说明不了。我们的索引里有 241,792 张脸,其中 2,333 张跨 106 个站点关联到具名女优(我们的索引,2026-08 快照),而那 2,333 位里有 2,246 位的代表图只来自单一来源。找不到,更常是覆盖范围或画面质量的问题,而不是合成的证据。

真正有用的组合,是强烈的人脸匹配加上前面那些时间性检查全部失守。那种模式符合「把一位真实女优的样貌套到生成或替换过的画面上」——而那是很严重的事,因为它是未经本人同意做的。

**有一条边界值得说明:**上述任何一项检查都不构成证明。它们只改变概率。任何人光凭肉眼检查就给你关于合成媒体的确定答案,都是在夸大证据能支撑的程度。

那自动检测器呢?

把它们的输出当成一项参考,不是判决。

检测器是拿特定几个生成模型家族的产出训练出来的,那些家族一换代,准确度就掉。而且它们在你最可能拿去检查的那种素材上退化得特别严重:重新编码、缩放、加了水印的视频——压缩已经把检测器赖以判断的细微统计痕迹摧毁了。误判和漏判都很常见。

到底退化多少,至少在研究文献里被测量过。一场与 2025 年某计算机视觉会议同期举办的独立盲测,最强的参赛作品在未经处理的生成视频上拿到 0.93 AUC,套上普通后期处理之后降到 0.74,而在经过录屏的画面上大约只有 0.62——最后那个数字离扔硬币已经不远了。另有研究发现,检测器面对训练时用过的生成模型能拿到 96% 以上,换成没见过的就掉到五十几。

那些都是在受控条件下评测的研究系统。至于你实际接触得到的那些消费端「这是不是 AI?」工具,根本没有任何经独立复现的准确率数字——唯一一份确实纳入了商用视频检测器的评测,按合约必须把厂商匿名,那正好是可复现性的反面。所以这个页面不会为任何具名工具引用准确率数字,而一个工具自己宣称的数字,并没有给你任何你能查证的东西。

资料来源:SAFE Challenge 视频组(ICCV 2025);GenVidBench 与 Deepfake-Eval-2024 评测;2026-08-03 核对。

为什么这件事不只是好奇心的问题?

因为未经同意、针对真实人物的合成描绘是实实在在的伤害,而认错人会让伤害叠加。

如果一部视频看上去描绘的是一位真实、可辨认的人,而且过不了一致性检查,负责任的做法是把它当成未经证实的内容、避免再转发——而不是公开下结论。错误地指控一段画面是合成的,会伤害一位真实的女优;错误地认定它是真的,则会让一份捏造的描绘扩散出去。这两种错误的另一端,都站着一个人。

相关问题


如果你想要的是「来源」那一半的答案,就在这里上传一帧画面。它会告诉你这张脸是否对得上索引里的某位女优,并附上分数——检测在你的浏览器里执行,原图不会离开你的设备。