合成影片會在交界處與時間軸上失守。生成模型很擅長做出看起來合理的表面,卻不擅長維持兩個物體相接處的一致性,更不擅長讓那些沒有道理的細節從這一秒到下一秒都長得一模一樣。

這就給了你一個實用的方法:別再盯著臉看,改去檢查邊緣與連續片段。單一格畫面可以毫無破綻,同一個鏡頭連續十秒通常就不行了。

哪些地方最值得優先檢查?

以下按「多常能給出明確答案」排序,不是按「多明顯」排序。

檢查項目 要看什麼 為什麼有效
手與手指 數手指;看手指交叉或握東西的時候 手的關節活動度高、又經常自我遮蔽 —— 是最難維持連貫的幾何結構
耳環與飾品 兩耳不對稱、形狀漂移、從頭髮後面消失再出現時變了樣 小型剛體沒有強烈的先驗,生成模型是一格一格即興編出來的
髮絲與背景的交界 輪廓邊緣上的單根髮絲;融進背景的細碎髮尾 交界處的細緻透明度細節,正是去背瑕疵最集中的地方
說話時的牙齒與舌頭 一句話講到一半牙齒數目與形狀變了;舌頭的形狀 口腔內部的結構經常被逐格重新生成
時間一致性 把同一個鏡頭停在 0 秒、2 秒、4 秒;比對痣、疤、刺青、指甲長度、布料花紋 沒有結構限制的細節會漂移,因為沒有任何東西逼它維持不變
接觸點的皮膚 手壓在皮膚上的地方,或皮膚與布料相接的地方 接觸造成的形變需要物理,而模型只是近似
畫面裡的文字 招牌、包裝、畫面上的字幕 文字是經典的破綻 —— 字形看起來像樣,組起來卻不成詞
眼球反光 兩眼的反光點不一致,或反射出來的東西前後對不上 反射需要一個場景模型,而那個模型並不存在

時間一致性那一列是單一技巧裡最強、也最被低估的。把同一個鏡頭停在幾個不同的時間點,比對某個具體而任意的細節 —— 一顆痣的確切形狀、床單上的花紋、一片指甲的長度。攝影機記錄的是同一個物體;生成模型則是把它重新發明一次。

為什麼現在單張畫面騙得過人?

因為單格畫質正是生成技術研究最用力優化的東西,而在靜態影像上,它大致已經解決了。

那些舊的判斷依據 —— 蠟像般的皮膚、詭異的對稱、扭曲的耳朵 —— 是更早期模型的瑕疵,拿它們去檢查,在瑕疵不存在時只會給你錯誤的安心感。用 2022 年的瑕疵去判斷 2026 年的生成結果,兩個方向的錯誤答案都會下得很有信心。

還沒被同樣徹底解決的是持續性:在攝影機與被攝者都在動的情況下,讓每一個不受約束的細節在幾百格之間保持完全相同。剩下的證據就住在那裡。

實務上要怎麼檢查一致性?

  1. 挑一個連續的鏡頭 —— 中間不能有剪接。剪接會把一切重置,等於直接放生成模型過關。
  2. 在那個鏡頭裡暫停三到四次。
  3. 選一個任意的、非結構性的細節:一顆痣、一叢雀斑、刺青的邊緣、布料印花、指甲形狀、一條飾品鏈。
  4. 在你的幾個暫停點之間比對它。 真實的細節是穩定的。合成的細節會漂移、變形,或消失後以不同的樣子回來。
  5. 換畫面另一個區域的第二個細節再做一次。 一個細節漂移可能是壓縮造成的;兩個就是模式了。
  6. 找一段手從某個東西前面經過的畫面,逐格看過去。遮蔽的交界處,正是連貫性崩掉得最明顯的地方。

臉搜能告訴你一支影片是不是合成的嗎?

不能直接告訴你 —— 而且我們有必要把它能貢獻什麼、不能貢獻什麼講精確。

臉搜是拿你的畫面去和索引裡的臉比對,回傳相似度分數。它給你的是一個來源訊號,不是一份合成與否的判決:

  • 和一位真實、已被索引的女優高度相符,只告訴你這張臉長得像某個真實存在的人。這既符合「這是一部真實作品」,符合「有人把一張臉換到別的畫面上」。它縮小了問題,而不是回答了問題。
  • 找不到相符的結果幾乎什麼都不代表。我們的索引裡有 241,792 張臉,其中 2,333 張跨 106 個站台連到具名女優(我們的索引,2026-08 快照),而那 2,333 位裡有 2,246 位的代表圖只來自單一來源。找不到,更常是覆蓋範圍或畫面品質的問題,而不是合成的證據。

真正有用的組合,是強烈的臉部相符加上前面那些時間性檢查全都失守。那個模式符合「把一位真實女優的樣貌套到生成或替換過的畫面上」—— 而那是很嚴重的事,因為那是未經本人同意做的。

**有一條界線值得講明:**上述任何一項檢查都不構成證明。它們只改變機率。任何人光憑肉眼檢查就給你關於合成媒體的確定答案,都是在誇大證據能支撐的程度。

那自動偵測器呢?

把它們的輸出當成一項參考,不是判決。

偵測器是拿特定幾個生成模型家族的產出訓練出來的,那些家族一改版,準確度就掉。而且它們在你最可能拿去檢查的那種素材上退化得特別嚴重:重新編碼、縮放、加了浮水印的影片 —— 壓縮已經把偵測器賴以判斷的細微統計痕跡摧毀掉了。誤判和漏判都很常見。

究竟退化多少,至少在研究文獻裡是被量測過的。一場與 2025 年某電腦視覺研討會同時舉辦的獨立盲測,最強的參賽作品在未經處理的生成影片上拿到 0.93 AUC,套上一般的後製之後降到 0.74,而在經過螢幕錄影的畫面上大約只有 0.62 —— 最後那個數字離擲銅板已經不遠。另有研究發現,偵測器面對訓練時用過的生成模型能拿到 96% 以上,換成沒看過的就掉到五十幾。

那些都是在受控條件下評測的研究系統。至於你實際碰得到的那些消費端「這是不是 AI?」工具,根本沒有任何經獨立重現的準確率數字 —— 唯一一份確實納入商用影片偵測器的評測,依合約必須把廠商匿名,那正好是可重現性的反面。所以這個頁面不會為任何具名工具引用準確率數字,而一個工具自己宣稱的數字,並沒有給你任何你查得證的東西。

資料來源:SAFE Challenge 影片組(ICCV 2025);GenVidBench 與 Deepfake-Eval-2024 評測;2026-08-03 核對。

為什麼這件事不只是好奇心的問題?

因為未經同意、對真實人物的合成描繪是實質的傷害,而認錯人會讓傷害加倍。

如果一支影片看起來描繪的是一位真實、可辨識的人,而且過不了一致性檢查,負責任的做法是把它當成未經證實的內容、避免再轉發 —— 而不是公開下結論。錯誤地指控一段畫面是合成的,會傷害一位真實的女優;錯誤地假定它是真的,則會讓一份捏造的描繪擴散出去。這兩種錯誤的另一端,都站著一個人。

相關問題


如果你想要的是「來源」那一半的答案,在這裡上傳一格畫面。它會告訴你這張臉是否對得上索引裡的某位女優,並附上分數 —— 偵測在你的瀏覽器裡執行,原圖不會離開你的裝置。