一格堪用的畫面只需要一件事:一張眼睛、鼻子與兩個嘴角都看得見的臉,而且拍得夠銳利,讓這些點能被精確定位。大家會擔心的那些東西 —— 光線、背景、整張圖的解析度 —— 重要性都遠不及這一點。

原因很機械。人臉搜尋會偵測五個特徵點,用它們把臉扭正成標準姿勢,然後緊緊裁切、丟掉其餘部分。只要特徵點看得見而且銳利,這格畫面就行。如果不行,再高的畫質也救不回來。

具體來說,什麼讓一格畫面好或壞?

判斷那張臉,不是判斷那張圖。

因素 勉強 失敗
頭部角度 正面到轉約 30° 轉 30–45° 很硬的側臉、後腦勺
遮擋 整張臉都看得見 頭髮蓋住一隻眼 手、物體或濃重陰影蓋住眼睛或嘴
銳利度 靜止或慢動作 輕微模糊 動態模糊把五官抹開
臉在畫面裡的大小 臉佔了畫面相當大的比例 中景 遠景,臉只有幾十個像素寬
臉上的光線 均勻,亮或暗都可以 一側在陰影裡 剪影、過曝的高光
壓縮 播放器的原生截圖 重新存過的 JPEG 截圖的截圖、明顯的壓縮瑕疵
背景 無關 無關 無關

最後那一列不是在開玩笑 —— 它是整張表上最有用的一項。人們會因為房間又暗又亂就把畫面丟掉。對齊會把整個房間裁光。判斷那張臉就好。

要截一張,步驟是什麼?

  1. 拖到女優面向鏡頭的那一刻。 對話、開場戲與反應鏡頭通常是最豐富的來源。往前拖五秒不花什麼成本;跟一格爛畫面硬拚的代價則很高。
  2. 完全暫停。 暫停下來的畫面是銳利的。播放中抓下來的畫面,尤其是在卡頓的串流上,可能抓到一格解碼到一半的畫面。
  3. 用你裝置自己的截圖功能,不要拿手機對著螢幕拍。macOS 用內建的截圖;Windows 用剪取工具或 Print Screen;手機用實體按鍵組合。
  4. 以原生解析度截取。 如果播放器是縮小的視窗,先放到最大或切成全螢幕。你沒截下來的細節,事後救不回來。
  5. 不要事先裁得只剩臉。 就讓畫面保持截下來的樣子,或者裁得寬鬆一點。對齊器需要特徵點周圍的邊界。
  6. 有得選的話存成 PNG。 PNG 是無損的;重新存成低品質的 JPEG,會正好在細緻臉部細節所在的位置加上瑕疵。
  7. 看看還有沒有其他值得一試的臉。 如果場景裡不只一個人,你辨識的機會就不只一次。

為什麼人一眼就認得出來的側臉,機器卻會失敗?

因為轉過去的頭把對齊器需要的特徵點藏起來了,而編碼器訓練時看到的,壓倒性地都是沒有轉那麼多的臉。

在很硬的側臉裡,一隻眼睛看不見,一個嘴角也常被遮住。對齊於是去估算它看不到的位置,扭正的結果就是錯的。跑出來的向量,是對一張並不真正存在的臉的自信描述。它照樣會回傳結果 —— 只是回傳錯的那些,而且分數看起來還過得去。

實用的原則是:如果你兩隻眼睛都看得清楚,就繼續。如果只看得到一隻,去找另一格畫面。

好幾格畫面之中,該挑哪一格?

有得挑的時候,就依「有多少身分訊號能撐過整條流程」來排序。

優先序 畫面類型 為什麼
1 特寫、正面、暫停、打光良好 特徵點精確度最高
2 中景、正面、銳利 像素較少,但幾何完好
3 中等角度的特寫 角度會損失準確度,但救得回來
4 封面圖或宣傳劇照,如果找得到的話 常常正是索引建構時用的那種素材
5 遠景或很斜的角度 最後手段

第 4 列值得知道。索引條目是用封面與劇照建起來的 —— 我們的索引裡有 241,792 張臉,取自 106 個站台上這類素材(我們的索引,2026-08 快照)。如果你找得到封面圖而不是影片畫面,你就是拿更接近索引本身分布的素材在搜尋,分數通常也會反映這一點。

怎麼知道這格畫面夠不夠好?

讀分數,不要讀排名。餘弦相似度的範圍是 0 到 1,我們針對影片截圖校準出來的門檻是 0.40

如果你最好的結果落在門檻底下一大截,第一個該懷疑的是這格畫面 —— 而不是索引。不管對的人在不在索引裡,向量搜尋都會回傳它最接近的候選,所以一串低分同時可以解讀成「畫面不好」或「沒被索引」。同一個人的第二格畫面能免費解掉這個歧義,這也是為什麼那永遠是下一步。

**值得講明的邊界:**就算是完美的畫面,也找不到我們從沒索引過的人,而我們的來源很集中 —— 2,333 位具名女優裡有 2,246 位,代表圖來自同一個站台。一張好截圖能把你的機會拉到最大;它變不出覆蓋範圍。

相關問題


只要你有一格兩隻眼睛都看得見、也沒有動態模糊的畫面,就在這裡上傳。偵測在你的瀏覽器裡執行,所以你會立刻知道有沒有偵測到臉 —— 如果沒有,那就什麼都沒送出去。