一格堪用的畫面只需要一件事:一張眼睛、鼻子與兩個嘴角都看得見的臉,而且拍得夠銳利,讓這些點能被精確定位。大家會擔心的那些東西 —— 光線、背景、整張圖的解析度 —— 重要性都遠不及這一點。
原因很機械。人臉搜尋會偵測五個特徵點,用它們把臉扭正成標準姿勢,然後緊緊裁切、丟掉其餘部分。只要特徵點看得見而且銳利,這格畫面就行。如果不行,再高的畫質也救不回來。
具體來說,什麼讓一格畫面好或壞?
判斷那張臉,不是判斷那張圖。
| 因素 | 好 | 勉強 | 失敗 |
|---|---|---|---|
| 頭部角度 | 正面到轉約 30° | 轉 30–45° | 很硬的側臉、後腦勺 |
| 遮擋 | 整張臉都看得見 | 頭髮蓋住一隻眼 | 手、物體或濃重陰影蓋住眼睛或嘴 |
| 銳利度 | 靜止或慢動作 | 輕微模糊 | 動態模糊把五官抹開 |
| 臉在畫面裡的大小 | 臉佔了畫面相當大的比例 | 中景 | 遠景,臉只有幾十個像素寬 |
| 臉上的光線 | 均勻,亮或暗都可以 | 一側在陰影裡 | 剪影、過曝的高光 |
| 壓縮 | 播放器的原生截圖 | 重新存過的 JPEG | 截圖的截圖、明顯的壓縮瑕疵 |
| 背景 | 無關 | 無關 | 無關 |
最後那一列不是在開玩笑 —— 它是整張表上最有用的一項。人們會因為房間又暗又亂就把畫面丟掉。對齊會把整個房間裁光。判斷那張臉就好。
要截一張,步驟是什麼?
- 拖到女優面向鏡頭的那一刻。 對話、開場戲與反應鏡頭通常是最豐富的來源。往前拖五秒不花什麼成本;跟一格爛畫面硬拚的代價則很高。
- 完全暫停。 暫停下來的畫面是銳利的。播放中抓下來的畫面,尤其是在卡頓的串流上,可能抓到一格解碼到一半的畫面。
- 用你裝置自己的截圖功能,不要拿手機對著螢幕拍。macOS 用內建的截圖;Windows 用剪取工具或 Print Screen;手機用實體按鍵組合。
- 以原生解析度截取。 如果播放器是縮小的視窗,先放到最大或切成全螢幕。你沒截下來的細節,事後救不回來。
- 不要事先裁得只剩臉。 就讓畫面保持截下來的樣子,或者裁得寬鬆一點。對齊器需要特徵點周圍的邊界。
- 有得選的話存成 PNG。 PNG 是無損的;重新存成低品質的 JPEG,會正好在細緻臉部細節所在的位置加上瑕疵。
- 看看還有沒有其他值得一試的臉。 如果場景裡不只一個人,你辨識的機會就不只一次。
為什麼人一眼就認得出來的側臉,機器卻會失敗?
因為轉過去的頭把對齊器需要的特徵點藏起來了,而編碼器訓練時看到的,壓倒性地都是沒有轉那麼多的臉。
在很硬的側臉裡,一隻眼睛看不見,一個嘴角也常被遮住。對齊於是去估算它看不到的位置,扭正的結果就是錯的。跑出來的向量,是對一張並不真正存在的臉的自信描述。它照樣會回傳結果 —— 只是回傳錯的那些,而且分數看起來還過得去。
實用的原則是:如果你兩隻眼睛都看得清楚,就繼續。如果只看得到一隻,去找另一格畫面。
好幾格畫面之中,該挑哪一格?
有得挑的時候,就依「有多少身分訊號能撐過整條流程」來排序。
| 優先序 | 畫面類型 | 為什麼 |
|---|---|---|
| 1 | 特寫、正面、暫停、打光良好 | 特徵點精確度最高 |
| 2 | 中景、正面、銳利 | 像素較少,但幾何完好 |
| 3 | 中等角度的特寫 | 角度會損失準確度,但救得回來 |
| 4 | 封面圖或宣傳劇照,如果找得到的話 | 常常正是索引建構時用的那種素材 |
| 5 | 遠景或很斜的角度 | 最後手段 |
第 4 列值得知道。索引條目是用封面與劇照建起來的 —— 我們的索引裡有 241,792 張臉,取自 106 個站台上這類素材(我們的索引,2026-08 快照)。如果你找得到封面圖而不是影片畫面,你就是拿更接近索引本身分布的素材在搜尋,分數通常也會反映這一點。
怎麼知道這格畫面夠不夠好?
讀分數,不要讀排名。餘弦相似度的範圍是 0 到 1,我們針對影片截圖校準出來的門檻是 0.40。
如果你最好的結果落在門檻底下一大截,第一個該懷疑的是這格畫面 —— 而不是索引。不管對的人在不在索引裡,向量搜尋都會回傳它最接近的候選,所以一串低分同時可以解讀成「畫面不好」或「沒被索引」。同一個人的第二格畫面能免費解掉這個歧義,這也是為什麼那永遠是下一步。
**值得講明的邊界:**就算是完美的畫面,也找不到我們從沒索引過的人,而我們的來源很集中 —— 2,333 位具名女優裡有 2,246 位,代表圖來自同一個站台。一張好截圖能把你的機會拉到最大;它變不出覆蓋範圍。
相關問題
只要你有一格兩隻眼睛都看得見、也沒有動態模糊的畫面,就在這裡上傳。偵測在你的瀏覽器裡執行,所以你會立刻知道有沒有偵測到臉 —— 如果沒有,那就什麼都沒送出去。