搜尋失敗幾乎一定是四種原因之一,而它們各自需要不同的處理方式。判斷你撞到的是哪一種大概只要一分鐘,能省下你用略微不同的拼法把同一個查詢重打好幾次。
這四種是:輸入太弱、身分未命名、不在索引裡、名字的形式不對。它們的症狀差得夠多,你通常光看結果畫面就能分辨。
我怎麼知道自己撞到的是哪一種失敗?
去讀結果,不要只看到「沒有你想要的答案」。
| 你看到的畫面 | 最可能的原因 | 該怎麼做 |
|---|---|---|
| 「未偵測到人臉」 | 輸入太弱 | 換一個畫面;參考截圖指南 |
| 有回傳結果,但全都低於 0.40 | 輸入太弱,或不在索引裡 | 先換第二個畫面重試 |
| 分數很高,但結果沒有名字 | 索引裡的未命名身分 | 用回傳的參考圖與相似臉清單 |
| 找到正確的女優,但不是這部片 | 這部片不在索引裡,或名字形式不同 | 改用番號搜,或翻她的作品列表 |
| 番號搜尋什麼都沒有 | 名字形式不對,或格式打錯 | 檢查分隔符號、字首與字尾的慣例 |
第二列是最常被誤讀的一列。有一串結果,並不等於答案在裡面 —— 向量檢索一定會回傳它最近的幾個候選,即使正確的那個人從來沒被索引過。
為什麼分數很高的比對回來卻沒有名字?
因為「把一張臉索引起來」和「認出這張臉是誰」是兩道工序,而第二道不會自動發生。
我們的索引裡有 241,792 張臉,但只有 2,333 張連上了具名的女優紀錄(我們的索引,2026-08 快照)。這個落差不是 bug —— 大多數被索引的臉來自封面與截圖,那些影像上並沒有附著可靠的姓名。光是我們的相似女優資料裡,就有 7,004 筆參照指向沒有名字的身分,散落在 1,899 位具名女優的相似臉清單裡。
實務上:如果你拿到一個高分但沒有名字的結果,你已經找到對的那張臉了。接下來你需要另一條路去拿到名字 —— 它出自的那張參考圖、它被抓取的那個站台,或是這個身分最靠近的那幾位具名女優。
為什麼一部片會整個不在索引裡?
因為沒有任何索引涵蓋得了全部,而我們這個索引有一個你該知道的形狀。
我們從 106 個站台索引人臉。但我們 2,333 位具名女優裡,有 2,246 位的代表圖來自同一個站台。這是極重的集中,也定義了盲區在哪裡:
- 只在我們沒有涵蓋的片庫上流通過的作品
- 早於我們所索引來源年代的舊素材
- 素人與個人製作的內容,這類東西很少被以一致的中介資料聚合起來
- 在我們看到之前,就已經從我們索引的每一個來源被下架的作品
這些都不會產生錯誤訊息。它們產生的是一串看起來很像樣、但都是錯的人的清單,這也是為什麼讀分數比讀排名順序更重要。
為什麼同一部片會有好幾個名字?
因為一部作品在片庫之間流轉時會不斷累積識別碼,而只搜其中一種形式就會漏掉其他的。
| 形式 | 大致長相 | 出現的地方 |
|---|---|---|
| 片商番號 | 字母 + 數字,常帶連字號 | 封面、官方片庫 |
| 替代番號 | 相同字母,不同分隔符號或補零方式 | 聚合站、資料庫 |
| 日文片名 | 原始發行片名 | 官方清單 |
| 譯名 | 英文或機器翻譯的 | 國際聚合站 |
| 帶字尾的變體 | 番號後面再加一個標記 | 再版、格式變體 |
翻譯是一個很大、卻被嚴重低估的漏失來源。在我們自己的女優資料裡,有 197 筆紀錄的英文寫法與主要姓名形式不同 —— 也就是說,同一個人會因為你從哪個來源出發,而以兩種拼法被找到。同樣的分歧也發生在片名上,而且規模更大。
最有效率的嘗試順序是什麼?
從最便宜的往最昂貴的一路升級:
- 換第二個畫面。 免費、花十秒,而且能解掉很大一部分由姿勢或模糊造成的失敗。
- 換場景裡的另一個人。 多人場景等於給了你好幾次辨識機會。
- 番號,如果看得到的話。 番號被燒在片頭、封面與浮水印上的頻率,比一般人以為的高。有番號,就把影像問題轉成文字問題。
- 女優的作品列表。 一旦有了名字,就用場景細節去縮小範圍 —— 服裝、髮長、場景、畫面上的文字。
- 暫時接受它就是不在。 有些素材確實不在你搆得到的任何索引裡。過幾個月再查一次,比今天把同一個查詢換句話再打一遍有用得多。
關於誠實的一點說明: 我們寧可告訴你索引裡沒有這個東西,也不願給你一個自信滿滿的錯誤答案。這也是為什麼每一筆結果上都標著分數。一個永遠都找得到東西的工具並沒有比較好 —— 它只是失敗得比較安靜。
相關問題
如果你還沒試過換第二個畫面,那是收益最高的下一步。上傳到這裡 —— 偵測在你的瀏覽器裡執行,原圖不會離開你的裝置,而每一筆結果上的分數會告訴你它到底有沒有意義。