沒有哪個平台的搜尋是「普遍最好」的,因為這個領域的搜尋引擎是沿著不同的軸線壞掉的 —— 而哪一種壞法會傷到你,完全取決於你怎麼搜。真正值得擁有的答案,是你自己量出來的那個:用你實際會找的作品,花二十分鐘左右。

以下是這個測試的設計方式,以及更重要的,怎麼讀結果。一次「找不到」可以代表三件完全不同的事,而把它們混為一談,正是多數「某某站搜尋很爛」的說法站不住腳的原因。

我們自己並沒有跨平台跑過這份基準測試,所以這篇文章不給你任何分數。它給你的是一套方法,能產出對你自己的用途有效的分數,而那是唯一轉移得過去的版本。

這個測試實際上包含什麼?

拿 10 到 20 個你已經知道存在的番號,逐一丟進每個平台的搜尋,記下回傳了什麼、以及花了幾個步驟。

組成比數量更重要。全部取自近期大片商作品的測試集,只會告訴你每個平台都很優秀,因為那是每個引擎都應付得來的簡單情況。要把難的情況也建進去:

測試項目類型 幾個 它在探測什麼
近期、大片商 3 基準線 —— 到哪裡都該成功
五年以上的舊片 3 片庫與索引有沒有保留舊作
較小或小眾的廠牌 3 主流以外的收錄範圍
女優名字,不是番號 2 以人為鍵的索引與藝名處理
日文原文片名,照樣打進去 2 索引裡有沒有原始片名的文字
羅馬拼音片名,不給番號 2 音譯到底有沒有被建索引

每一項都要記三件事:正確的結果有沒有出現、它是在前幾筆還是被埋在後面,以及從搜尋框到作品頁要點幾下。第三欄是大家會忘記的那個,而那正是各平台在日常使用中差別最明顯的地方。

你實際上在測的失敗模式有哪些?

有五種各自不同的機制,會讓引擎漏掉自己明明有的作品。每一種產生的症狀都不同,而這正是讓這個測試變成診斷工具、而不只是計分板的原因。

番號正規化。 番號在整個產業與整個網路上的寫法都不一致 —— 有連字號的、沒有的、補了前導零的、有沒有片商前綴的。引擎要嘛把你打的那串字正規化成它內部的形式,要嘛就不做。光是這一個機制,就解釋了大部分「在這個站可以、在那個站不行」的回報。

書寫系統與音譯。 片名以日文文字存在;英文讀者打的是羅馬拼音。那個拼音對不對得上,取決於平台到底有沒有存它,以及存的是誰的拼法。正確的音譯不只一種,所以這一項會安靜地、而且經常地失敗。

藝名處理。 女優會改藝名。有把藝名關係建模的索引,用任一個名字都會回傳整段職涯;只有一個扁平名字欄位的索引,你剛好打了哪一半,就回傳哪一半。

比對嚴格度。 完全比對的引擎,差一點點就什麼都不回傳。模糊比對的引擎則什麼都回傳得出東西,包括正確答案根本不在的時候 —— 那是另一種失敗,而且可以說更糟,因為它看起來像成功。

收錄範圍。 這部作品根本不在那個片庫裡。這完全不是搜尋失敗,而把它算成搜尋失敗,是這類比較中最常見的錯誤。

怎麼分辨「搜不到」和「根本沒有」?

拿同一個番號,到另一個你已經知道有收錄它的平台上交叉比對。如果在那邊找得到,那第一個平台要不是沒有這部片,就是比對不上你的查詢 —— 再做一個測試就能把這兩者分開。

另一個把手去搜同一部作品:女優的名字、片商的系列名稱,或片名裡一個有辨識度的關鍵字。如果透過那條路徑作品出現了,表示片庫裡有它,壞掉的是番號查詢。如果從任何路徑都找不到,那就是收錄範圍的問題,搜尋品質再好也幫不上忙。

症狀 它告訴你這個引擎的什麼事
番號帶連字號找不到,不帶連字號可以 沒有做輸入正規化 —— 你必須配合它內部的格式
正確結果有出現,但排在一堆不相干的作品下面 比對是有效的;相關性排序很弱
用女優名字只回傳已知作品列表的一部分 藝名處理缺席或不完整
日文片名可以,羅馬拼音什麼都沒有 只有原文文字被建了索引
每一次查詢都回傳看似合理的結果,連亂打的查詢也一樣 模糊比對而且沒有信心度下限 —— 對所有結果都要存疑
用番號、名字、關鍵字都找不到 收錄範圍的問題,不是搜尋失敗
找得到,但要點四下以上才到得了 導覽成本,不是檢索品質 —— 還是值得記下來

亂打查詢那一列值得特別強調。打一個不可能存在的番號 —— 隨機的前綴加數字。一個會為它回傳看起來很有把握的結果的引擎,在你真正要找的東西不存在時也會這樣做,而你將無法分辨這兩種狀況。

遇到搜尋很爛的平台該怎麼辦?

先改你的查詢格式,再考慮換平台 —— 這些失敗大部分是可以從你這一端修掉的。

  • 每一種番號寫法都試過。 有連字號、沒連字號、有前導零、沒前導零、只打前綴。三次嘗試花你十秒,就能解掉最常見的那種失敗。
  • 改搜女優,而不是片名。 以人為鍵的導覽路徑,可以完全繞開番號正規化。
  • 手上有日文原文就用日文原文。 從資料庫條目複製貼上,不要自己打羅馬拼音。
  • 搜一段有辨識度的片段,不要搜完整片名。長的完全比對字串會因為一個字元的差異而失敗;一個罕見的片段通常不會。

如果你手上根本沒有任何文字 —— 只有一張截圖 —— 那麼任何平台的搜尋框都不是對的工具,因為它們全都需要一串你沒有的字。那是另一個問題,要用另一套方法:從一張截圖找出影片

你自己的結果該怎麼解讀?

把這個測試讀成一份側寫,不是一份排名。你要的產出是這種形式的一句話:「平台 A 對舊片處理得好,但把女優名字搞砸了;平台 B 正好相反」 —— 因為那才告訴你哪一種搜尋該打開哪一個站,而那正是大家實際上同時用好幾個平台的方式。

兩個誠實的限制。十五個項目是診斷樣本,不是統計樣本,所以不要把它換算成百分比。而你的測試集是從你自己的興趣裡挑出來的,所以結果對你有效,不能推廣 —— 這正是為什麼一份公開的通用排名,本來就幫不了你。

相關問題


我們索引的平台,以及各自涵蓋什麼,都列在我們的平台頁上。