這個領域裡的資料庫,並不是同一份清單的幾個競爭版本。它們是四種不同的紀錄,從不同的來源、為了不同的目的建起來,而每一種都在一小組欄位上具有權威性,出了那個範圍就不可靠。
真正的技能不是挑一個網站,而是知道你眼前看的是哪一類,好判斷它哪些欄位可信。販售平台知道自己賣什麼,其餘一無所知。社群資料庫知道更多作品,也錯得更多。兩者都不是在騙你;它們本來就是為了回答不同的問題而建的。
資料庫的四大類是哪四類?
這四類是:販售平台片庫、社群中繼資料庫、以女優為中心的索引,以及圖片或臉部索引。它們的差別在於資料從哪裡來,而那決定了它們所有的失效方式。
| 類別 | 資料來源 | 最擅長 | 已知的弱點 |
|---|---|---|---|
| 販售平台片庫 | 賣家自己的商品資料 | 正規編號、官方標題、封面圖、目前買得到什麼 | 只涵蓋該賣家有賣的東西;下架的作品可能整筆消失 |
| 社群中繼資料庫 | 群眾投稿,常常是先爬取再人工訂正 | 跨片商、跨年代的廣度,包含已絕版的素材 | 正確度參差、資料過期、貢獻者之間的欄位定義不一致 |
| 以女優為中心的索引 | 以人為主鍵彙整的作品清單 | 追蹤同一個人跨片商、跨時間的作品 | 遇到藝名更換就斷掉;早期或未掛名的作品經常缺漏 |
| 圖片/臉部索引 | 封面圖與截圖,以視覺相似度比對 | 你手上只有圖、完全沒有文字時,找出那個人是誰 | 只回傳被索引過的東西;沒辦法直接告訴你作品,只能告訴你人 |
每一列的弱點都是它的來源直接造成的結果。這就是為什麼再怎麼努力,販售平台也不會涵蓋絕版作品,也是為什麼社群資料庫永遠不可能像賣家的商品表那樣內部一致。
什麼時候該去查販售平台片庫?
當你需要一筆紀錄的正規形式時:確切的編號、發行商所寫的官方標題、封面,以及這部作品目前買不買得到。
販售平台的資料是商業活動的副產品,這讓它在自己的範圍內異常可靠:賣家有直接的營運理由把編號、標題與供應狀態維持正確,因為那些欄位驅動著它自己的搜尋與出貨。對於幾年前就停售的作品,沒有人有那個誘因,而那正好就是販售平台開天窗的地方。
常見的錯誤是把販售平台當成普查。在販售平台上找不到,意思是「這裡沒賣」,永遠不是「不存在」。如果你想確認某個東西究竟有沒有發行過,販售平台是錯的工具。
販售平台的資料也是這個領域裡最適合機器讀取的資料,如果你要做什麼東西,這值得知道。FANZA 的營運方在 api.dmm.com/affiliate/v3/ 提供商品 API,商品、女優、片商、系列、類型與片庫分區各有獨立的端點,回傳內容編號、標題、日期與圖片網址;它需要一組 API ID 與一組聯盟 ID,所以是擋在聯盟帳號後面,而不是公開的(對照 DMM.com Labo 自家的 Go SDK 確認,pkg.go.dev/github.com/dmmcomlabo/dmm-go-sdk/api,2026-08-03 核對)。整個市場都是這個模式:片庫可以整批取得,但是以聯盟資料流的形式,帶著那意味著的商業附帶條件。
什麼時候該改信社群資料庫?
在存在性與廣度上信任社群資料庫 —— 確認某部作品或某位女優存在,以及找到已經沒有任何地方在賣的素材。
那確實很有價值,而且沒有任何商業來源複製得出來。代價是欄位定義會在貢獻者之間漂移。「發行日期」可能指的是公布日、數位發行日,或實體發行日。演職員資訊可能抄自封面、抄自商品頁,或抄自另一個從別處抄來的資料庫。錯誤會傳播,因為資料庫彼此互爬 —— 這就是為什麼同一個錯誤的出生年份可以出現在四個網站上,看起來像是彼此佐證。
社群資料庫之間彼此一致,應該當成弱證據,不是強證據。兩個網站說法相同,可能代表兩筆獨立的紀錄 —— 也可能是同一筆紀錄被抄了兩次。
以女優為中心的索引做了什麼別人做不到的事?
女優索引是以人而不是以商品為主鍵的,而那是唯一能跨片商追蹤一段職業生涯的結構。
那才是它真正的功能。販售平台按自己賣什麼來組織;女優索引按裡面是誰來組織。如果你想知道某個人在換片商前後分別做過什麼,只有以人為主鍵的結構能在一次查詢裡回答。
它們的典型失效是改名。藝名會在換經紀公司、換片商之間更改,有時也會在出道與重新出發之間更改,於是同一個人變成兩筆資料、兩份不完整的作品清單。純文字的資料庫沒有任何機制能自動偵測到這件事 —— 那兩筆紀錄沒有共用的欄位。
這也是為什麼一份作品清單應該當成下限來讀。它是「這個索引所知道、掛在這個名字底下的東西」的清單,不是「這個人做過什麼」的清單。
圖片或臉部索引站在什麼位置?
圖片索引回答的是其他幾類在結構上就回答不了的那個問題:你手上只有一張圖時,這是誰。
每一個文字資料庫都要求你已經知道一個名字、一個編號或一個標題。如果你有的是影片裡的一格畫面、完全沒有文字,它們就沒有入口。臉部比對把這件事反過來:偵測出臉、把它編碼成一組向量,再拿去和已經索引的臉比對,回傳的是人,不是作品。
我們自己的索引有 241,792 張臉、涵蓋 2,333 位具名女優,取自 106 個站台上的封面圖與截圖(我們的索引,2026-08 快照)。
界線比數字更重要。 覆蓋範圍並不平均:那 2,333 位具名女優裡,有 2,246 位的代表圖來自單一個站台。那是相當大的偏斜,也意味著從未出現在我們主要來源上的女優,被找到的機率低得多 —— 而工具仍然會回傳一串排過序的「差一點」。任何圖片索引都有這種形狀的限制;好的那些會告訴你。
圖片索引同樣不會給你作品名稱。它給你一個人,而作品來自第二個步驟 —— 用場景細節把那個人的已知作品縮小範圍。臉搜和作品清單資料庫是互補的,不是互相取代的。
怎麼判斷單獨一筆資料值不值得信?
判斷那一筆,不是判斷那個網站。有四個訊號可以把「查證過的紀錄」和「抄來的紀錄」分開:
- 它有沒有引用來源編號? 帶著發行商自家商品編號的資料可以往回追。只帶著一個標題的就不行。
- 它有沒有區分舊藝名與現用藝名? 一個明確建模別名的資料庫,代表它想過改名這件事。只有單一個扁平姓名欄位的,會無聲無息地把一段生涯切成兩半。
- 這筆紀錄有日期嗎? 一筆沒有「最後更新」的資料,跟一筆 2015 年就被丟著不管的資料無法區分。
- 空欄位是空著,還是填了看起來合理的垃圾? 佔位用的值 —— 整數的三圍、預設的出生日期 —— 是這個欄位從未被驗證過的強烈訊號。空白的欄位比猜出來的欄位誠實。
持續套用這四個問題,對正確度的幫助遠大於挑一個「最好的」網站,因為它們讓你能一筆一筆評分,而不是整批信任某個來源。
相關問題
我們索引的來源,以及每一個各自貢獻了什麼,都列在我們的站台頁面。