我們的資料來自兩條在中間交會的來源。臉部向量是從 106 個公開站台上發布的封面圖與影片截圖計算出來的。女優資料 —— 姓名、譯名、生平欄位 —— 則是從公開的個人頁解析而來。我們發布的每一項都衍生自其中一條或兩條;在它們互相矛盾或雙雙沉默的地方,我們得到的是一個缺口,而不是一個答案。

關於這些來源,最該知道的一件事是它們有多窄。我們 2,333 筆身分紀錄裡有 2,246 筆的代表圖來自同一個站台,而整個索引裡總共只有四個不同的站台在提供代表圖。

這兩條資料來源,具體是什麼?

一條是我們自己算出來的,另一條是從發布者那裡繼承來的。它們失效的方式完全不同。

臉部向量 女優資料
來源 106 個已索引站台上發布的影像 公開的個人頁
產生方式 我們自己的流程(YuNet、ArcFace) 第三方編輯者
完整度 已索引的影像幾乎全數涵蓋 依欄位而定,23%–89%
失效模式 偵測漏抓;角度不佳、遮擋、臉太小 欄位留白、佔位字串、互相矛盾的值
我們有辦法改善嗎? 可以 —— 索引更多來源 只有在來源願意發布時

這個不對稱很重要。臉部資料缺失,是因為我們沒有索引到那張圖。個人資料缺失,是因為一開始就沒有人把它寫下來,再多的工程也救不回來。

哪些來源佔了大宗,集中到什麼程度?

有一個站台幾乎完全獨大,我們寧可把這件事講出來,也不願讓「106 個站台」暗示一種我們並不具備的廣度。

代表圖來源站台 身分紀錄數 佔比
主要來源(jable) 2,246 96.3%
第二個站台 67 2.9%
第三個站台 14 0.6%
第四個站台 6 0.3%

來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。

106 這個數字描述的是對臉部索引有貢獻的站台 —— 也就是那 241,792 個向量。上面那四個站台描述的則是每一筆身分的代表圖來自哪裡。兩者都成立;但只有後者告訴你身分這一層集中到什麼程度。

在第一重集中之上,還疊著第二重。在這 106 個已索引的站台裡,只有大約 13 個帶有日本番號。其餘多半是國際性的 tube 站與聚合平台。也因此,我們看到的日本成人影片,幾乎完全是透過國際轉載這層中介看到的。

逐個欄位來看,缺了什麼?

依欄位而定,缺 11% 到 77% 的紀錄。以下是完整的帳,不是好看的那一部分。

欄位 有值 缺漏 n=2,333 的覆蓋率
相似女優清單 2,070 263 89%
罩杯 1,375 958 59%
出道日期 1,371 962 59%
身高 1,340 993 57%
三圍 1,316 1,017 56%
生日 1,301 1,032 56%
出生地 716 1,617 31%
血型 547 1,786 23%

來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。

三點說明,我們認為它們是資料的一部分,而不是資料的但書:

  • 缺的部分不是隨機的。 資料齊全的紀錄屬於最有紀錄可考的女優,而那通常也就是最知名的那些。任何拿現有值算出來的統計,描述的都是知名、在國際上流通的女優。
  • 有 626 筆紀錄只有姓名,其他什麼都沒有 —— 一個生平欄位也沒有。它們仍然被算進上面的分母裡,這也是為什麼每一個百分比都比我們把它們悄悄丟掉時要低。
  • 本站早期的一些數字偏高。 來源資料裡的佔位字串被當成真值計入,讓好幾個覆蓋率數字被灌水,更糟的是還被輸出到女優頁的結構化資料裡。那些值已經移除。上面的表格是修正後的帳,先前的數字不應該再被引用。

這份資料永遠回答不了什麼?

它永遠沒辦法告訴你任何關於作品、片商或發行量的事,因為它裡面根本沒有這些。

這個索引存的是,不是作品。沒有發行日期欄位,沒有片商或廠牌欄位,也沒有作品紀錄。這就排除掉一整族很容易造假、卻完全無法佐證的統計:年產量、片商市佔、格式普及的時間軸、逐年的類型變化。

它同時也框住了我們的用字。我們絕不會寫某片商發行了 N 部作品,只會寫我們索引到 N 部 —— 因為我們數到的是聚合站的轉載,而這兩句話之間的落差,正好就是我們的資料與整個產業之間的落差。

資料與方法

來源。 106 個公開站台上發布的封面圖與影片截圖;用於資料欄位的公開女優個人頁;在能有把握對應時,加上 Wikidata 識別碼。

樣本。 241,792 個臉部向量;2,333 筆身分紀錄(1,707 筆有完整檔案,626 筆只有姓名字串);13,420 筆相似女優參照,其中 7,004 筆指向未具名的身分。

方法。 以 YuNet 偵測人臉,依五個特徵點對齊,用 ArcFace 編碼成 512 維向量,以餘弦相似度檢索,同一人的門檻為 0.40。個人資料從公開頁面解析,經型別與格式驗證,驗證失敗時留空,而不是拿別的值頂上。相似女優清單是從向量計算出來的,不是沿用來源的。

快照日期。 2026-08。

不儲存的東西。 影片檔。使用者原始上傳的圖片 —— 偵測在訪客的瀏覽器裡執行,只有裁切下來的臉部區域與五個特徵點會被傳送以供比對,查詢結果不予保留。索引是用已發布的素材建立的,絕不是用人們搜尋的內容建立的。

已知偏斜。

  • 來源極度集中。 96.3% 的代表圖來自單一站台;四個站台就涵蓋了全部。
  • 聚合站中介。 106 個已索引站台裡只有大約 13 個帶有日本番號,所以我們看得到的素材,就是在國際上流通的那些。
  • 紀錄偏斜。 現有的資料欄位過度代表了知名女優。
  • 後果。 這些數字衡量的是我們所索引站台上的曝光度,不是發行量,也不是產業結構。 請把這裡的每一個數字都先當成關於我們來源的陳述,關於產業的部分只能靠推論。

引用格式。

starlikeness(2026)。〈我們的資料從哪裡來,又缺了什麼〉。
臉部索引,2026-08 快照(n=241,792 張臉;2,333 筆身分紀錄;
106 個站台;4 個代表圖來源站台)。
https://starlikeness.com/zh-TW/articles/where-our-data-comes-from

相關問題


上面說的全都是這個索引,不是你:人臉偵測在你的瀏覽器裡執行,只有裁切下來的臉部區域會被送出去比對,關於你的搜尋,沒有任何東西會被寫回這份資料。