我們的資料來自兩條在中間交會的來源。臉部向量是從 106 個公開站台上發布的封面圖與影片截圖計算出來的。女優資料 —— 姓名、譯名、生平欄位 —— 則是從公開的個人頁解析而來。我們發布的每一項都衍生自其中一條或兩條;在它們互相矛盾或雙雙沉默的地方,我們得到的是一個缺口,而不是一個答案。
關於這些來源,最該知道的一件事是它們有多窄。我們 2,333 筆身分紀錄裡有 2,246 筆的代表圖來自同一個站台,而整個索引裡總共只有四個不同的站台在提供代表圖。
這兩條資料來源,具體是什麼?
一條是我們自己算出來的,另一條是從發布者那裡繼承來的。它們失效的方式完全不同。
| 臉部向量 | 女優資料 | |
|---|---|---|
| 來源 | 106 個已索引站台上發布的影像 | 公開的個人頁 |
| 產生方式 | 我們自己的流程(YuNet、ArcFace) | 第三方編輯者 |
| 完整度 | 已索引的影像幾乎全數涵蓋 | 依欄位而定,23%–89% |
| 失效模式 | 偵測漏抓;角度不佳、遮擋、臉太小 | 欄位留白、佔位字串、互相矛盾的值 |
| 我們有辦法改善嗎? | 可以 —— 索引更多來源 | 只有在來源願意發布時 |
這個不對稱很重要。臉部資料缺失,是因為我們沒有索引到那張圖。個人資料缺失,是因為一開始就沒有人把它寫下來,再多的工程也救不回來。
哪些來源佔了大宗,集中到什麼程度?
有一個站台幾乎完全獨大,我們寧可把這件事講出來,也不願讓「106 個站台」暗示一種我們並不具備的廣度。
| 代表圖來源站台 | 身分紀錄數 | 佔比 |
|---|---|---|
| 主要來源(jable) | 2,246 | 96.3% |
| 第二個站台 | 67 | 2.9% |
| 第三個站台 | 14 | 0.6% |
| 第四個站台 | 6 | 0.3% |
來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。
106 這個數字描述的是對臉部索引有貢獻的站台 —— 也就是那 241,792 個向量。上面那四個站台描述的則是每一筆身分的代表圖來自哪裡。兩者都成立;但只有後者告訴你身分這一層集中到什麼程度。
在第一重集中之上,還疊著第二重。在這 106 個已索引的站台裡,只有大約 13 個帶有日本番號。其餘多半是國際性的 tube 站與聚合平台。也因此,我們看到的日本成人影片,幾乎完全是透過國際轉載這層中介看到的。
逐個欄位來看,缺了什麼?
依欄位而定,缺 11% 到 77% 的紀錄。以下是完整的帳,不是好看的那一部分。
| 欄位 | 有值 | 缺漏 | n=2,333 的覆蓋率 |
|---|---|---|---|
| 相似女優清單 | 2,070 | 263 | 89% |
| 罩杯 | 1,375 | 958 | 59% |
| 出道日期 | 1,371 | 962 | 59% |
| 身高 | 1,340 | 993 | 57% |
| 三圍 | 1,316 | 1,017 | 56% |
| 生日 | 1,301 | 1,032 | 56% |
| 出生地 | 716 | 1,617 | 31% |
| 血型 | 547 | 1,786 | 23% |
來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。
三點說明,我們認為它們是資料的一部分,而不是資料的但書:
- 缺的部分不是隨機的。 資料齊全的紀錄屬於最有紀錄可考的女優,而那通常也就是最知名的那些。任何拿現有值算出來的統計,描述的都是知名、在國際上流通的女優。
- 有 626 筆紀錄只有姓名,其他什麼都沒有 —— 一個生平欄位也沒有。它們仍然被算進上面的分母裡,這也是為什麼每一個百分比都比我們把它們悄悄丟掉時要低。
- 本站早期的一些數字偏高。 來源資料裡的佔位字串被當成真值計入,讓好幾個覆蓋率數字被灌水,更糟的是還被輸出到女優頁的結構化資料裡。那些值已經移除。上面的表格是修正後的帳,先前的數字不應該再被引用。
這份資料永遠回答不了什麼?
它永遠沒辦法告訴你任何關於作品、片商或發行量的事,因為它裡面根本沒有這些。
這個索引存的是臉,不是作品。沒有發行日期欄位,沒有片商或廠牌欄位,也沒有作品紀錄。這就排除掉一整族很容易造假、卻完全無法佐證的統計:年產量、片商市佔、格式普及的時間軸、逐年的類型變化。
它同時也框住了我們的用字。我們絕不會寫某片商發行了 N 部作品,只會寫我們索引到 N 部 —— 因為我們數到的是聚合站的轉載,而這兩句話之間的落差,正好就是我們的資料與整個產業之間的落差。
資料與方法
來源。 106 個公開站台上發布的封面圖與影片截圖;用於資料欄位的公開女優個人頁;在能有把握對應時,加上 Wikidata 識別碼。
樣本。 241,792 個臉部向量;2,333 筆身分紀錄(1,707 筆有完整檔案,626 筆只有姓名字串);13,420 筆相似女優參照,其中 7,004 筆指向未具名的身分。
方法。 以 YuNet 偵測人臉,依五個特徵點對齊,用 ArcFace 編碼成 512 維向量,以餘弦相似度檢索,同一人的門檻為 0.40。個人資料從公開頁面解析,經型別與格式驗證,驗證失敗時留空,而不是拿別的值頂上。相似女優清單是從向量計算出來的,不是沿用來源的。
快照日期。 2026-08。
不儲存的東西。 影片檔。使用者原始上傳的圖片 —— 偵測在訪客的瀏覽器裡執行,只有裁切下來的臉部區域與五個特徵點會被傳送以供比對,查詢結果不予保留。索引是用已發布的素材建立的,絕不是用人們搜尋的內容建立的。
已知偏斜。
- 來源極度集中。 96.3% 的代表圖來自單一站台;四個站台就涵蓋了全部。
- 聚合站中介。 106 個已索引站台裡只有大約 13 個帶有日本番號,所以我們看得到的素材,就是在國際上流通的那些。
- 紀錄偏斜。 現有的資料欄位過度代表了知名女優。
- 後果。 這些數字衡量的是我們所索引站台上的曝光度,不是發行量,也不是產業結構。 請把這裡的每一個數字都先當成關於我們來源的陳述,關於產業的部分只能靠推論。
引用格式。
starlikeness(2026)。〈我們的資料從哪裡來,又缺了什麼〉。
臉部索引,2026-08 快照(n=241,792 張臉;2,333 筆身分紀錄;
106 個站台;4 個代表圖來源站台)。
https://starlikeness.com/zh-TW/articles/where-our-data-comes-from
相關問題
上面說的全都是這個索引,不是你:人臉偵測在你的瀏覽器裡執行,只有裁切下來的臉部區域會被送出去比對,關於你的搜尋,沒有任何東西會被寫回這份資料。