比你從那個大標數字猜到的要少。我們的索引裡有 241,792 個臉部向量,卻只有 2,333 筆身分紀錄,其中只有 1,707 筆能對到一份帶生平欄位的檔案。我們索引到的臉裡,大約 1% 連得上一個名字(我們的索引,2026-08 快照)。
這個比例,就是「你們的資料有多完整」最誠實的答案。這篇文章其餘的部分,都是在試著把「究竟是哪 1%」講清楚,以及為什麼另外 99% 不是系統的失敗,而是素材本身的性質。
那些大標數字實際上在數什麼?
每一個數字數的東西都比它聽起來要窄,所以以下把每一個都配上它真正的定義。
| 數字 | 值 | 它數的是什麼 | 它沒有數的是什麼 |
|---|---|---|---|
| 臉部向量 | 241,792 | 已索引影像裡偵測到的臉 | 不同的人;同一個人會出現很多次 |
| 身分紀錄 | 2,333 | 被當成同一個人並貼上標籤的群集 | 索引裡的所有人;大多數臉沒有標籤 |
| 有完整檔案的紀錄 | 1,707 | 有正規 slug 與詮釋資料的身分 | 那 626 筆只有一個原始姓名字串的 |
| 已索引站台 | 106 | 我們抓過影像的主機 | 帶有日本番號的站台 —— 大約 13 個 |
| 關鍵字著陸頁 | 300 | 建在索引之上的查詢頁 | 這個產業標籤詞彙的覆蓋率 |
| 語系 | 13 | 介面與姓名翻譯的語言 | 來源;多數來源是英語的 |
來源:我們的索引,2026-08 快照。
第一列是多數人臉搜尋行銷話術的所在地,也是最沒有意義的一列。241,792 衡量的是我們處理了多少張影像,不是我們能認出多少個人。
為什麼索引裡只有 1% 有名字?
因為臉是機器找出來的,名字是人工編輯供給的,而在我們索引的那些來源上,這種編輯供給非常稀薄。
偵測器會在我們處理的每一張影像裡找出每一張臉。而名字只有在來源頁面以可解析、可連結的形式寫出來時才會附上。在國際聚合站上 —— 也就是我們那 106 個主機裡的大宗 —— 演職員資訊常常在轉載時就被整個剝掉。
後果在我們自己的相似女優資料裡看得見:在 13,420 筆鄰居參照中,有 7,004 筆(52%)指向沒有名字的身分。所有「誰長得像這個人」的指標,超過一半通往公開紀錄留白的地方。
已經有名字的那些人,資料有多完整?
依欄位而定,介於 23% 到 89% 之間,而我們會把難看的數字和好看的數字一起發布。
| 欄位 | 有值的紀錄 | n=2,333 的覆蓋率 |
|---|---|---|
| 相似女優清單 | 2,070 | 89% |
| 罩杯 | 1,375 | 59% |
| 出道日期 | 1,371 | 59% |
| 身高 | 1,340 | 57% |
| 三圍 | 1,316 | 56% |
| 生日 | 1,301 | 56% |
| 出生地 | 716 | 31% |
| 血型 | 547 | 23% |
來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。
由此得出兩件事。第一,我們能發布的任何關於出生地分布之類的統計,底下只有 716 個人 —— 而這 716 人不是隨機樣本,他們是檔案被記錄得最完整的那一群,通常也就是最知名的那一群。第二,像血型這種只有 23% 的欄位,薄到根本撐不起任何關於母體的宣稱,我們寧可直說,也不願把 547 筆紀錄打扮成一幅產業肖像。
唯一紮實的欄位 —— 89% 的相似女優清單 —— 之所以紮實,正是因為那是我們自己從向量算出來的,不是從來源繼承來的。
如果它量的不是這個產業,那它量的是什麼?
它量的是聚合站上的曝光度,而這個區別並不只是學術上的講究。
我們 2,333 筆身分紀錄裡有 2,246 筆,代表圖取自同一個站台。整個資料集裡,代表圖只來自四個不同的主機。我們索引的 106 個站台裡,只有大約 13 個帶有日本番號;其餘多半是國際性的 tube 站與聚合平台。
所以當一位女優在我們的資料裡被充分呈現時,這個發現的意思是:這個人的影像在我們索引的聚合站上流通得很廣。那是一個真實而有用的訊號。它不等於作品多產、在日本很紅,或在商業上舉足輕重,我們也不會把它當成那些來呈現。
這同時也框住了我們永遠不會做的宣稱。我們不會說某片商發行了 N 部作品,只會說我們索引到 N 部。這個索引沒有發行日期欄位、沒有片商欄位,也完全沒有作品紀錄,所以逐年的產量趨勢、片商市佔、格式普及的時間軸,從它身上根本算不出來 —— 不管用它做出來的圖表看起來多有把握。
資料與方法
來源。 starlikeness 臉部索引:從 106 個站台的封面圖與影片截圖推導出來的臉部向量與身分紀錄。
樣本。 241,792 個臉部向量;2,333 筆身分紀錄(1,707 筆有完整檔案,626 筆只有姓名字串);13,420 筆相似女優參照。
方法。 以 YuNet 偵測;依五個臉部特徵點對齊;用 ArcFace 編碼成 512 維向量;以餘弦相似度檢索,同一人的門檻為 0.40。覆蓋率百分比是某欄位有非空值的紀錄數,除以 2,333 這個完整母體。
快照日期。 2026-08。各項計數是在該日期從即時資料檔重新計算的;本頁上顯示的更新日期反映的是資料,不是改版。
已知偏斜。
- 來源集中。 2,333 張代表圖裡有 2,246 張來自同一個站台;四個主機就涵蓋了全部。凡是這些來源上沒有的,我們的量測裡也就沒有。
- 語言與地區偏斜。 多數已索引站台是國際聚合站,所以相對於只在日本流通的素材,在國際上流通的影像被過度代表了。
- 紀錄偏斜。 那 1,707 位具名者,就結構而言就是被記錄得最完整的女優。拿他們算出來的覆蓋率統計,描述的是被記錄得好的人,不是典型的人。
- 歷史包袱。 本站先前發布的一些欄位覆蓋率數字,因為佔位字串被當成有效值計入而被灌水。那些值在這份快照之前已經移除;上面的數字是修正後的版本,比我們先前報的要低。
引用格式。
starlikeness(2026)。〈這個產業我們到底看得見多少?〉
臉部索引,2026-08 快照(n=241,792 張臉;2,333 筆身分紀錄;
106 個站台)。https://starlikeness.com/zh-TW/articles/how-complete-is-our-index
相關問題
覆蓋率最實際的檢驗方式是搜一次。上傳一格畫面,然後讀分數:一串低分的結果,就是索引在告訴你這個人不在那 1% 裡。偵測在你的瀏覽器裡執行,原始圖片不會離開你的裝置。