在我們的相似女優資料裡,有 7,004 筆指標指向沒有掛上名字的身分。那是這些清單裡全部 13,420 筆指標的 52% —— 我們手上每一個「誰長得像這個人」的指標,有超過一半通往一個已發布紀錄從未指名過的人(我們的索引,2026-08 快照)。

這是我們能公布的、關於自家資料最誠實的一個數字,同時也是最有用的一個,因為它把每一個人臉搜尋工具都有、卻沒有一個願意攤開來給你看的東西量化了:存在的臉有人願意去指認的臉,這兩者之間的落差。

7,004 這個數字,究竟數的是什麼?

7,004 數的是指標,不是人。 把這件事講精確,正是這篇文章的重點。

我們索引裡的每一筆身分紀錄,都帶著一份簡短的清單,列出它在向量空間裡最近的鄰居 —— 也就是模型認為最相似的那些臉。清單裡有些項目會對應到一份有名字的女優檔案,其餘的則對應到一個只以內部鍵值、一張代表圖與一組向量形式存在的身分。

項目 數值 這是什麼
相似女優指標總數 13,420 所有鄰居清單裡的每一筆
指向具名檔案的指標 6,416 佔總數的 48%
指向無名身分的指標 7,004 佔總數的 52%
被指到的不同無名身分 589 那 7,004 筆指標背後的人
至少有一個無名鄰居的女優 1,899 在 2,070 筆有鄰居清單的紀錄中
索引裡的身分紀錄 2,333 其中 1,707 筆帶有可解析的具名檔案

來源:我們的索引,2026-08 快照,n=2,333 筆身分紀錄。

所以是這樣:7,004 個指標,589 個人。平均而言,一個無名身分大約會是十二個人的近鄰。如果你只看標題那個數字,你會把問題誇大大約十二倍 —— 這正是我們把細目擺在它旁邊的原因。

為什麼會有臉進了索引卻沒有名字?

因為臉和名字是走不同管線進來的,而且只有其中一條可靠。

只要偵測器在一張被索引的圖片裡找到臉,這張臉就進索引。那是機械式的,而且幾乎不會漏。名字則要等到某個已發布的頁面以我們解析得了、也連得起來的形式寫出它,才會進來。那是編輯行為,各站台之間並不一致,而且經常整個付之闕如。

常見的成因,大致依我們看到的頻率排序:

  • 來源頁面根本沒有標註任何女優 —— 在聚合站上非常常見,它們轉貼素材時會把描述資料整個剝掉。
  • 頁面只用日文標了名字,而那個寫法從來沒有被對應到一份正式檔案。在我們的 2,333 筆身分紀錄裡,有 626 筆只以一串原始名稱字串存在,既沒有連結的檔案,也完全沒有任何生平欄位
  • 這位女優用過多個名字,而沒有任何來源把它們串起來。
  • 這張臉屬於製作現場的邊緣人物,一開始就不是掛名的演出者。

最後一項值得直白地說出來:成人影片索引裡不是每一張臉都是女優,而一個假設「都是」的索引,錯的方式會很要命。

搜尋結果裡出現一個無名鄰居,代表什麼?

它告訴你相似性是真的,缺的是指認 —— 這跟搜尋失敗是兩回事,而且比使用者以為的常見得多。

在有鄰居清單的 2,070 筆紀錄中,有 1,899 筆(92%)的最近鄰裡至少有一個無名身分。如果你跑了一次人臉搜尋,拿回一個分數高於門檻卻沒有名字的結果,你碰到的不是 bug。你碰到的是公開紀錄的真實狀態。

這也是為什麼我們不把無名身分從結果裡濾掉。壓掉它們會產出一份看起來乾淨、卻悄悄扭曲了資料的清單:它會把「這個人存在,只是從來沒被標註過」變成「這裡沒有人」。前一句是真的,後一句不是。

這對覆蓋率數字有什麼影響?

它把數字拉低了,而我們報的是比較低的那組,不是比較好看的那組。

我們公布的每一個覆蓋率百分比,分母都用完整的 2,333 筆身分紀錄 —— 包含那 626 筆只有名稱字串、其他什麼都沒有的紀錄。

欄位 有值的紀錄數 佔 n=2,333 的覆蓋率
相似女優清單 2,070 89%
罩杯 1,375 59%
出道日期 1,371 59%
身高 1,340 57%
三圍 1,316 56%
生日 1,301 56%
出生地 716 31%
血型 547 23%

來源:我們的索引,2026-08 快照,n=2,333。

我們大可以悄悄把分母換成那 1,707 筆有真正檔案的紀錄,讓上面每一個數字都變好看。血型會從 23% 變成 32%,出生地從 31% 變成 42%。我們不這麼做,因為那 626 筆確實在索引裡,也確實會在搜尋中被回傳,把它們排除在統計之外,等於在描述一個我們實際上沒在跑的資料庫。

資料與方法

來源。 starlikeness 臉部索引:從 106 個站台的封面圖與劇照擷取出來的臉部向量與身分紀錄。

樣本。 241,792 組臉部向量;2,333 筆身分紀錄;橫跨 2,070 份鄰居清單的 13,420 筆相似女優指標。

方法。 臉部以 YuNet 偵測,依五個特徵點對齊,再用 ArcFace 編碼成 512 維向量。鄰居清單取的是餘弦相似度上最接近的向量,並套用 0.40 的同一人門檻。當一筆指標對應到的身分只以內部雜湊值作鍵、沒有連結任何女優檔案時,就歸類為「無名」。

快照日期。 2026-08。所有計數都在該日從即時資料檔重新計算。

已知偏斜。 我們的來源高度集中。2,333 張代表圖裡有 2,246 張來自單一站台,而我們索引的 106 個站台裡,只有大約 13 個帶有日本番號 —— 其餘大多是國際性的影片站與聚合站。因此,我們量到的這道命名缺口,有一部分是那些來源的描述資料習慣造成的,不是整個產業的性質。這份索引衡量的是在聚合站上的曝光度,不是發行量。一位紀錄詳盡、但作品不在我們來源上的女優,在這裡會呈現為缺席;而一則標註草率的聚合站上傳,則會把無名的數字推高。

我們算不出來的東西。 索引存的是臉,不是作品。裡面沒有發行日期、片商或作品數的欄位,所以任何關於產量、片商市佔或年度產出變化的說法,都無法從它推導出來。

引用格式。

starlikeness(2026)。〈我們的索引裡有 7,004 張沒有名字的臉〉。
臉部索引,2026-08 快照(n=2,333 筆身分紀錄;13,420 筆鄰居
指標)。https://starlikeness.com/zh-TW/articles/faces-without-names

相關問題


想親眼看看無名身分,就跑一次人臉搜尋,留意那些分數很高、背後卻沒有檔案的結果。偵測在你的瀏覽器裡進行,只有裁切下來的臉部區域會被送出比對。