在我们的相似女优数据里,有 7,004 条引用指向没有名字的身份。那是这些列表中全部 13,420 条引用的 52%——我们手上每一条「谁长得像这个人」的指针里,超过一半指向的是公开记录从未命名过的某个人(我们的索引,2026-08 快照)。
这是关于我们自己的数据,我们能公布的最诚实的一个数字,同时也是最有用的一个,因为它量化了一件每个人脸搜索工具都存在、却没有一个愿意给你看的事:存在的脸与有人愿意去辨认的脸之间的落差。
7,004 这个数字究竟数的是什么?
7,004 数的是引用,不是人。 把这一点说清楚,正是这篇文章的目的。
我们索引里的每一条身份记录,都带着一份简短的列表,列出它在向量空间里最近的邻居——模型认为最相似的那些脸。列表中有些条目能对应到一份具名女优资料页,其余的只对应到一个身份:一个内部标识、一张代表图、一条向量,仅此而已。
| 量 | 数值 | 它是什么 |
|---|---|---|
| 相似女优引用总数 | 13,420 | 所有近邻列表里的全部条目 |
| 指向具名资料页的引用 | 6,416 | 占总数的 48% |
| 指向无名身份的引用 | 7,004 | 占总数的 52% |
| 被引用到的不同无名身份 | 589 | 那 7,004 条指针背后的人 |
| 至少有一个无名近邻的女优 | 1,899 | 在 2,070 条有近邻列表的记录中 |
| 索引中的身份记录 | 2,333 | 其中 1,707 条能对应到具名资料页 |
来源:我们的索引,2026-08 快照,n=2,333 条身份记录。
所以:7,004 条指针,589 个人。平均每一个无名身份,会以近邻的身份出现十二次左右。如果你只看标题里那个数字,就会把问题夸大约十二倍——这也是我们把拆解放在它旁边的原因。
为什么会有脸进了索引却没有名字?
因为脸和名字是从两条不同的管道进来的,而其中只有一条是可靠的。
只要检测器在一张被索引的图片里找到人脸,这张脸就进了索引。这是机械的,几乎不会漏。而名字只有在某个已公开的页面以我们能解析、能关联的形式写出来时才会进来。这一步是编辑性的,各站点之间不一致,而且经常干脆就没有。
常见成因,大致按我们遇到的频率排序:
- 来源页面根本没有署名任何女优——这在聚合站上非常常见,它们转载素材时把元数据剥得干干净净。
- 页面只用日文写了名字,而那个写法从来没有被映射到某份标准资料页。在我们的 2,333 条身份记录中,有 626 条只是一串原始的名字字符串,没有关联资料页,也完全没有任何传记字段。
- 这位女优用过多个名字,而没有任何来源把它们串起来。
- 这张脸属于制作中偶然入镜的某个人,本来就不是署名的演出者。
最后一条值得直说:成人影片索引里的每一张脸并不都是女优,一个假定「都是」的索引,会在要紧的地方出错。
搜索结果里出现无名近邻,说明了什么?
它说明相似是真的,缺的是辨认——这跟一次失败的搜索不是一回事,而且比用户想象的常见得多。
在有近邻列表的 2,070 条记录中,有 1,899 条(92%)的最近邻里至少有一个无名身份。如果你跑了一次人脸搜索,拿回一条分数高于阈值却没有名字的结果,你碰到的不是 bug,而是公开记录的真实状态。
这也是我们不把无名身份从结果里过滤掉的原因。压掉它们会得到一份看起来更干净的列表,却悄悄歪曲了数据:它会把「这个人存在,只是从未被署名」变成「这里没有人」。前一句是真的,后一句不是。
这件事怎么影响覆盖率数字?
它把覆盖率往下拉,而我们公布的是那个更低的数字,不是好看的那个。
我们公布的每一个覆盖率百分比,分母都用完整的 2,333 条身份记录——包括那 626 条只有一串名字、别的什么都没有的记录。
| 字段 | 有值的记录数 | 在 n=2,333 中的覆盖率 |
|---|---|---|
| 相似女优列表 | 2,070 | 89% |
| 罩杯 | 1,375 | 59% |
| 出道日期 | 1,371 | 59% |
| 身高 | 1,340 | 57% |
| 三围 | 1,316 | 56% |
| 生日 | 1,301 | 56% |
| 出生地 | 716 | 31% |
| 血型 | 547 | 23% |
来源:我们的索引,2026-08 快照,n=2,333。
我们大可以悄悄把分母换成那 1,707 条有真实资料页的记录,让上面每一个数字都变好看。血型会从 23% 变成 32%,出生地从 31% 变成 42%。我们不这么做,因为那 626 条就在索引里,也确实会在搜索中被返回,把它们排除在统计之外,描述的将是一个我们其实并没有在运行的数据库。
数据与方法
来源。 starlikeness 人脸索引:从 106 个站点的封面图与剧照中提取的人脸向量与身份记录。
样本。 241,792 条人脸向量;2,333 条身份记录;分布在 2,070 份近邻列表中的 13,420 条相似女优引用。
方法。 用 YuNet 检测人脸,按五个关键点对齐,用 ArcFace 编码成 512 维向量。近邻列表取余弦相似度上最近的向量,同一人的阈值为 0.40。当一条引用对应到的身份只有一个内部哈希作标识、没有关联的女优资料页时,它被归类为「无名」。
快照日期。 2026-08。所有计数都在该日期从线上数据文件重新计算。
已知偏差。 我们的来源高度集中。2,333 张代表图中有 2,246 张来自同一个站点,而我们索引的 106 个站点里,只有 13 个左右带有日本作品番号——其余大多是国际性的 tube 站和聚合站。因此我们测到的这个命名落差,有一部分是那些来源的元数据习惯的产物,不是整个行业的属性。这份索引衡量的是在聚合站上的曝光度,不是发行量。一位资料齐全但作品不在我们来源里的女优,在这里会显示为缺席;而一条署名马虎的聚合站上传,则会推高无名的计数。
我们算不出来的东西。 索引存的是脸,不是作品。里面没有发行日期、片商或作品数这些字段,所以任何关于产量、片商市场份额或逐年产出的说法,都无法从中推导出来。
引用格式。
starlikeness (2026). "Our Index Contains 7,004 Faces With No Name."
Face index, 2026-08 snapshot (n=2,333 identity records; 13,420 neighbour
references). https://starlikeness.com/zh-CN/articles/faces-without-names
相关问题
想亲眼看看一个无名身份,就跑一次人脸搜索,留意那种分数很高、背后却没有资料页的结果。检测发生在你的浏览器里,只有裁切下来的人脸区域会被发出去做匹配。