比你从那个头条数字里猜到的要少。我们的索引里有 241,792 条人脸向量,但只有 2,333 条身份记录,其中只有 1,707 条带有可以解析、含生平字段的档案。我们索引过的人脸里,大约 1% 挂着名字(我们的索引,2026-08 快照)。
这个比例就是对「你们的数据有多完整」这个问题的诚实回答。这篇文章余下的部分,是在尽量说清楚具体是哪 1%,以及为什么另外 99% 不是系统的失败,而是素材本身的性质。
这些头条数字实际上在数什么?
每个数字数的东西都比它听上去的窄,所以下面把每一个连同它真正的定义列出来。
| 数字 | 值 | 它数的是什么 | 它不数什么 |
|---|---|---|---|
| 人脸向量 | 241,792 | 在已索引图像中检测到的人脸 | 不同的人;同一个人会出现很多次 |
| 身份记录 | 2,333 | 被当作同一个人并打上标签的聚类 | 索引里的所有人;大多数人脸没有标签 |
| 有完整档案的记录 | 1,707 | 有规范 slug 和元数据的身份 | 那 626 条只有一串原始姓名的 |
| 已索引站点 | 106 | 我们抓取过图像的主机 | 带日文番号的站点——大约 13 个 |
| 关键词落地页 | 300 | 建在索引之上的查询页 | 对行业标签词汇的覆盖 |
| 语言 | 13 | 界面与姓名翻译的语言 | 数据来源;大多数来源是英文的 |
资料来源:我们的索引,2026-08 快照。
第一行是人脸搜索的营销话术最爱待的地方,也是最没有意义的一行。241,792 衡量的是我们处理了多少张图,不是我们能认出多少个人。
为什么索引里只有 1% 有名字?
因为人脸是机器找出来的,名字是人工补上的,而我们索引的这些来源,人工那一头的供给很薄。
检测器会在我们处理的每一张图里找出每一张脸。而名字只有在来源页面以可解析、可链接的形式写出来时才挂得上。国际聚合站占了我们那 106 个主机的大头,而它们在转载时经常把署名整段抹掉。
后果在我们自己的相似女优数据里看得见:在 13,420 条相邻引用中,7,004 条(52%)指向没有名字的身份。所有「谁长得像这个人」的指针里,有一半以上通向了公开记录留白的地方。
已经有名字的这些人,数据有多完整?
按字段不同,介于 23% 到 89% 之间,而我们把低的那些数字和高的一起公布。
| 字段 | 有值的记录数 | 在 n=2,333 中的覆盖率 |
|---|---|---|
| 相似女优列表 | 2,070 | 89% |
| 罩杯 | 1,375 | 59% |
| 出道日期 | 1,371 | 59% |
| 身高 | 1,340 | 57% |
| 三围 | 1,316 | 56% |
| 出生日期 | 1,301 | 56% |
| 出生地 | 716 | 31% |
| 血型 | 547 | 23% |
资料来源:我们的索引,2026-08 快照,n=2,333 条身份记录。
由此有两点。第一,我们能发布的任何关于比如出生地分布的统计,都建立在 716 个人身上——而这 716 个人不是随机样本,他们是档案记录得最好的那批,通常也就意味着最有名的那批。第二,血型这种只有 23% 的字段,薄到根本撑不起任何关于整体的论断,我们宁可直说,也不愿把 547 条记录打扮成一幅行业画像。
唯一强的那个字段——89% 的相似女优列表——之所以强,恰恰是因为它是我们自己从向量算出来的,而不是从某个来源继承来的。
如果不是行业,那这个索引测的是什么?
它测的是聚合站上的曝光度,而这个区别不是咬文嚼字。
我们 2,333 条身份记录里的 2,246 条,代表图取自同一个站点。在整个集合上,代表图只来自四个不同的主机。我们索引的 106 个站点里,只有大约 13 个带日文番号;其余的大多是国际的 tube 站和聚合平台。
所以当某位女优在我们的数据里被充分呈现时,这个发现的意思是:这个人的图像在我们索引的那些聚合站上流传很广。这是一个真实且有用的信号。它跟「作品多产」「在日本很红」或者「商业上举足轻重」都不是一回事,我们也不会把它说成那些。
这同时也框定了我们永远不会声称的东西。我们不会说某家片商发行了 N 部作品——只会说我们索引了 N 部。索引里没有发行日期字段、没有片商字段、根本就没有作品记录,所以逐年产量趋势、片商市场份额、格式普及时间线,从它这里就是算不出来的,无论拿它做出来的图表看上去有多笃定。
数据与方法
**来源。**starlikeness 人脸索引:从 106 个站点的封面图与视频截帧中提取的人脸向量与身份记录。
**样本。**241,792 条人脸向量;2,333 条身份记录(1,707 条有完整档案,626 条只有姓名字符串);13,420 条相似女优引用。
**方法。**用 YuNet 做检测;按五个面部关键点做对齐;用 ArcFace 编码成 512 维向量;按余弦相似度检索,同一人阈值取 0.40。覆盖率是某字段有非空值的记录数,除以 2,333 这个完整总体。
**快照日期。**2026-08。计数是在该日期从线上数据文件重新算出来的;本页面上显示的更新日期反映的是数据,不是页面重建。
已知偏差。
- **来源集中。**2,333 张代表图里有 2,246 张来自同一个站点;四个主机就占完了全部。任何在这些来源里缺席的东西,在我们的测量里同样缺席。
- **语言与地域偏斜。**已索引站点多为国际聚合站,因此在国际上流传的图像,相对于只在日本发行的素材被过度呈现。
- **记录完备度偏斜。**有名字的那 1,707 位,按构造就是记录得最好的一批女优。在他们身上算出来的覆盖率统计,描述的是「记录完备的」,不是「典型的」。
- **历史遗留。**本站此前发布过的一些字段覆盖率数字被虚高了,原因是占位字符串被当成了有效值来数。它们在本次快照之前已被清除;上面的数字是修正后的,比我们之前报的要低。
引用格式。
starlikeness (2026). 《这个行业我们究竟能看到多少?》
人脸索引,2026-08 快照(n=241,792 张人脸;2,333 条身份记录;
106 个站点)。https://starlikeness.com/zh-CN/articles/how-complete-is-our-index
相关问题
检验覆盖面最实际的办法就是搜一次。上传一帧画面,读那些分数:一串低分结果,就是索引在告诉你这个人不在那 1% 里。检测在你的浏览器里跑,原图不会离开你的设备。