我们的数据来自两条在中间汇合的流。人脸向量106 个公开站点上发布的封面图和视频截图计算得出。女优元数据——名字、译名、生平字段——从公开的资料页解析而来。我们发布的一切都源自这两条流之一或两者,而当它们彼此矛盾或双双沉默时,我们拿到的是一个缺口,不是一个答案。

关于这些来源,最该知道的是它们有多窄。我们 2,333 条身份记录里有 2,246 条的代表图来自同一个站点,而整个索引里真正提供代表图的,一共只有四个不同的主机

这两条数据流具体是什么?

一条是我们自己算出来的;另一条是从发布方那里继承来的。它们出问题的方式完全不同。

人脸向量 女优元数据
来源 106 个已索引站点上发布的图片 公开的资料页
由谁产出 我们自己的流水线(YuNet、ArcFace) 第三方编辑
完整度 对已索引的图片接近全覆盖 按字段 23%–89% 不等
失败方式 检测漏掉;角度差、遮挡、脸太小 字段留空、占位字符串、互相矛盾的值
我们能改善吗? 能——索引更多来源 只有当某个来源发布了它才行

这种不对称很要紧。人脸数据缺失,是因为我们没有索引那张图。元数据缺失,是因为一开始就没人写下来,再多的工程也救不回来。

哪些来源占了主导,程度有多严重?

一个站点几乎完全主导,而我们宁愿把这件事发布出来,也不愿让「106 个站点」暗示一种我们并不具备的广度。

代表图主机 身份记录 占比
主要来源(jable) 2,246 96.3%
第二个主机 67 2.9%
第三个主机 14 0.6%
第四个主机 6 0.3%

来源:我们的索引,2026-08 快照,n=2,333 条身份记录。

106 这个数字说的是为人脸索引——那 241,792 个向量——做出贡献的站点数。上面那四个主机说的是每一条身份的代表图从哪来。两者都属实;但只有第二个告诉你身份这一层有多集中。

在第一层集中之上还有第二层。106 个已索引站点里,只有大约 13 个带日式内容 ID。其余大多是国际性的 tube 站和聚合平台。因此我们对日本成人影片的视野,几乎完全是通过国际转载中介过的。

逐个字段看,缺了什么?

按字段不同,缺的记录在 11% 到 77% 之间。下面是完整的账,不是好看的那一部分。

字段 在 n=2,333 中的覆盖率
相似女优列表 2,070 263 89%
罩杯 1,375 958 59%
出道日期 1,371 962 59%
身高 1,340 993 57%
三围 1,316 1,017 56%
出生日期 1,301 1,032 56%
出生地 716 1,617 31%
血型 547 1,786 23%

来源:我们的索引,2026-08 快照,n=2,333 条身份记录。

有三点我们认为是数据本身的一部分,而不是对它的免责声明:

  • **缺失不是随机的。**元数据齐全的记录,属于被记录得最好的那批女优,而那通常意味着最出名的。任何在现有值上算出来的统计,描述的都是知名度高、在国际上被广泛转载的女优。
  • 有 626 条记录只有一个名字,别的什么都没有——一个生平字段都没有。它们被算进了上面的分母,所以每一个百分比都比我们悄悄把它们扔掉时要低。
  • **本站早前的一些数字偏高了。**来源数据里的占位字符串被当成了真实值统计,这抬高了好几个覆盖率数字,更糟的是,它们还被写进了女优页的结构化数据里。那些值已经移除。上面这张表是订正后的账,之前的数字不应被引用。

这份数据永远告诉不了你什么?

它永远告诉不了你任何关于作品、片商或发行量的事,因为它根本不包含这些。

索引存的是人脸,不是作品。没有发行日期字段,没有片商或厂牌字段,也没有作品记录。这就排除了一整类既容易伪造、又无法支撑的统计:年度产量、片商市场份额、格式普及的时间线、按年份的类型变迁。

它也框住了我们的措辞。我们从不写某个片商发行了 N 部作品。我们写的是我们索引了 N 个——因为我们数的是聚合站的转载,而这两句话之间的落差,正好就是我们的数据与这个行业之间的落差。

数据与方法

**来源。**106 个公开站点上发布的封面图与视频截图;元数据取自公开的女优资料页;在能够有把握对应时,也使用 Wikidata 标识符。

**样本。**241,792 个人脸向量;2,333 条身份记录(1,707 条有完整资料,626 条只有名字字符串);13,420 条相似女优引用,其中 7,004 条指向没有名字的身份。

**方法。**用 YuNet 检测人脸,依五个关键点对齐,用 ArcFace 编码成 512 维向量,以余弦相似度检索,同一人的阈值为 0.40。元数据从公开资料页解析而来,会做类型与格式校验,校验不过时留空而不是拿别的值顶上。相似女优列表由向量计算得出,不是继承来的。

**快照日期。**2026-08。

**不存什么。**视频文件。用户上传的原图——检测在访客的浏览器里完成,只有裁切出来的人脸区域和它的五个关键点会被传输去比对,查询结果也不保留。索引是用已发布的素材建起来的,绝不是用大家搜了什么建的。

已知偏差。

  • **来源极度集中。**96.3% 的代表图来自一个主机;四个主机加起来就是全部。
  • **聚合站中介。**106 个已索引站点里只有大约 13 个带日式内容 ID,所以我们看到的素材,就是在国际上流通的那些。
  • **记录偏斜。**现有的元数据过度代表了知名度高的女优。
  • **后果。这些数字量的是我们所索引站点上的曝光度,不是发行量或行业构成。**这里的每一个数字,都请先当成关于我们来源的陈述,只有通过推论才是关于这个行业的。

引用。

starlikeness(2026)。《我们的数据从哪来,又缺了什么》。
人脸索引,2026-08 快照(n=241,792 张脸;2,333 条身份记录;
106 个站点;4 个代表图主机)。
https://starlikeness.com/zh-CN/articles/where-our-data-comes-from

相关问题


上面写的全都是关于索引,不是关于你:人脸检测在你的浏览器里运行,只有裁切出来的人脸区域会被送去比对,关于你这次搜索的一切都不会写回这份数据。