这个领域里的数据库,并不是同一份名单的几个竞争版本。它们是四种不同的记录,由不同的来源、为不同的目的建起来,每一种都只在一小组字段上具有权威性,出了这个范围就不可靠

真正的本事不是挑一个网站,而是认出眼前这一类是什么,从而知道它哪些字段可信。销售平台知道自己卖什么,别的一概不知。社区数据库知道更多作品,也错得更多。两者都不是在骗你;它们本来就是为回答不同的问题而建的。

数据库分成哪四类?

这四类是:销售平台片库、社区元数据库、以女优为中心的索引,以及图片或人脸索引。它们的区别在于数据从哪儿来,而那决定了它们全部的失效方式。

类别 数据来源 最擅长 已知短板
销售平台片库 卖家自己的商品记录 标准番号、官方标题、封面图、当下买得到什么 只覆盖这家卖家在卖的东西;下架作品可能整条消失
社区元数据库 用户投稿,常常是先抓取再人工订正 跨片商、跨年代的广度,包括已绝版的内容 准确度参差、条目过期、贡献者之间字段定义不一致
以女优为中心的索引 以人为主键汇总的作品列表 追踪同一个人跨片商、跨时间的作品 一遇艺名更换就断;早期或未署名的作品经常缺失
图片/人脸索引 封面图与截图,按视觉相似度比对 手上只有一张图、完全没有文字时,找出这个人是谁 只返回被索引过的内容;没法直接告诉你作品,只能告诉你人

每一行的短板都是它的数据来源直接导致的。这就是为什么再怎么使劲,销售平台也覆盖不了绝版作品;也是为什么社区数据库永远做不到卖家商品表那种内部一致。

什么时候该去查销售平台片库?

当你需要一条记录的标准形态时:确切的番号、发行方所写的官方标题、封面,以及这部作品当下买不买得到。

销售平台的数据是商业活动的副产品,这让它在自己的范围内异常可靠:卖家有直接的经营理由把番号、标题和在售状态维持正确,因为这些字段驱动着它自家的搜索和履约。对几年前就停售的作品,没人有这份动力,而那正好就是销售平台开天窗的地方。

常见的错误是把销售平台当成普查。在销售平台上查不到,意思是「这儿没卖」,从来不是「不存在」。如果你想确认某个东西到底有没有发行过,销售平台是错的工具。

销售平台的数据也是这个领域里最适合机器读取的数据,如果你要做点什么东西,这值得知道。FANZA 的运营方在 api.dmm.com/affiliate/v3/ 提供商品 API,商品、女优、片商、系列、类型和片库分区各有独立端点,返回内容编号、标题、日期和图片网址;它需要一组 API ID 和一组联盟 ID,所以是挡在联盟账号后面的,并不开放(对照 DMM.com Labo 自家的 Go SDK 确认,pkg.go.dev/github.com/dmmcomlabo/dmm-go-sdk/api,2026-08-03 核对)。整个市场都是这个模式:片库可以整批拿到,但要以联盟数据流的形式,附带那意味着的商业条件。

什么时候该改信社区数据库?

存在性和广度上信社区数据库——确认某部作品或某位女优确实存在,以及找到已经没有任何地方在卖的内容。

这确实有价值,而且没有任何商业来源能复制出来。代价是字段定义会在贡献者之间漂移。「发行日期」可能指公布日、线上发行日,也可能指实体发行日。演职员信息可能抄自封面、抄自商品页,或者抄自另一个从别处抄来的数据库。错误会传播,因为数据库之间互相抓取——这就是为什么同一个错误的出生年份能出现在四个网站上,看着像互相印证。

社区数据库之间说法一致,只能当成弱证据,不是强证据。两个网站对上了,可能是两条独立记录——也可能是同一条记录被抄了两遍。

以女优为中心的索引做了什么别人做不到的事?

女优索引是以、而不是以商品为主键的,那是唯一能跨片商追完一段职业生涯的结构。

这才是它真正的用处。销售平台按自己卖什么来组织;女优索引按里面是谁来组织。如果你想知道某个人在换片商前后各做过什么,只有以人为主键的结构能在一次查询里给出答案。

它们的典型失效是改名。艺名会在换经纪公司、换片商时更改,有时也会在出道和复出之间更改,于是同一个人变成两条记录、两份残缺的作品列表。纯文本的数据库没有任何机制能自动察觉这件事——那两条记录没有任何共用字段。

这也是为什么一份作品列表应该当成下限来读。它是「这个索引所知道的、挂在这个名字下的东西」的清单,不是「这个人拍过什么」的清单。

图片或人脸索引处在什么位置?

图片索引回答的是其他几类在结构上就答不了的那个问题:手上只有一张图时,这是谁

每一个文字数据库都要求你已经知道一个名字、一个番号或一个标题。如果你只有视频里的一帧画面、一个字都没有,它们就没有入口。人脸比对把这件事反了过来:先检测出人脸,把它编码成一组向量,再拿去和已经索引的人脸比对,返回的是人,不是作品。

我们自己的索引收了 241,792 张人脸、覆盖 2,333 位具名女优,取自 106 个站点上的封面图和截图(我们的索引,2026-08 快照)。

边界比数字更重要。 覆盖并不均匀:那 2,333 位具名女优里,有 2,246 位的代表图来自单一个站点。这是相当大的偏斜,也意味着从没在我们主要来源上出现过的女优,被找到的概率要低得多——而工具照样会返回一串排好序的「差一点」。任何图片索引都有这种形状的局限;好的那些会主动告诉你。

图片索引同样不会给你作品名。它给你一个人,作品名来自第二步——用场景细节把这个人的已知作品缩小范围。人脸搜索和作品列表数据库是互补的,不是互相替代的。

怎么判断单独一条记录值不值得信?

判断这一条,而不是判断这个网站。有四个信号能把「核对过的记录」和「抄来的记录」分开:

  1. 它有没有引用来源番号? 带着发行方自家商品编号的条目可以往回追溯。只带一个标题的就不行。
  2. 它有没有区分旧艺名和现用艺名? 一个把别名明确建模的数据库,说明它想过改名这件事。只有单一个扁平姓名字段的,会不声不响地把一段生涯切成两半。
  3. 这条记录带日期吗? 一条没有「最后更新」的条目,跟一条 2015 年就被扔在那儿不管的条目分不出来。
  4. 空字段是空着,还是填了看着合理的垃圾? 占位用的值——凑整的三围、默认的出生日期——是这个字段从未核实过的强烈信号。空白字段比猜出来的字段诚实。

坚持用这四个问题去问,对准确度的帮助远大于挑一个「最好的」网站,因为它们让你能一条一条地打分,而不是整批地信任某个来源。

相关问题


我们索引的来源,以及每一个各自贡献了什么,都列在我们的站点页面