日本成人影片的英文元数据不是翻译一次然后大家共用的。它是每一家片库各自生成的,来源可能是机器翻译、外包译者,也可能是内部员工,而这一切背后都没有一份共同的术语表。

结果就是系统性的分歧。同一个标签在三个站点上变成三个英文词,同一个片名变成三个句子,而且——这是可以量化的——同一个人变成两个名字。

女优的名字到底有多常对不上?

常到应该把它当成常态,而不是异常。

在我们的索引里,2,333 位具名女优中有 197 位,其罗马字艺名与同一个人在至少一种其他语言的元数据中记录的名字对不上(我们的索引,2026-08 快照,n=2,333)。这大概是十二分之一。

这些分歧分成几种不同的类型,而把它们混为一谈本身就是一个常见错误:

类型 发生了什么 典型样子
多个艺名 这位女优在不同职业阶段或不同片商那里用过不同的名字 同一个人有两个毫不相干的名字
姓名顺序 一个来源姓在前,另一个来源名在前 同样两个词,顺序反过来
罗马字写法的选择 长音、助词和双辅音的处理方式不同 多一个字母,或者多出一个连字符
转写错误 一个汉字名字的少见读法被猜错了 一个看似合理但错误的读音

值得讲清楚的边界: 我们这个数字统计的是我们手上跨语言版本之间名字字符串的不一致。不逐个核对的话,它没法区分「另起的第二个艺名」和「罗马字写法的差异」,所以请把它读成「靠名字查人有多不可靠」的一个度量,而不是「有多少个别名」的计数。

哪些类型词最常被译错?

那些在英文里根本没有对应词的,以及那些最接近的英文词自带额外包袱的。

日文词 常见英文译法 出了什么问题
素人(Shirouto) "amateur" 英文的 amateur 暗示内容是用户自制的;日文这个标签标的是商业作品里的一种制作风格
単体(Tanpin) "solo" 在英文成人元数据里 solo 指只有一个人的场景;単体指的是围绕一位挂名女优做的作品
痴女(Chijo) "slut"、"nympho" 塞进了一层片库标签本身没有的道德评判;它标的是谁在主导这场戏
美乳(Binyu) "big tits" 美乳是对形状的称赞,完全不含任何尺寸主张
人妻(Hitozuma) "MILF" 加进了一个日文标签并没有做出的年龄假设
寝取らせ(Netorase) "NTR" 把一组三向的语法区分压进了同一个桶
総集編(Soshuhen) 各站不一 被译成 compilation、collection、highlights 或 omnibus,于是同一部作品要用四个不同的词才找得全
独占(Dokusen) "exclusive" 英文的 exclusive 涵盖独家代理、抢先上架和自制三种情况;日文把这三种分得清清楚楚

整张表的规律是一致的:英文词与其说是错的,不如说是比原文更宽或更窄,而这个差异,对只看得到英文的读者来说是隐形的。

为什么片名比标签分歧更大?

因为片名是一整段营销文案,每多一个词,就多一次产生分歧的机会。

日文片名把系列名、设定、强调词和数字主张全塞在一个字符串里。要把它翻出来,需要几十个小决定——哪些强调词要保留、数字主张要不要照字面译、括号里的状态标记要不要留。两位称职的译者会做出肉眼可见地不同的结果,机器翻译再产出第三种。

最常见的几种失败方式:

  • 强调词照字面翻,产出的英文读起来像一个事实主张,而日文那边纯粹只是在加强语气
  • 括号里的状态标记被丢掉,于是一部合集或复刻版失去了标识自己身份的那个标签
  • 数字主张被重排,把一个时长数字和赋予它意义的那个词拆开了
  • 系列名被意译而不是音译,于是同一系列的各部作品看起来不再是一家的

那到底该用什么来搜?

有番号就用番号。它是唯一一个能完好无损地熬过翻译、复刻和平台更替的字段。

字段 稳定吗? 为什么
番号 稳定 由片商一次性指定;从不本地化
日文片名 大体稳定 偶尔会为了显示而被截短
日文女优名 大体稳定 除非这位女优换了艺名,否则是稳的
罗马字女优名 不稳定 按上面那个数字,大约十二个里有一个对不上
英文片名 不稳定 每家片库各自重新生成
英文类型标签 不稳定 不存在共同的词汇表

如果你手上只有一个罗马字名字而且搜不到东西,最可能的解释不是这位女优冷门——而是你拿到的是流通中好几种拼写里的一种,而你搜的那个片库用的是另一种。

相关问题


名字搜不到的时候,直接匹配人脸就完全绕开了拼写问题——人脸向量不在乎这个名字的罗马字是怎么拼的。