没有哪个平台的搜索是笼统意义上最好的,因为这个领域的搜索引擎是沿着不同的轴失败的——而哪一种失败会伤到你,完全取决于你怎么搜。值得拥有的答案是你自己量出来的那个,用你真正会去找的作品,花大概二十分钟。

下面是这套测试的设计,以及更重要的:结果该怎么读。一次「没找到」可能意味着三件完全不同的事,把它们混为一谈,正是大多数「某某站搜索很烂」的说法站不住脚的原因。

我们自己没有跨平台跑过这套基准测试,所以这篇文章不会给你任何分数。它给你的是一套方法,产出的分数对你自己的用法有效——那也是唯一能迁移的版本。

这套测试具体包括什么?

拿 10 到 20 个你已经确定存在的番号,在每个平台的搜索里各跑一遍,记录返回了什么、花了几步。

组成比数量更重要。一组全部取自近期大片商新作的测试集,会告诉你每个平台都很优秀,因为那是每个引擎都搞得定的简单情况。要把难的情况建进这组里:

测试项类型 几个 它在探什么
近期、大片商 3 基线——到哪儿都该成功
五年以上的老片 3 片库和索引留不留得住旧内容
较小或小众的厂牌 3 主流之外的收录情况
女优姓名,不是番号 2 以人为键的索引和艺名处理
日文原文片名,照原样输入 2 索引里有没有存原始片名文本
罗马化片名,不带番号 2 转写形式到底有没有被索引

每一项都记三件事:正确的结果有没有出现、它是排在前几条还是被埋了、从搜索框到作品页要点几下。第三列是大家会忘的那一列,而日常使用中平台之间差别最看得见的地方,正是它。

你实际上在测的失败方式有哪些?

有五种彼此不同的机制,会让引擎搜不到自己明明有的作品。每一种产生的症状都不一样,这也正是这套测试能当诊断用、而不只是记分牌的原因。

番号归一化。 番号在整个行业里、在整个互联网上的写法都不统一——带连字符的、不带的、补前导零的、带或不带片商前缀的。引擎要么把你输入的字符串归一化成它内部的形式,要么不。光是这一个机制,就能解释大部分「在这个站能用、在那个站不行」的报告。

文字体系与转写。 片名以日文文本存在;英文圈的观众输入的是一种罗马化写法。那种写法配不配得上,取决于平台到底存不存它,以及存的是谁的那一版罗马化。转写没有唯一正确的答案,所以这一项经常失败,而且是无声地失败。

艺名处理。 女优会改艺名。有艺名建模的索引,用哪个名字搜都能返回整段生涯;只有一个扁平姓名字段的索引,你碰巧输入哪半边就只返回哪半边。

匹配严格度。 精确匹配的引擎,差一点点就什么都不返回。模糊匹配的引擎则什么都能返回点东西,包括正确答案根本不在的时候——那是另一种失败,而且可以说更糟,因为它看起来像成功。

收录。 这部作品压根就不在那个片库里。这根本不算搜索失败,而把它算成搜索失败,是这类比较里最常见的错误。

怎么分辨是搜索没搜到,还是片库压根没有?

拿同一个番号去另一个你已经知道有它的平台上交叉验证一下。如果在那边找得到,那第一个平台要么是没有这部作品,要么是配不上你的查询——再多做一步测试就能把这两种分开。

另一个抓手去搜同一部作品:女优的名字、片商的系列名,或者片名里一个有辨识度的关键词。如果作品从这条路出现了,那说明片库里有它,坏掉的是番号查找。如果哪条路都出不来,那就是收录缺失,搜索质量再好也帮不上忙。

症状 它告诉你这个引擎的什么
带连字符的番号失败,不带的可以 没有输入归一化——你得去迁就它内部的格式
正确结果出现了,但排在一堆不相干的作品下面 匹配是好的;相关性排序很弱
搜女优姓名只返回了已知作品年表的一部分 艺名处理缺失或不完整
日文片名可以,罗马化写法什么都搜不到 只索引了原文文本
每个查询都返回看似合理的结果,连乱敲的查询也一样 模糊匹配且没有置信度下限——所有结果都要存疑
番号、姓名、关键词都找不到 是收录缺失,不是搜索失败
找到了,但要点四下以上才到得了 是导航成本,不是检索质量——但仍然值得记下来

乱敲查询那一行值得强调。输一个不可能存在的番号——随便一个前缀加数字。会为它返回一副胸有成竹的结果的引擎,在你真正要找的东西不存在时也会这么干,而你没法把这两种情况分开。

遇到搜索很烂的平台,该怎么办?

在换平台之前先换查询格式——这些失败大多是你自己这边就能修的。

  • 每种番号写法都试一遍。 带连字符和不带、补前导零和不补、只用前缀。试三次花十秒,就能解决最常见的那种失败。
  • 搜女优,而不是搜片名。 以人为键的浏览路径,完全绕开了番号归一化。
  • 手上有日文原文就用日文原文。 从数据库条目里复制粘贴,而不是自己敲一串罗马化写法。
  • 搜一个有辨识度的片段,而不是完整片名。长的精确字符串差一个字符就会失败;一个罕见的片段通常不会。

如果你手上压根没有任何文字——只有一张截图——那任何平台的搜索框都不是对的工具,因为它们都要你给出一串你没有的字符。那是另一个问题,要用另一套方法:从一张截图找出视频

你自己的结果该怎么解读?

把这套测试读成一份画像,而不是一份排名。你要的产出是这样一句话:「平台 A 对老片处理得好,但把女优姓名搞得一团糟;平台 B 正好反过来」——因为那才告诉你哪种搜索该开哪个站,而这正是大家实际同时用多个平台的方式。

有两个得诚实说明的界限。十五个项目是一份诊断样本,不是统计样本,所以别把它换算成百分比。而你的测试集是从你自己的兴趣里挑出来的,所以结果对你有效、不能推而广之——这恰恰就是为什么一份公开发布的通用排名帮不了你。

相关问题


我们索引的平台,以及每个平台覆盖什么,都列在我们的站点页上。