搜不到很少是运气不好。它们聚在大约八种反复出现的错误上,而其中大部分都源于把一种方法用在它从来不是为之设计的问题上——然后在它不管用的时候,更用力地再来一遍。

下面逐一列出每个错误、它为什么看起来合情合理,以及该改成怎么做。

哪些错误最浪费时间?

按人们放弃之前浪费掉多少力气来排序。

错误 为什么感觉是对的 实际发生了什么 改成怎么做
拿自己截的画面去用 Google/TinEye 这是最顺手的工具 你截的这一帧从来没有作为一个已发布的文件存在过,所以没有副本可找 改用人脸向量搜索
只看排名,不看分数 排第一的结果看起来很笃定 向量检索永远会返回点什么,哪怕答案根本不在里面 拿分数去对阈值
拿同一张糟糕的截图重试 感觉像是在坚持 这条流水线每次都以完全相同的方式失败 换一张截图
上传前把人脸裁得很紧 看起来能让搜索更聚焦 裁掉了对齐所需的余量,还降低了有效分辨率 按截下来的样子原图上传
把「找到了女优」当成「找到了作品」 一半的答案看起来像全部 你最后会断言一个错误的作品 拿作品列表和场景细节去确认
无视画面上明摆着的番号 感觉图像才是主要证据 你在做图像取证,而一次文本查询几秒钟就能解决 看看片头三十秒里有没有番号
不做视觉核对就信作品列表 数据记录看起来很权威 重名和被合并的记录会产出错误的列表 比对挂在这条记录上的人脸
用手机拍屏幕 比找截图快捷键快 摩尔纹、反光和模糊会毁掉关键点精度 用设备自带的截图功能

为什么「再换个工具试试」通常是错的?

因为同一族系里的工具,是出于同一个结构性原因失败的,在它们之间切换什么都改变不了。

近似重复匹配器——Google 图片、Bing 视觉搜索、TinEye、Yandex——找的都是网络爬取结果里你整张图的副本。你从播放器里截下来的一帧从来没有作为文件被发布过,所以它们谁都没有副本。把四个都跑一遍,等于把同一个实验重复了四次。

族系是值得做的。从近似重复匹配换到人脸向量匹配,改变的是提出的问题本身,因而也改变了失败的条件。这是唯一一种有期望价值的工具切换。

为什么排第一的结果错了还这么有说服力?

因为排序检索没有「找不到」这个概念。你要最接近的十张脸,它就给你十张,不管对的那个人在不在索引里。

这是最常见的一种误读,所以值得直白地说一遍:在列表里的位置本身什么都不代表。 在我们的数据上,余弦相似度的取值范围是 0 到 1,视频截图的校准阈值是 0.40

分数 它代表什么 常见误读
0.31 低于阈值——当成没匹配上 「它排第一,那肯定就是她」
0.44 弱;需要第二条证据 「确认了」
0.72 强;很可能是同一个人 通常读得没错

如果一个工具给你一份没有分数的排序列表,它就是把区分上面这三行的唯一信息拿掉了。

为什么认出女优不等于认出作品?

因为一张脸出现在这位女优拍过的每一部作品里,而人脸向量里没有任何东西编码了你看的是哪一部。

人脸搜索回答的是。要走到哪一部,需要第二个步骤:用场景细节缩小范围——场地、服装、发长、纹身或穿孔、画面上任何可见的文字——拿去对这位女优的已知作品,再用番号确认。人们会跳过这一步,是因为第一个答案给得太具体了,具体到让人觉得它已经完整。

开始之前,该对覆盖范围抱什么预期?

要假定没有哪个索引是完整的,包括我们的;而且要知道,「没有」不会给你一条错误提示,只会给你看似合理但错误的答案。

我们的索引里有来自 106 个站点241,792 张人脸,其中 2,333 张关联到了具名女优(我们的索引,2026-08 快照)。有两个数字能把预期摆正:

  • 2,333 位具名女优里有 2,246 位,代表图来自同一个来源。覆盖高度集中,所以来自我们没有索引的片库的素材是隐形的。
  • 我们的相似女优数据里有 7,004 条指向没有名字的身份的引用。匹配分数很高却没有名字,是一种正常结果——它意味着这张脸进了索引,但识别那一步从来没发生过。

假定覆盖是完整的,本身就是一个错误,因为它会把「不在索引里」变成「一定是这几个结果之一」。

一次有章法的尝试长什么样?

四步,按顺序走完就停:

  1. 一张好截图——两只眼睛都看得见,没有运动模糊,在暂停状态下截取。
  2. 拿最高分去对 0.40 这个阈值。高于它就往下走;低于它就去怀疑截图或覆盖范围,而不是这个人。
  3. 换一张截图,或者换画面里的另一个人。
  4. 如果画面上或文件名里出现了番号,就查一次番号。

如果这四步都失败了,诚实的结论是:以现在能拿到的来源,这份素材够不着。过几个月再查一次,比今天做第五次尝试更有用。

相关问题


如果你一直在拿同一张截图重试,解法是换一张截图,不是换一个工具。传一张新的上来——检测在你的浏览器里跑,而且每条结果都会给出你判断它所需要的分数。