图像搜索工具并不是同一个想法的几种互相竞争的实现。它们分属两个家族,回答的是不同的问题,而选错家族就等于注定失败——不管你在这个家族里挑哪个产品。

第一个家族问的是*「这张图还出现在哪儿?」,第二个家族问的是「这是谁的脸?」*。如果你手上是一张从播放器里截下来的图,那只有第二个问题有答案。

这两个家族真正的差别是什么?

近重复匹配会给整张图算一个指纹,然后在网页抓取的结果里找指纹对得上的。人脸向量引擎则是定位到一张脸,把它归正,编码成一串数字,再拿这串数字去跟一个人脸索引比。

近重复匹配 人脸向量匹配
核心问题 这张图出现在哪儿? 这是谁的脸?
比对的单位 整图指纹 对齐后的人脸 → 数值向量
需要这张图本身已经在网上存在
裁到只剩脸 有害——信号被裁掉了 有利——那本来就是它的输入
换姿势、换光线、换年份 通常失败 就是为扛住这些设计的
对你自己截的画面管用吗 不管用 管用
典型的失败方式 返回一堆不相干的图库照片 返回真实的人,但分数很低

对视频画面来说,一锤定音的是第三行。你把播放器暂停再截图,就等于造出了一张从来没有以文件形式在网上存在过的图。没有副本可找,近重复匹配也就无从下手——这是结构性的限制,不是质量上的差距。

各家主要工具实际上在干什么?

按行为而不是按品牌来分组,选择就一目了然了。

工具 家族 它匹配什么 它在视频画面上会怎么坏掉
Google Images/Lens 近重复 + 视觉相似 整张图,对上 Google 的抓取库 成人站点在抓取库里基本缺席,还被 SafeSearch 压着
Bing Visual Search 近重复 + 区域搜索 整张图,或者你框选的一块 面对成人片库是同样的抓取覆盖问题
TinEye 严格的近重复 同一个文件的原版和编辑版副本 它明确就是个找副本的工具;一张新画面没有副本
Yandex Images 近重复 + 很强的视觉相似 整张图,相似度排序更松 经常返回长得像的陌生人,看起来像命中,其实不是
通用的网页「人脸搜索」工具 人脸向量 从开放网络索引来的人脸 索引建在开放网络和社交图片上,不是成人片库
以成人素材建索引的人脸搜索 人脸向量 从成人封面和截帧索引来的人脸 只限于那些来源发布过的内容

Yandex 值得单独提个醒。它的视觉相似度排序松到会返回仅仅长得像的人——一样的发型、一样的姿势、一样的配色。用户会把这读成身份识别。它不是;那条流水线里没有任何一环在衡量身份。

为什么索引比引擎更重要?

因为检索只能返回被索引过的东西,而任何算法都补不上缺席的素材。

一个训练到业界顶尖水平的人脸向量引擎,如果指向的是一个开放网络照片的索引,那它就是找不到一位女优——如果她的图只活在那个索引从没抓过的片库里。工程做得多好,跟结果无关。

我们这一份就是专门建在这类素材上的:来自 106 个站点的成人封面与截帧,共 241,792 张脸,其中 2,333 张关联到具名女优(我们的索引,2026-08 快照)。这就是它能回答一个 Google 答不了的问题的全部原因。

值得说清楚的边界: 我们的覆盖是偏的。那 2,333 位具名女优里有 2,246 位的代表图来自单一来源。我们覆盖的片库之外的一切,对我们来说都是不可见的,而我们照样会给你一份差一点点的候选排序——这也正是为什么每条结果都带着分数,其中 0.40 是针对视频截帧标定出来的阈值。

这些工具在「你交出去什么」这件事上有什么不同?

比较通常停在结果质量上,但这些工具在隐私架构上的差别,比在算法上的差别还大。

行为 典型的整文件上传工具 浏览器侧检测
原图会被传出去 不会
元数据(GPS、设备、时间戳)会被传出去 会,除非事先剥掉 从不发送
脸以外的内容会被传出去 不会
发给服务器的是什么 完整文件 人脸裁剪块 + 5 个关键点坐标
用户能不能自己验证 只能靠政策上的说法 能——直接看网络请求

两个家族里的多数工具都是把整个文件传上去,因为那样做起来更简单。把检测放在客户端跑,意味着服务器根本不会收到原图。

各大服务对它们收到的上传图片是怎么说的,差异比你想的要大,而有用的分界线在于「有明确政策」和「什么都没说」之间。

服务 关于保留上传内容 关于用于训练
Google 只有在开了视觉搜索历史时才保存,而这个开关默认是关的 开着的话,图片可能被用于训练它的视觉搜索模型;训练副本最多保留四年,并与账号解绑
Bing Visual Search 没有公布保留期限 说照片可能被用来改进它的图像处理;没有用「训练」这个词
Yandex Images 没有针对图片的说明 没有针对图片的说明
TinEye 声明上传内容在结果展示后即删除,且绝不加进它的索引 两边都没有说明

把空着的格子读成「未知」,而不是读成「放心」。还有两个坑:大家常拿来引用的微软那句大方的「我们不拿你的图片做训练」,属于它的图像生成产品,不属于视觉搜索;而上面那条 Google 的默认设置,是针对它的 App 和 Lens 界面写的,没有一条对应的说明覆盖未登录状态下的桌面端上传。

来源:各服务自己公布的帮助页或政策页;2026-08-03 核对。

那你到底该用哪一个,什么时候用?

  • 你手上是一张已发布的图——封面、宣传剧照,或者任何以文件形式存在于网上的东西:先用近重复匹配是对的第一步。它能找到这张图出自哪个页面。
  • 你手上是自己截下来的一帧:直接上人脸向量搜索。近重复匹配不会管用,再试几次也改变不了这一点。
  • 你手上有一张脸,但怀疑这个人不是女优:任何以成人素材建索引的引擎都帮不上忙,而把它用在一位普通人身上,是对这个工具的滥用,不是什么聪明的变通。
  • 你手上有番号或者片名文本:图像搜索完全可以跳过。文本查找比任何视觉方法都更快、更可靠。

在你把时间投进任何一个工具之前,有个一步到位的诊断:把图裁到只剩脸,再搜一遍。如果结果变得更差,那这个工具做的是近重复匹配,它认不出任何人。

相关问题


这个比较用实验来定最省事:把同一帧画面分别丢给一个近重复工具和这里的人脸搜索。检测在你的浏览器里运行——原图绝不会离开你的设备,而每条结果都会显示它的分数。