图像搜索工具并不是同一个想法的几种互相竞争的实现。它们分属两个家族,回答的是不同的问题,而选错家族就等于注定失败——不管你在这个家族里挑哪个产品。
第一个家族问的是*「这张图还出现在哪儿?」,第二个家族问的是「这是谁的脸?」*。如果你手上是一张从播放器里截下来的图,那只有第二个问题有答案。
这两个家族真正的差别是什么?
近重复匹配会给整张图算一个指纹,然后在网页抓取的结果里找指纹对得上的。人脸向量引擎则是定位到一张脸,把它归正,编码成一串数字,再拿这串数字去跟一个人脸索引比。
| 近重复匹配 | 人脸向量匹配 | |
|---|---|---|
| 核心问题 | 这张图出现在哪儿? | 这是谁的脸? |
| 比对的单位 | 整图指纹 | 对齐后的人脸 → 数值向量 |
| 需要这张图本身已经在网上存在 | 是 | 否 |
| 裁到只剩脸 | 有害——信号被裁掉了 | 有利——那本来就是它的输入 |
| 换姿势、换光线、换年份 | 通常失败 | 就是为扛住这些设计的 |
| 对你自己截的画面管用吗 | 不管用 | 管用 |
| 典型的失败方式 | 返回一堆不相干的图库照片 | 返回真实的人,但分数很低 |
对视频画面来说,一锤定音的是第三行。你把播放器暂停再截图,就等于造出了一张从来没有以文件形式在网上存在过的图。没有副本可找,近重复匹配也就无从下手——这是结构性的限制,不是质量上的差距。
各家主要工具实际上在干什么?
按行为而不是按品牌来分组,选择就一目了然了。
| 工具 | 家族 | 它匹配什么 | 它在视频画面上会怎么坏掉 |
|---|---|---|---|
| Google Images/Lens | 近重复 + 视觉相似 | 整张图,对上 Google 的抓取库 | 成人站点在抓取库里基本缺席,还被 SafeSearch 压着 |
| Bing Visual Search | 近重复 + 区域搜索 | 整张图,或者你框选的一块 | 面对成人片库是同样的抓取覆盖问题 |
| TinEye | 严格的近重复 | 同一个文件的原版和编辑版副本 | 它明确就是个找副本的工具;一张新画面没有副本 |
| Yandex Images | 近重复 + 很强的视觉相似 | 整张图,相似度排序更松 | 经常返回长得像的陌生人,看起来像命中,其实不是 |
| 通用的网页「人脸搜索」工具 | 人脸向量 | 从开放网络索引来的人脸 | 索引建在开放网络和社交图片上,不是成人片库 |
| 以成人素材建索引的人脸搜索 | 人脸向量 | 从成人封面和截帧索引来的人脸 | 只限于那些来源发布过的内容 |
Yandex 值得单独提个醒。它的视觉相似度排序松到会返回仅仅长得像的人——一样的发型、一样的姿势、一样的配色。用户会把这读成身份识别。它不是;那条流水线里没有任何一环在衡量身份。
为什么索引比引擎更重要?
因为检索只能返回被索引过的东西,而任何算法都补不上缺席的素材。
一个训练到业界顶尖水平的人脸向量引擎,如果指向的是一个开放网络照片的索引,那它就是找不到一位女优——如果她的图只活在那个索引从没抓过的片库里。工程做得多好,跟结果无关。
我们这一份就是专门建在这类素材上的:来自 106 个站点的成人封面与截帧,共 241,792 张脸,其中 2,333 张关联到具名女优(我们的索引,2026-08 快照)。这就是它能回答一个 Google 答不了的问题的全部原因。
值得说清楚的边界: 我们的覆盖是偏的。那 2,333 位具名女优里有 2,246 位的代表图来自单一来源。我们覆盖的片库之外的一切,对我们来说都是不可见的,而我们照样会给你一份差一点点的候选排序——这也正是为什么每条结果都带着分数,其中 0.40 是针对视频截帧标定出来的阈值。
这些工具在「你交出去什么」这件事上有什么不同?
比较通常停在结果质量上,但这些工具在隐私架构上的差别,比在算法上的差别还大。
| 行为 | 典型的整文件上传工具 | 浏览器侧检测 |
|---|---|---|
| 原图会被传出去 | 会 | 不会 |
| 元数据(GPS、设备、时间戳)会被传出去 | 会,除非事先剥掉 | 从不发送 |
| 脸以外的内容会被传出去 | 会 | 不会 |
| 发给服务器的是什么 | 完整文件 | 人脸裁剪块 + 5 个关键点坐标 |
| 用户能不能自己验证 | 只能靠政策上的说法 | 能——直接看网络请求 |
两个家族里的多数工具都是把整个文件传上去,因为那样做起来更简单。把检测放在客户端跑,意味着服务器根本不会收到原图。
各大服务对它们收到的上传图片是怎么说的,差异比你想的要大,而有用的分界线在于「有明确政策」和「什么都没说」之间。
| 服务 | 关于保留上传内容 | 关于用于训练 |
|---|---|---|
| 只有在开了视觉搜索历史时才保存,而这个开关默认是关的 | 开着的话,图片可能被用于训练它的视觉搜索模型;训练副本最多保留四年,并与账号解绑 | |
| Bing Visual Search | 没有公布保留期限 | 说照片可能被用来改进它的图像处理;没有用「训练」这个词 |
| Yandex Images | 没有针对图片的说明 | 没有针对图片的说明 |
| TinEye | 声明上传内容在结果展示后即删除,且绝不加进它的索引 | 两边都没有说明 |
把空着的格子读成「未知」,而不是读成「放心」。还有两个坑:大家常拿来引用的微软那句大方的「我们不拿你的图片做训练」,属于它的图像生成产品,不属于视觉搜索;而上面那条 Google 的默认设置,是针对它的 App 和 Lens 界面写的,没有一条对应的说明覆盖未登录状态下的桌面端上传。
来源:各服务自己公布的帮助页或政策页;2026-08-03 核对。
那你到底该用哪一个,什么时候用?
- 你手上是一张已发布的图——封面、宣传剧照,或者任何以文件形式存在于网上的东西:先用近重复匹配是对的第一步。它能找到这张图出自哪个页面。
- 你手上是自己截下来的一帧:直接上人脸向量搜索。近重复匹配不会管用,再试几次也改变不了这一点。
- 你手上有一张脸,但怀疑这个人不是女优:任何以成人素材建索引的引擎都帮不上忙,而把它用在一位普通人身上,是对这个工具的滥用,不是什么聪明的变通。
- 你手上有番号或者片名文本:图像搜索完全可以跳过。文本查找比任何视觉方法都更快、更可靠。
在你把时间投进任何一个工具之前,有个一步到位的诊断:把图裁到只剩脸,再搜一遍。如果结果变得更差,那这个工具做的是近重复匹配,它认不出任何人。
相关问题
这个比较用实验来定最省事:把同一帧画面分别丢给一个近重复工具和这里的人脸搜索。检测在你的浏览器里运行——原图绝不会离开你的设备,而每条结果都会显示它的分数。