一帧能用的画面只需要一件事:一张眼睛、鼻子和两个嘴角都看得见的脸,而且拍得足够清晰,让这些点能被精确定位。大家操心的那些东西——光线、背景、整张图的分辨率——重要性都远远比不上这一点。

原因很机械。人脸搜索会检测五个特征点,用它们把脸摆正成标准姿势,然后紧紧裁切、丢掉其余部分。只要特征点看得见、够清晰,这一帧就能用。如果看不见,再高的画质也救不回来。

具体来说,什么让一帧画面变好或变坏?

判断那张脸,而不是判断那张图。

因素 勉强 失败
头部角度 正面到转约 30° 转 30–45° 很硬的侧脸、后脑勺
遮挡 整张脸都看得见 头发盖住一只眼 手、物体或浓重阴影盖住眼睛或嘴
清晰度 静止或慢动作 轻微模糊 运动模糊把五官抹开
脸在画面里的大小 脸占了画面相当大的比例 中景 远景,脸只有几十个像素宽
脸上的光线 均匀,亮或暗都行 一侧在阴影里 剪影、过曝的高光
压缩 播放器的原生截图 重新存过的 JPEG 截图的截图、明显的压缩噪块
背景 无关 无关 无关

最后那一行不是玩笑——它是整张表上最有用的一条。人们常因为房间又暗又乱就把画面扔了。对齐会把整个房间裁光。看那张脸就够了。

截一张的步骤是什么?

  1. 拖到女优面向镜头的那一刻。 对白、开场戏和反应镜头通常是最好的来源。往前拖五秒不花什么成本;跟一帧烂画面死磕的代价却很高。
  2. 完全暂停。 暂停下来的画面是清晰的。播放过程中抓下来的画面,尤其是在卡顿的流媒体上,可能抓到一帧只解码了一半的画面。
  3. 用设备自带的截图功能,别拿手机对着屏幕拍。macOS 用内置的截图;Windows 用截图工具或 Print Screen;手机用实体按键组合。
  4. 按原生分辨率截取。 如果播放器是缩小的窗口,先最大化或切成全屏。没截下来的细节,事后补不回来。
  5. 不要事先裁到只剩脸。 就保持截下来的原样,或者裁得宽松一点。对齐器需要特征点周围的边距。
  6. 能选的话存成 PNG。 PNG 是无损的;重新存成低质量的 JPEG,噪块正好加在细微面部细节所在的位置。
  7. 看看还有没有别的脸值得一试。 如果场景里不止一个人,你辨认的机会就不止一次。

为什么人一眼就认得出的侧脸,机器却会失败?

因为转过去的头把对齐器需要的特征点藏了起来,而编码器训练时看到的,压倒性地都是没转那么多的脸。

在很硬的侧脸里,一只眼睛看不见,一个嘴角也常被遮住。对齐于是去估算它看不到的位置,摆正的结果就是错的。跑出来的人脸向量,是对一张并不真正存在的脸的自信描述。它照样会返回结果——只是返回错的那些,而且分数看起来还过得去。

实用原则是:两只眼睛都看得清楚,就继续;只看得到一只,就去换一帧。

好几帧画面里该挑哪一帧?

有得挑的时候,就按「有多少身份信号能撑过整条流程」来排序。

优先级 画面类型 为什么
1 特写、正面、暂停、光线好 特征点精度最高
2 中景、正面、清晰 像素少一些,但几何完整
3 中等角度的特写 角度会损失准确度,但还救得回来
4 封面图或宣传剧照,如果找得到 往往正是索引建立时用的那类素材
5 远景或很斜的角度 最后的办法

第 4 行值得记住。索引条目是用封面和剧照建起来的——我们的索引里有 241,792 张脸,取自 106 个站点上的这类素材(我们的索引,2026-08 快照)。如果你能找到封面图而不是视频画面,你用的素材就更接近索引本身的分布,分数通常也会反映出来。

怎么知道这一帧够不够好?

看分数,别看排名。余弦相似度的范围是 0 到 1,我们针对视频截图校准出来的阈值是 0.40

如果你最好的结果比阈值低一大截,第一个该怀疑的是这一帧,而不是索引。不管对的人在不在索引里,向量搜索都会返回它最接近的候选,所以一串低分既可能是「画面不好」,也可能是「没被索引」。同一个人的第二帧画面能免费解掉这个歧义,这也是它永远是下一步的原因。

**值得说清楚的边界:**再完美的画面也找不到我们从没索引过的人,而我们的来源很集中——2,333 位具名女优里有 2,246 位,代表图来自同一个站点。一张好截图能把机会拉到最大,但它变不出覆盖范围。

相关问题


只要你有一帧两只眼睛都看得见、也没有运动模糊的画面,就在这里上传。检测在你的浏览器里执行,所以你会立刻知道有没有检测到脸——如果没有,那就什么都没送出去。