一帧能用的画面只需要一件事:一张眼睛、鼻子和两个嘴角都看得见的脸,而且拍得足够清晰,让这些点能被精确定位。大家操心的那些东西——光线、背景、整张图的分辨率——重要性都远远比不上这一点。
原因很机械。人脸搜索会检测五个特征点,用它们把脸摆正成标准姿势,然后紧紧裁切、丢掉其余部分。只要特征点看得见、够清晰,这一帧就能用。如果看不见,再高的画质也救不回来。
具体来说,什么让一帧画面变好或变坏?
判断那张脸,而不是判断那张图。
| 因素 | 好 | 勉强 | 失败 |
|---|---|---|---|
| 头部角度 | 正面到转约 30° | 转 30–45° | 很硬的侧脸、后脑勺 |
| 遮挡 | 整张脸都看得见 | 头发盖住一只眼 | 手、物体或浓重阴影盖住眼睛或嘴 |
| 清晰度 | 静止或慢动作 | 轻微模糊 | 运动模糊把五官抹开 |
| 脸在画面里的大小 | 脸占了画面相当大的比例 | 中景 | 远景,脸只有几十个像素宽 |
| 脸上的光线 | 均匀,亮或暗都行 | 一侧在阴影里 | 剪影、过曝的高光 |
| 压缩 | 播放器的原生截图 | 重新存过的 JPEG | 截图的截图、明显的压缩噪块 |
| 背景 | 无关 | 无关 | 无关 |
最后那一行不是玩笑——它是整张表上最有用的一条。人们常因为房间又暗又乱就把画面扔了。对齐会把整个房间裁光。看那张脸就够了。
截一张的步骤是什么?
- 拖到女优面向镜头的那一刻。 对白、开场戏和反应镜头通常是最好的来源。往前拖五秒不花什么成本;跟一帧烂画面死磕的代价却很高。
- 完全暂停。 暂停下来的画面是清晰的。播放过程中抓下来的画面,尤其是在卡顿的流媒体上,可能抓到一帧只解码了一半的画面。
- 用设备自带的截图功能,别拿手机对着屏幕拍。macOS 用内置的截图;Windows 用截图工具或 Print Screen;手机用实体按键组合。
- 按原生分辨率截取。 如果播放器是缩小的窗口,先最大化或切成全屏。没截下来的细节,事后补不回来。
- 不要事先裁到只剩脸。 就保持截下来的原样,或者裁得宽松一点。对齐器需要特征点周围的边距。
- 能选的话存成 PNG。 PNG 是无损的;重新存成低质量的 JPEG,噪块正好加在细微面部细节所在的位置。
- 看看还有没有别的脸值得一试。 如果场景里不止一个人,你辨认的机会就不止一次。
为什么人一眼就认得出的侧脸,机器却会失败?
因为转过去的头把对齐器需要的特征点藏了起来,而编码器训练时看到的,压倒性地都是没转那么多的脸。
在很硬的侧脸里,一只眼睛看不见,一个嘴角也常被遮住。对齐于是去估算它看不到的位置,摆正的结果就是错的。跑出来的人脸向量,是对一张并不真正存在的脸的自信描述。它照样会返回结果——只是返回错的那些,而且分数看起来还过得去。
实用原则是:两只眼睛都看得清楚,就继续;只看得到一只,就去换一帧。
好几帧画面里该挑哪一帧?
有得挑的时候,就按「有多少身份信号能撑过整条流程」来排序。
| 优先级 | 画面类型 | 为什么 |
|---|---|---|
| 1 | 特写、正面、暂停、光线好 | 特征点精度最高 |
| 2 | 中景、正面、清晰 | 像素少一些,但几何完整 |
| 3 | 中等角度的特写 | 角度会损失准确度,但还救得回来 |
| 4 | 封面图或宣传剧照,如果找得到 | 往往正是索引建立时用的那类素材 |
| 5 | 远景或很斜的角度 | 最后的办法 |
第 4 行值得记住。索引条目是用封面和剧照建起来的——我们的索引里有 241,792 张脸,取自 106 个站点上的这类素材(我们的索引,2026-08 快照)。如果你能找到封面图而不是视频画面,你用的素材就更接近索引本身的分布,分数通常也会反映出来。
怎么知道这一帧够不够好?
看分数,别看排名。余弦相似度的范围是 0 到 1,我们针对视频截图校准出来的阈值是 0.40。
如果你最好的结果比阈值低一大截,第一个该怀疑的是这一帧,而不是索引。不管对的人在不在索引里,向量搜索都会返回它最接近的候选,所以一串低分既可能是「画面不好」,也可能是「没被索引」。同一个人的第二帧画面能免费解掉这个歧义,这也是它永远是下一步的原因。
**值得说清楚的边界:**再完美的画面也找不到我们从没索引过的人,而我们的来源很集中——2,333 位具名女优里有 2,246 位,代表图来自同一个站点。一张好截图能把机会拉到最大,但它变不出覆盖范围。
相关问题
只要你有一帧两只眼睛都看得见、也没有运动模糊的画面,就在这里上传。检测在你的浏览器里执行,所以你会立刻知道有没有检测到脸——如果没有,那就什么都没送出去。