La recherche par visage ne compare pas des images. Elle convertit chaque visage en une liste fixe de nombres — un vecteur — et compare ces vecteurs. Deux photographies de la même personne, prises à des années d'intervalle dans des pièces différentes, produisent des vecteurs très proches l'un de l'autre alors même que les images ne partagent presque aucun pixel.
Comprendre les quatre étapes vous dit exactement pourquoi certaines captures d'écran fonctionnent du premier coup et pourquoi d'autres échouent quel que soit le nombre d'essais.
Que se passe-t-il à l'étape un, la détection ?
La détection répond à une question plus étroite qu'on ne l'imagine : où, dans cette image, y a-t-il un visage, et où sont ses cinq points clés ?
Le détecteur balaie l'image et renvoie, pour chaque visage trouvé, un cadre de délimitation plus cinq coordonnées de points caractéristiques — œil gauche, œil droit, pointe du nez, coin gauche de la bouche, coin droit de la bouche. Nous utilisons YuNet pour cette étape. Rien concernant l'identité ne s'est encore produit ; c'est de la géométrie pure.
Si la détection échoue, tout ce qui suit échoue. Et elle échoue pour des raisons qui n'ont rien à voir avec la qualité d'image au sens habituel : une main devant la bouche, un profil marqué, un visage plus petit que la taille minimale du détecteur.
Que se passe-t-il à l'étape deux, l'alignement ?
L'alignement se sert de ces cinq points pour déformer le visage vers une position canonique — les yeux sur une ligne horizontale, à des coordonnées fixes, à une échelle fixe.
C'est cette étape qui rend comparables une tête inclinée et une tête de face. Chaque visage qui entre dans l'encodeur arrive dans la même pose, à la même taille, recadré sur la même zone. Remarquez ce que ce recadrage écarte : l'essentiel des cheveux, les vêtements, l'arrière-plan, la pièce. Rien de tout cela ne fait partie du signal d'identité.
Cela explique aussi une frustration courante. Si les points sont légèrement faux — parce qu'un œil est masqué, par exemple — l'alignement déforme mal le visage, et le vecteur obtenu est faux d'une manière qui ressemble à une réponse assurée.
Que se passe-t-il à l'étape trois, l'encodage ?
Un réseau encodeur transforme le visage aligné en un vecteur de 512 nombres. Nous utilisons ArcFace pour cela. Ce vecteur est la description mathématique du visage.
C'est l'objectif d'entraînement qui le rend utile : le réseau est entraîné pour que les vecteurs d'une même identité se regroupent étroitement et que ceux d'identités différentes s'écartent. Il n'est pas entraîné à décrire à quoi un visage ressemble ; il est entraîné à décrire qui il est.
| Étape | Entrée | Sortie | Échoue quand |
|---|---|---|---|
| Détection (YuNet) | Image entière | Cadre + 5 points | Visage masqué, trop petit, angle extrême |
| Alignement | Cadre + points | Recadrage de visage normalisé | Les points sont imprécis |
| Encodage (ArcFace) | Recadrage aligné | Vecteur de 512 nombres | Le recadrage est dégradé, flou ou très compressé |
| Comparaison | Vecteur | Liste classée avec des scores | Jamais — elle renvoie toujours quelque chose |
La dernière ligne est la plus importante, et elle mérite sa propre section.
Que se passe-t-il à l'étape quatre, la comparaison ?
La comparaison mesure la similarité cosinus entre votre vecteur et chaque vecteur de l'index, puis renvoie les plus proches dans l'ordre.
La similarité cosinus va de 0 à 1 et décrit l'angle entre deux vecteurs. Sur nos données, le seuil calibré pour les captures vidéo est de 0.40. Au-dessus, une paire est traitée comme probablement la même personne ; en dessous, le résultat est du bruit qui se trouvait être le plus proche.
Ce dernier point est la chose la plus mal comprise à propos de la recherche vectorielle : elle ne renvoie jamais rien. Demandez-lui les dix visages les plus proches et elle vous en donne dix, même quand la bonne personne est totalement absente de l'index. Le score est la seule chose qui distingue une vraie réponse de l'inconnu le plus proche disponible. Une liste classée sans scores est illisible.
Pourquoi est-ce l'index qui décide de ce qui est trouvable ?
Parce que la comparaison ne peut classer que ce qui a déjà été encodé. Un index n'est pas une recherche sur le web ; c'est un ensemble fixe de vecteurs calculés à l'avance.
Le nôtre contient 241,792 visages, dont 2,333 sont reliés à une actrice nommée, tirés de jaquettes et de captures sur 106 sites (notre index, instantané 2026-08). Deux conséquences en découlent directement :
- Un visage présent dans l'index mais jamais relié à un nom revient comme une identité anonyme. C'est fréquent — nos seules données de ressemblance contiennent 7,004 références vers des identités sans nom rattaché.
- Un visage jamais indexé ne peut être renvoyé sous aucun score. L'outil vous montrera quand même ses suppositions les plus proches.
Limite qui mérite d'être dite : nos sources sont concentrées. 2,246 des 2,333 actrices nommées ont leur image représentative issue d'un seul site. La couverture reflète donc ce que ces sources ont publié, pas la production totale de l'industrie.
En quoi est-ce différent de la recherche d'image inversée ?
La recherche d'image inversée cherche des copies de votre image entière. La recherche par visage cherche la même identité à travers des images différentes. Elles échouent et réussissent dans des conditions opposées.
| Recherche d'image inversée | Recherche par visage | |
|---|---|---|
| Compare | Une empreinte de l'image entière | Un vecteur de visage |
| A besoin que l'image exacte existe en ligne | Oui | Non |
| Aidée par un recadrage sur le visage | Non — cela l'aggrave | Oui — c'est l'entrée |
| Résiste à un éclairage et une pose différents | Mal | Par conception |
| Fonctionne sur une image que vous avez capturée vous-même | Non | Oui |
Si un outil devient moins bon quand vous recadrez sur le visage, il ne fait pas de la recherche par visage. C'est un diagnostic fiable en un seul test.
Questions liées
- Pourquoi la recherche d'image inversée de Google ne marche pas pour les vidéos pour adultes
- Comment retrouver une vidéo à partir d'une seule capture d'écran
- Envoyer une photo à un outil de recherche est-il sans risque ?
- Les outils de recherche d'image inversée comparés
- Comment prendre une capture d'écran que la recherche par visage peut vraiment exploiter
Le moyen le plus rapide de comprendre la chaîne, c'est de la voir tourner. Envoyez une image ici : la détection et l'alignement se font dans votre navigateur, seuls la zone de visage recadrée et ses cinq points sont envoyés pour comparaison, et l'original ne quitte jamais votre appareil.