Moins que ne le laisse croire le chiffre d'accroche. Notre index contient 241,792 vecteurs de visage mais seulement 2,333 fiches d'identité, et 1,707 d'entre elles seulement portent un profil exploitable avec des champs biographiques. Environ 1 % des visages que nous avons indexés sont rattachés à un nom (notre index, instantané 2026-08).

Ce rapport est la réponse honnête à « quelle est la complétude de vos données ». Tout le reste de cet article est une tentative de dire précisément lequel est ce 1 %, et pourquoi les 99 % restants ne sont pas un échec du système mais une propriété du matériel.

Que comptent réellement les chiffres d'accroche ?

Chacun compte quelque chose de plus étroit qu'il n'y paraît ; voici donc chacun avec sa vraie définition.

Chiffre Valeur Ce qu'il compte Ce qu'il ne compte pas
Vecteurs de visage 241,792 Visages détectés dans les images indexées Des personnes distinctes ; une même personne apparaît de nombreuses fois
Fiches d'identité 2,333 Grappes traitées comme une personne avec une étiquette Tout le monde dans l'index ; la plupart des visages ne sont pas étiquetés
Fiches avec profil complet 1,707 Identités avec un slug canonique et des métadonnées Les 626 qui ne portent qu'une chaîne de nom brute
Sites indexés 106 Hôtes dont nous avons collecté des images Sites portant des codes japonais — environ 13
Pages mots-clés 300 Pages de requête construites sur l'index La couverture du vocabulaire de tags de l'industrie
Langues 13 Langues d'interface et de traduction des noms Les sources ; la plupart des sources sont anglophones

Source : notre index, instantané 2026-08.

La première ligne est celle où vit l'essentiel du marketing de la recherche par visage, et c'est la moins parlante. 241,792 mesure combien d'images nous avons traitées, pas combien de personnes nous savons identifier.

Pourquoi seul 1 % de l'index porte-t-il un nom ?

Parce que les visages sont trouvés mécaniquement et les noms fournis par un travail éditorial, et que l'apport éditorial est mince sur les sources que nous indexons.

Un détecteur trouve chaque visage dans chaque image que nous traitons. Un nom ne s'y attache que lorsqu'une page source l'indique sous une forme analysable et reliable. Sur les agrégateurs internationaux, qui constituent le gros de nos 106 hôtes, les crédits sont souvent entièrement supprimés lors de la republication.

La conséquence est visible dans nos propres données de ressemblance : sur 13,420 références de voisinage, 7,004 (52 %) pointent vers des identités sans nom. Plus de la moitié des pointeurs « qui ressemble à cette personne » mènent quelque part que le registre public a laissé vide.

Quelle est la complétude des données sur les personnes que nous avons nommées ?

Entre 23 % et 89 % selon le champ, et nous publions les chiffres bas à côté des chiffres élevés.

Champ Fiches avec une valeur Couverture sur n=2,333
Liste d'actrices similaires 2,070 89 %
Taille de bonnet 1,375 59 %
Date de début 1,371 59 %
Taille 1,340 57 %
Mensurations 1,316 56 %
Date de naissance 1,301 56 %
Lieu de naissance 716 31 %
Groupe sanguin 547 23 %

Source : notre index, instantané 2026-08, n=2,333 fiches d'identité.

Deux choses en découlent. D'abord, toute statistique que nous pourrions publier sur, disons, la répartition des lieux de naissance repose sur 716 personnes — et ces 716 ne sont pas un échantillon aléatoire, ce sont celles dont les profils étaient les mieux documentés, ce qui veut généralement dire les plus en vue. Ensuite, un champ comme le groupe sanguin à 23 % est bien trop mince pour soutenir la moindre affirmation sur la population, et nous préférons le dire plutôt que de déguiser 547 fiches en portrait de l'industrie.

Le seul champ solide, les listes d'actrices similaires à 89 %, est solide précisément parce que nous le calculons nous-mêmes à partir des vecteurs au lieu de l'hériter d'une source.

Que mesure l'index, si ce n'est l'industrie ?

Il mesure l'exposition sur les sites agrégateurs, et la distinction n'a rien d'académique.

2,246 de nos 2,333 fiches d'identité tirent leur image représentative d'un seul site. Sur l'ensemble, les images représentatives ne proviennent que de quatre hôtes distincts. Sur les 106 sites que nous indexons, seuls 13 environ portent des codes japonais ; le reste est en grande partie constitué de plateformes de tubes et d'agrégateurs internationaux.

Ainsi, quand une actrice est bien représentée dans nos données, le constat est : les images de cette personne circulent largement sur les agrégateurs que nous indexons. C'est un signal réel et utile. Ce n'est pas la même chose qu'être prolifique, populaire au Japon ou commercialement importante, et nous ne le présentons comme rien de tout cela.

Cela borne aussi ce que nous n'affirmerons jamais. Nous ne dirons pas qu'un studio a sorti N titres — seulement que nous en avons indexé N. L'index n'a pas de champ date de sortie, pas de champ studio et aucune fiche de titre, si bien que les tendances de production d'une année à l'autre, les parts de marché des studios et les calendriers d'adoption des formats n'y sont tout simplement pas calculables, quelle que soit l'assurance qu'afficherait un graphique bâti dessus.

Données et méthode

Source. L'index de visages starlikeness : vecteurs de visage et fiches d'identité dérivés d'images de jaquettes et de captures vidéo sur 106 sites.

Échantillon. 241,792 vecteurs de visage ; 2,333 fiches d'identité (1,707 avec un profil complet, 626 avec une simple chaîne de nom) ; 13,420 références de ressemblance.

Méthode. Détection avec YuNet ; alignement à partir de cinq points caractéristiques du visage ; encodage avec ArcFace en vecteurs à 512 dimensions ; recherche par similarité cosinus avec un seuil de 0.40 pour « même personne ». Les pourcentages de couverture sont le nombre de fiches portant une valeur non vide pour un champ, divisé par la population complète de 2,333.

Date de l'instantané. 2026-08. Décomptes recalculés à partir du fichier de données en production à cette date ; la date de mise à jour visible sur cette page reflète les données, pas une reconstruction.

Biais connus.

  • Concentration des sources. 2,246 des 2,333 images représentatives proviennent d'un seul site ; quatre hôtes les fournissent toutes. Tout ce qui est absent de ces sources est absent de nos mesures.
  • Biais de langue et de région. La plupart des sites indexés sont des agrégateurs internationaux, si bien que les images qui circulent à l'international sont surreprésentées par rapport au matériel distribué uniquement au Japon.
  • Biais de documentation. Les 1,707 personnes nommées sont, par construction, les actrices les mieux documentées. Les statistiques de couverture calculées sur elles décrivent le bien documenté, pas le typique.
  • Antécédent historique. Certains chiffres de couverture par champ publiés auparavant sur ce site étaient gonflés parce que des chaînes de remplissage étaient comptées comme des valeurs. Elles ont été retirées avant cet instantané ; les chiffres ci-dessus sont les chiffres corrigés, et ils sont plus bas que ce que nous annoncions avant.

Citation.

starlikeness (2026). « Quelle part de l'industrie voyons-nous réellement ? »
Index de visages, instantané 2026-08 (n=241,792 visages ; 2,333 fiches
d'identité ; 106 sites). https://starlikeness.com/fr/articles/how-complete-is-our-index

Questions liées


Le vrai test de la couverture, c'est une recherche. Envoyez une image et lisez les scores : une liste de résultats à score faible, c'est l'index qui vous dit que cette personne est en dehors du 1 %. La détection s'exécute dans votre navigateur et l'image d'origine ne quitte jamais votre appareil.