Nos données viennent de deux flux qui se rejoignent à mi-chemin. Les vecteurs faciaux sont calculés à partir de jaquettes et de photogrammes publiés sur 106 sites publics. Les métadonnées d'interprètes — noms, traductions, champs biographiques — sont extraites de pages de profil publiques. Tout ce que nous publions dérive de l'un des deux ou des deux, et là où ils se contredisent ou se taisent, nous avons un trou plutôt qu'une réponse.

Le plus important à savoir sur ces sources, c'est à quel point elles sont étroites. 2,246 de nos 2,333 fiches d'identité tirent leur image représentative d'un seul site, et sur tout l'index seuls quatre hébergeurs distincts fournissent la moindre image représentative.

Quels sont ces deux flux de données, précisément ?

L'un est calculé par nous ; l'autre est hérité d'éditeurs. Ils échouent de façons complètement différentes.

Vecteurs faciaux Métadonnées d'interprètes
Origine Images publiées sur 106 sites indexés Pages de profil publiques
Produits par Notre propre chaîne (YuNet, ArcFace) Des rédacteurs tiers
Complétude Quasi totale pour les images indexées 23%–89% selon le champ
Mode d'échec Détections manquées ; mauvais angles, occlusion, visages petits Champs laissés vides, chaînes de remplissage, valeurs contradictoires
Peut-on l'améliorer ? Oui — indexer plus de sources Seulement si une source le publie

L'asymétrie compte. Quand une donnée faciale manque, c'est que nous n'avons pas indexé l'image. Quand une métadonnée manque, c'est que personne ne l'a jamais écrite, et aucune ingénierie ne la récupérera.

Quelles sources dominent, et à quel point ?

Un site domine presque totalement, et nous préférons le publier plutôt que de laisser « 106 sites » suggérer une ampleur que nous n'avons pas.

Hébergeur de l'image représentative Fiches d'identité Part
Source principale (jable) 2,246 96.3%
Deuxième hébergeur 67 2.9%
Troisième hébergeur 14 0.6%
Quatrième hébergeur 6 0.3%

Source : notre index, instantané 2026-08, n=2,333 fiches d'identité.

Le chiffre de 106 décrit les sites qui alimentent l'index facial — les 241,792 vecteurs. Les quatre hébergeurs ci-dessus décrivent d'où vient l'image représentative de chaque identité. Les deux sont vrais ; seul le second vous dit à quel point la couche d'identité est concentrée.

Il y a une seconde concentration par-dessus la première. Sur les 106 sites indexés, 13 environ portent des identifiants de contenu japonais. Le reste est constitué en grande partie de plateformes tube et agrégateurs internationales. Notre vision de la vidéo pour adultes japonaise passe donc presque entièrement par la republication internationale.

Que manque-t-il, champ par champ ?

Entre 11% et 77% des fiches, selon le champ. Voici la comptabilité complète plutôt que le sous-ensemble flatteur.

Champ Présent Manquant Couverture sur n=2,333
Liste d'interprètes similaires 2,070 263 89%
Bonnet 1,375 958 59%
Date de début 1,371 962 59%
Taille 1,340 993 57%
Mensurations 1,316 1,017 56%
Date de naissance 1,301 1,032 56%
Lieu de naissance 716 1,617 31%
Groupe sanguin 547 1,786 23%

Source : notre index, instantané 2026-08, n=2,333 fiches d'identité.

Trois remarques que nous considérons comme faisant partie des données, et non comme des réserves à leur sujet :

  • Les manques ne sont pas aléatoires. Les fiches aux métadonnées complètes sont celles des interprètes les mieux documentées, c'est-à-dire en général les plus en vue. Toute statistique calculée sur les valeurs présentes décrit des interprètes en vue, diffusées à l'international.
  • 626 fiches contiennent un nom et rien d'autre — aucun champ biographique. Elles sont comptées dans le dénominateur ci-dessus, ce qui explique que chaque pourcentage soit plus bas qu'il ne le serait si nous les écartions discrètement.
  • Certains chiffres antérieurs sur ce site étaient trop élevés. Des chaînes de remplissage présentes dans les données sources étaient comptées comme de vraies valeurs, ce qui gonflait plusieurs taux de couverture et, pire encore, était injecté dans les données structurées des pages d'interprètes. Ces valeurs ont été supprimées. Le tableau ci-dessus est la comptabilité corrigée, et les chiffres précédents ne doivent pas être cités.

Que ces données ne pourront jamais vous dire ?

Elles ne pourront jamais rien vous dire sur les titres, les studios ou le volume de sorties, parce qu'elles ne les contiennent pas.

L'index stocke des visages, pas des œuvres. Il n'y a ni champ de date de sortie, ni champ studio ou label, ni fiche de titre. Cela exclut toute une famille de statistiques qu'il serait facile d'inventer et impossible d'étayer : volume de production annuel, parts de marché des studios, chronologies d'adoption des formats, évolutions de genres par année.

Cela borne aussi le vocabulaire que nous employons. Nous n'écrivons jamais qu'un studio a sorti N titres. Nous écrivons que nous avons indexé N — parce que ce que nous avons compté, c'est de la republication par des agrégateurs, et l'écart entre ces deux formulations est exactement l'écart entre nos données et l'industrie.

Données et méthode

Source. Jaquettes et photogrammes publiés sur 106 sites publics ; pages de profil publiques d'interprètes pour les métadonnées ; identifiants Wikidata là où une correspondance sûre existe.

Échantillon. 241,792 vecteurs faciaux ; 2,333 fiches d'identité (1,707 avec un profil complet, 626 réduites à une chaîne de nom) ; 13,420 références d'interprètes similaires, dont 7,004 pointent vers des identités sans nom.

Méthode. Visages détectés avec YuNet, alignés à partir de cinq points de repère, encodés avec ArcFace en vecteurs à 512 dimensions, recherchés par similarité cosinus avec un seuil de même personne à 0.40. Les métadonnées sont extraites de profils publics, validées en type et en format, et laissées vides en cas d'échec de validation plutôt que remplacées. Les listes d'interprètes similaires sont calculées à partir des vecteurs, pas héritées.

Date de l'instantané. 2026-08.

Ce qui n'est pas stocké. Les fichiers vidéo. Les envois originaux des utilisateurs — la détection tourne dans le navigateur du visiteur, seule une zone de visage recadrée et ses cinq points de repère sont transmis pour la comparaison, et les résultats de requête ne sont pas conservés. L'index est construit à partir de matériel publié, jamais à partir de ce que les gens cherchent.

Biais connu.

  • Concentration extrême des sources. 96.3% des images représentatives viennent d'un seul hébergeur ; quatre hébergeurs en fournissent la totalité.
  • Médiation par les agrégateurs. Seuls 13 environ des 106 sites indexés portent des identifiants de contenu japonais : ce que nous voyons est donc ce qui circule à l'international.
  • Biais de documentation. Les métadonnées présentes surreprésentent les interprètes en vue.
  • Conséquence. Ces chiffres mesurent l'exposition sur les sites que nous indexons, pas un volume de sorties ni la composition de l'industrie. Prenez chaque nombre ici comme une affirmation d'abord sur nos sources, et sur l'industrie seulement par déduction.

Citation.

starlikeness (2026). « D'où viennent nos données, et ce qui manque. »
Index facial, instantané 2026-08 (n=241,792 visages ; 2,333 fiches d'identité ;
106 sites ; 4 hébergeurs d'images représentatives).
https://starlikeness.com/fr/articles/where-our-data-comes-from

Questions connexes


Tout ce qui précède décrit l'index, pas vous : la détection de visage tourne dans votre navigateur, seule une zone de visage recadrée est envoyée pour la comparaison, et rien de votre recherche n'est réécrit dans ces données.