Nuestros datos vienen de dos flujos que se encuentran a mitad de camino. Los vectores faciales se calculan a partir de portadas y fotogramas publicados en 106 sitios públicos. Los metadatos de actrices —nombres, traducciones, campos biográficos— se extraen de páginas de perfil públicas. Todo lo que publicamos deriva de uno de los dos o de ambos, y donde se contradicen o callan tenemos un hueco, no una respuesta.

Lo más importante que hay que saber sobre las fuentes es lo estrechas que son. 2,246 de nuestros 2,333 registros de identidad toman su imagen representativa de un solo sitio, y en todo el índice hay únicamente cuatro servidores distintos que aporten imágenes representativas.

¿Cuáles son exactamente los dos flujos de datos?

Un flujo lo calculamos nosotros; el otro lo heredamos de quien publica. Fallan de maneras completamente distintas.

Vectores faciales Metadatos de actrices
Origen Imágenes publicadas en 106 sitios indexados Páginas de perfil públicas
Producido por Nuestro propio pipeline (YuNet, ArcFace) Editores de terceros
Completitud Casi total para las imágenes indexadas 23%–89% según el campo
Modo de fallo Fallos de detección; ángulos malos, oclusión, caras pequeñas Campos en blanco, cadenas de relleno, valores contradictorios
¿Podemos mejorarlo? Sí: indexando más fuentes Solo si alguna fuente lo publica

La asimetría importa. Cuando faltan datos faciales es porque no indexamos la imagen. Cuando faltan metadatos es porque nadie los escribió nunca, y no hay ingeniería que los recupere.

¿Qué fuentes dominan, y hasta qué punto?

Un sitio domina de forma casi total, y preferimos publicarlo antes que dejar que «106 sitios» sugiera una amplitud que no tenemos.

Servidor de la imagen representativa Registros de identidad Cuota
Fuente principal (jable) 2,246 96.3%
Segundo servidor 67 2.9%
Tercer servidor 14 0.6%
Cuarto servidor 6 0.3%

Fuente: nuestro índice, muestra de 2026-08, n=2,333 registros de identidad.

La cifra de 106 describe los sitios que alimentan el índice facial, los 241,792 vectores. Los cuatro servidores de arriba describen de dónde sale la imagen representativa de cada identidad. Las dos cosas son ciertas; solo la segunda te dice lo concentrada que está la capa de identidades.

Hay una segunda concentración encima de la primera. De los 106 sitios indexados, solo unos 13 llevan identificadores de contenido japoneses. El resto son en buena medida tubes y agregadores internacionales. Nuestra visión del vídeo para adultos japonés está, por tanto, mediada casi por completo por la republicación internacional.

¿Qué falta, campo por campo?

Entre el 11% y el 77% de los registros, según el campo. Aquí está la contabilidad completa, no el subconjunto favorecedor.

Campo Presente Ausente Cobertura sobre n=2,333
Lista de actrices similares 2,070 263 89%
Talla de copa 1,375 958 59%
Fecha de debut 1,371 962 59%
Estatura 1,340 993 57%
Medidas 1,316 1,017 56%
Fecha de nacimiento 1,301 1,032 56%
Lugar de nacimiento 716 1,617 31%
Grupo sanguíneo 547 1,786 23%

Fuente: nuestro índice, muestra de 2026-08, n=2,333 registros de identidad.

Tres notas que consideramos parte de los datos, no salvedades sobre ellos:

  • Lo que falta no falta al azar. Los registros con metadatos completos corresponden a las actrices mejor documentadas, que suelen ser las más conocidas. Cualquier estadística calculada sobre los valores presentes describe a actrices conocidas y de circulación internacional.
  • 626 registros contienen un nombre y nada más, sin ningún campo biográfico. Están contados en el denominador de arriba, y por eso todos los porcentajes son más bajos de lo que serían si los descartáramos en silencio.
  • Algunas cifras anteriores de este sitio eran demasiado altas. Cadenas de relleno de los datos de origen se estaban contando como valores reales, lo que inflaba varias cifras de cobertura y, peor aún, se estaba emitiendo en los datos estructurados de las fichas de actrices. Esos valores se eliminaron. La tabla de arriba es la contabilidad corregida, y las cifras anteriores no deben citarse.

¿Qué no podrán decirte nunca estos datos?

Nunca podrán decirte nada sobre títulos, estudios ni volumen de producción, porque no los contienen.

El índice guarda caras, no obras. No hay campo de fecha de salida, ni campo de estudio o sello, ni registro de títulos. Eso descarta toda una familia de estadísticas que serían fáciles de inventar e imposibles de sostener: volumen de producción anual, cuota de mercado por estudio, cronologías de adopción de formatos, cambios de género por año.

También acota el lenguaje que usamos. Nunca escribimos que un estudio publicó N títulos. Escribimos que hemos indexado N, porque lo que contamos fue republicación en agregadores, y la distancia entre esas dos afirmaciones es exactamente la distancia entre nuestros datos y la industria.

Datos y método

Fuente. Portadas y fotogramas publicados en 106 sitios públicos; páginas de perfil públicas de actrices para los metadatos; identificadores de Wikidata cuando existe una correspondencia fiable.

Muestra. 241,792 vectores faciales; 2,333 registros de identidad (1,707 con perfil completo, 626 solo con la cadena del nombre); 13,420 referencias de actrices similares, de las cuales 7,004 apuntan a identidades sin nombre.

Método. Caras detectadas con YuNet, alineadas a partir de cinco puntos de referencia, codificadas con ArcFace en vectores de 512 dimensiones y recuperadas por similitud del coseno con un umbral de 0.40 para «misma persona». Los metadatos se extraen de perfiles públicos, se validan por tipo y formato y se dejan vacíos cuando la validación falla, en lugar de sustituirlos. Las listas de actrices similares se calculan a partir de los vectores, no se heredan.

Fecha de la muestra. 2026-08.

Lo que no se guarda. Archivos de vídeo. Las imágenes originales que sube el usuario: la detección se ejecuta en el navegador del visitante, solo se transmiten una región recortada de la cara y sus cinco puntos de referencia para la comparación, y los resultados de las consultas no se conservan. El índice se construye con material publicado, nunca con lo que la gente busca.

Sesgo conocido.

  • Concentración extrema de fuentes. El 96.3% de las imágenes representativas viene de un solo servidor; cuatro servidores explican todas.
  • Mediación de los agregadores. Solo unos 13 de los 106 sitios indexados llevan identificadores de contenido japoneses, así que el material que vemos es el que circula internacionalmente.
  • Sesgo de documentación. Los metadatos presentes sobrerrepresentan a las actrices más conocidas.
  • Consecuencia. Estas cifras miden la exposición en los sitios que indexamos, no el volumen de producción ni la composición de la industria. Toma cada número de aquí como una afirmación sobre nuestras fuentes primero y sobre la industria solo por inferencia.

Cita.

starlikeness (2026). «De dónde vienen nuestros datos y qué falta».
Índice de caras, muestra de 2026-08 (n=241,792 caras; 2,333 registros de identidad;
106 sitios; 4 servidores de imagen representativa).
https://starlikeness.com/es/articles/where-our-data-comes-from

Preguntas relacionadas


Todo lo anterior describe el índice, no a ti: la detección de caras se ejecuta en tu navegador, solo se envía una región recortada de la cara para la comparación y nada de tu búsqueda se escribe en estos datos.