Menos de lo que sugiere la cifra de titular. Nuestro índice contiene 241,792 vectores faciales pero solo 2,333 registros de identidad, y solo 1,707 de ellos tienen un perfil resoluble con campos biográficos. Alrededor del 1% de las caras que hemos indexado está asociado a un nombre (nuestro índice, instantánea de 2026-08).
Esa proporción es la respuesta honesta a «cómo de completos son vuestros datos». Todo lo demás en este artículo es un intento de decir con precisión cuál es ese 1%, y por qué el otro 99% no es un fallo del sistema sino una propiedad del material.
¿Qué cuentan realmente las cifras de titular?
Cada número cuenta algo más estrecho de lo que parece, así que aquí va cada uno con su definición real.
| Cifra | Valor | Qué cuenta | Qué no cuenta |
|---|---|---|---|
| Vectores faciales | 241,792 | Caras detectadas en las imágenes indexadas | Personas distintas; una persona aparece muchas veces |
| Registros de identidad | 2,333 | Agrupaciones tratadas como una persona con etiqueta | A todos los del índice; la mayoría de caras no tiene etiqueta |
| Registros con perfil completo | 1,707 | Identidades con slug canónico y metadatos | Los 626 que solo tienen una cadena de texto con el nombre |
| Sitios indexados | 106 | Servidores de los que hemos rastreado imágenes | Sitios que llevan códigos japoneses: unos 13 |
| Páginas de palabra clave | 300 | Páginas de consulta construidas sobre el índice | La cobertura del vocabulario de etiquetas del sector |
| Idiomas | 13 | Lenguas de la interfaz y de la traducción de nombres | Las fuentes; la mayoría de fuentes están en inglés |
Fuente: nuestro índice, instantánea de 2026-08.
La primera fila es donde vive casi todo el marketing de búsqueda facial, y es la menos significativa. 241,792 es una medida de cuántas imágenes procesamos, no de a cuántas personas podemos identificar.
¿Por qué solo el 1% del índice tiene nombre?
Porque las caras se encuentran mecánicamente y los nombres se aportan editorialmente, y ese aporte editorial es escaso en las fuentes que indexamos.
Un detector encuentra todas las caras de todas las imágenes que procesamos. Un nombre solo se asocia cuando una página de origen lo declara de forma analizable y enlazable. En los sitios agregadores internacionales, que son el grueso de nuestros 106 servidores, los créditos suelen eliminarse por completo al republicar.
La consecuencia se ve dentro de nuestros propios datos de actrices parecidas: de 13,420 referencias entre vecinos, 7,004 (52%) apuntan a identidades sin nombre. Más de la mitad de todos los punteros de «a quién se parece esta persona» llevan a un lugar que el registro público dejó en blanco.
¿Cómo de completos son los datos de las personas a las que sí hemos puesto nombre?
Entre el 23% y el 89% según el campo, y publicamos las cifras bajas junto a las altas.
| Campo | Registros con valor | Cobertura sobre n=2,333 |
|---|---|---|
| Lista de actrices parecidas | 2,070 | 89% |
| Talla de copa | 1,375 | 59% |
| Fecha de debut | 1,371 | 59% |
| Estatura | 1,340 | 57% |
| Medidas | 1,316 | 56% |
| Fecha de nacimiento | 1,301 | 56% |
| Lugar de nacimiento | 716 | 31% |
| Grupo sanguíneo | 547 | 23% |
Fuente: nuestro índice, instantánea de 2026-08, n=2,333 registros de identidad.
De ahí se siguen dos cosas. Primera, cualquier estadística que pudiéramos publicar sobre, digamos, la distribución de lugares de nacimiento se apoya en 716 personas, y esas 716 no son una muestra aleatoria: son aquellas cuyos perfiles estaban mejor documentados, lo que casi siempre significa las más prominentes. Segunda, un campo como el grupo sanguíneo, al 23%, es demasiado escaso para sostener afirmación alguna sobre la población, y preferimos decirlo antes que disfrazar 547 registros de retrato del sector.
El único campo sólido, las listas de actrices parecidas al 89%, lo es precisamente porque lo calculamos nosotros a partir de los vectores en lugar de heredarlo de una fuente.
¿Qué mide el índice, si no es la industria?
Mide la exposición en sitios agregadores, y la distinción no es académica.
2,246 de nuestros 2,333 registros de identidad toman su imagen representativa de un único sitio. En todo el conjunto, las imágenes representativas vienen de solo cuatro servidores distintos. De los 106 sitios que indexamos, solo unos 13 llevan códigos japoneses; el resto son en su mayoría plataformas internacionales de tubos y agregadores.
Así que cuando una actriz está bien representada en nuestros datos, el hallazgo es: las imágenes de esta persona circulan ampliamente por los agregadores que indexamos. Esa es una señal real y útil. No es lo mismo que ser prolífica, popular en Japón o comercialmente relevante, y no la presentamos como ninguna de esas cosas.
Esto también acota lo que nunca afirmaremos. No diremos que un estudio lanzó N títulos, solo que hemos indexado N. El índice no tiene campo de fecha de lanzamiento, ni campo de estudio, ni registros de títulos en absoluto, así que las tendencias de producción interanuales, la cuota de mercado por estudio y las cronologías de adopción de formatos sencillamente no se pueden calcular a partir de él, por muy convincente que quedara un gráfico hecho con esos datos.
Datos y método
Fuente. El índice facial de starlikeness: vectores faciales y registros de identidad derivados de portadas y fotogramas de vídeo de 106 sitios.
Muestra. 241,792 vectores faciales; 2,333 registros de identidad (1,707 con perfil completo, 626 solo con cadena de nombre); 13,420 referencias de actrices parecidas.
Método. Detección con YuNet; alineación a partir de cinco puntos faciales; codificación con ArcFace en vectores de 512 dimensiones; recuperación por similitud coseno con un umbral de 0.40 para «misma persona». Los porcentajes de cobertura son el número de registros con un valor no vacío en un campo, dividido por la población completa de 2,333.
Fecha de la instantánea. 2026-08. Los recuentos se recalcularon a partir del archivo de datos en vivo en esa fecha; la fecha de actualización visible en esta página refleja los datos, no una reconstrucción.
Sesgos conocidos.
- Concentración de fuentes. 2,246 de 2,333 imágenes representativas vienen de un solo sitio; cuatro servidores las explican todas. Lo que falte en esas fuentes falta en nuestras mediciones.
- Sesgo de idioma y región. La mayoría de los sitios indexados son agregadores internacionales, así que las imágenes que circulan internacionalmente están sobrerrepresentadas frente al material distribuido solo en Japón.
- Sesgo de documentación. Las 1,707 con nombre son, por construcción, las actrices mejor documentadas. Las estadísticas de cobertura calculadas sobre ellas describen a las bien documentadas, no a las típicas.
- Antecedente histórico. Algunas cifras de cobertura por campo publicadas antes en este sitio estaban infladas porque se contaban como valores unas cadenas de relleno. Se eliminaron antes de esta instantánea; las cifras de arriba son las corregidas, y son más bajas que las que informamos antes.
Cita.
starlikeness (2026). "How Much of the Industry Can We Actually See?"
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites). https://starlikeness.com/es/articles/how-complete-is-our-index
Preguntas relacionadas
- De dónde vienen nuestros datos y qué falta
- Nuestro índice contiene 7,004 caras sin nombre
- ¿Qué significa una puntuación de similitud de 0.40?
- Cómo funciona la búsqueda facial, paso a paso
- Cómo se estructura la industria del vídeo para adultos japonés
La prueba práctica de la cobertura es una búsqueda. Sube un fotograma y lee las puntuaciones: una lista de resultados con puntuación baja es el índice diciéndote que esta persona está fuera del 1%. La detección se ejecuta en tu navegador y la imagen original nunca sale de tu dispositivo.