Una puntuación de similitud es la similitud del coseno entre dos vectores faciales —dos listas de 512 números— y va de 0 a 1. En nuestro índice, 0.40 es el punto por encima del cual un par se trata como probablemente la misma persona. No es un porcentaje, ni una confianza, ni una probabilidad. Es un ángulo.

El número importa por algo que casi ninguna herramienta de búsqueda facial te cuenta: la búsqueda vectorial densa nunca devuelve nada vacío. Pídele diez resultados y te da diez, exista o no en el índice la persona que buscas. La puntuación es lo único que separa una respuesta del desconocido más parecido que había disponible.

¿Qué mide realmente la puntuación?

La similitud del coseno mide el ángulo entre dos vectores, sin tener en cuenta su longitud. Dos caras codificadas en vectores de 512 dimensiones son «similares» cuando sus vectores apuntan casi en la misma dirección.

El codificador —ArcFace, en nuestro caso— está entrenado para que las imágenes de una misma identidad produzcan vectores que apuntan igual, y las imágenes de identidades distintas produzcan vectores que apuntan a lugares separados. La pose, la iluminación, el fondo y el peinado se descartan en buena medida durante la detección y el alineado, antes de que el codificador llegue a ver la cara.

Por eso la puntuación no se comporta como una impresión visual. Dos fotografías que a ti te parecen iguales pueden puntuar bajo; dos fotografías que no se parecen en nada —otra luz, otra década, otro pelo— pueden puntuar alto.

¿Cómo hay que leer cada franja de puntuación?

Trata la puntuación como una franja, no como un veredicto. Estas son las franjas de trabajo que usamos con nuestros propios datos.

Puntuación Lectura Qué hacer con ella
0.70 o más Muy probablemente la misma identidad Trátalo como coincidencia; consulta igualmente la página de origen
0.55 – 0.70 Probablemente la misma identidad Coincidencia, pero verifícala con una segunda imagen
0.40 – 0.55 Por encima del umbral, pero débil Plausible; un mal ángulo y un parecido casual dan lo mismo
0.25 – 0.40 Por debajo del umbral Parecido, no identidad
Menos de 0.25 El vector más cercano disponible No dice nada, salvo que el índice tenía que devolver algo

Las filas por debajo de 0.40 son las que la gente malinterpreta. Un resultado de 0.31 no es «un 31% de probabilidad». Es el sistema diciéndote que no tiene a tu persona y enseñándote lo que sí tiene.

Fuente: nuestro índice, muestra de 2026-08. Las franjas son heurísticas de trabajo para leer nuestros propios resultados, no un baremo publicado.

¿Por qué existe un umbral?

Porque un umbral convierte una distancia continua en una decisión de sí o no, y toda conversión de ese tipo cambia un tipo de error por otro.

Baja el umbral y recuperas más coincidencias auténticas grabadas en ángulos difíciles o con mala compresión, a costa de admitir más caras que no tienen nada que ver. Súbelo y las coincidencias que conservas son más limpias, mientras que las auténticas procedentes de un plano de perfil o de un stream de bitrate bajo se caen de la lista por completo.

No hay ajuste que elimine los dos errores. 0.40 está donde está porque nuestra consulta típica es un fotograma de vídeo: comprimido, movido, pocas veces frontal y a menudo pequeño. Un umbral afinado con retratos limpios de estudio sería más alto y rechazaría la mayoría de las consultas reales.

¿Por qué la misma persona puntúa distinto en fotos distintas?

Porque el codificador descarta la pose y la iluminación de forma imperfecta, y cada degradación entre la cámara y tu captura mueve el vector.

Condición Efecto en la puntuación
Frontal, nítida, bien iluminada Las puntuaciones más altas; el mejor caso del codificador
Cabeza girada más allá de unos tres cuartos Caída notable; parte de la cara sencillamente no está
Compresión de vídeo agresiva, bitrate bajo Caída; los artefactos de bloque destrozan el detalle fino
Cara pequeña dentro del cuadro Caída, y la detección puede fallar antes de codificar
Oclusión: una mano, el pelo, un objeto sobre la cara Los puntos de referencia se desplazan, el alineado se deforma y el vector sale mal
Años de diferencia entre las dos imágenes Caída moderada; la señal de identidad persiste, pero se debilita
Cirugía estética, cambio de peso importante Coincidencias auténticas pueden caer por debajo del umbral
Maquillaje, peinado, color de pelo Poco efecto; el alineado recorta casi todo eso

La última fila sorprende a la gente y la anterior la decepciona. El pelo sale casi gratis; una cara cambiada, no.

¿Por qué desconfiar de una herramienta que oculta la puntuación?

Porque ocultar la puntuación oculta la diferencia entre una coincidencia y una conjetura, y esa diferencia es el resultado entero.

Una lista ordenada sin puntuaciones tiene el mismo aspecto tanto si el primer resultado está en 0.85 como si está en 0.19. Los dos se muestran como «aquí tienes tu coincidencia más cercana». Solo uno de ellos significa algo. Una herramienta que enseña diez caras y ningún número ha cogido el campo más informativo y lo ha quitado, y lo ha hecho justo en la única situación en la que el sistema va a producir salida haya o no verdad detrás.

La versión honesta del resultado de una búsqueda facial contiene tres cosas: la puntuación, el umbral con el que se la está juzgando y un enlace a la imagen de origen para que lo compruebes con tus propios ojos. Si falta cualquiera de las tres, no puedes auditar la respuesta.

Datos y método

Fuente. Vectores faciales calculados a partir de portadas y fotogramas indexados por starlikeness en 106 sitios.

Muestra. 241,792 vectores faciales en el índice; 2,333 registros de identidad con nombre asociado (nuestro índice, muestra de 2026-08).

Método. Detección con YuNet, que produce una caja delimitadora y cinco puntos de referencia. Alineado a una pose canónica a partir de esos puntos. Codificación con ArcFace en vectores de 512 dimensiones. Recuperación por similitud del coseno contra el índice completo. El umbral de 0.40 está calibrado para consultas de fotograma de vídeo contra este índice.

Fecha de la muestra. 2026-08.

Sesgo conocido. La cobertura está muy concentrada. 2,246 de las 2,333 identidades con nombre toman su imagen representativa de un solo sitio, y solo una pequeña minoría de los 106 sitios indexados lleva identificadores de contenido japoneses. Lo que medimos es, por tanto, la exposición en sitios agregadores, no el volumen de producción. Una actriz cuyo trabajo solo aparece en sitios que no hemos indexado no se encontrará, y ninguna puntuación te lo dirá: la búsqueda seguirá devolviendo sus diez desconocidos más cercanos.

Límites del umbral. 0.40 se aplica a este codificador y a este índice. No es trasladable a otra herramienta, a otro modelo ni a otro tipo de imagen de consulta. Cualquier afirmación de que una puntuación «significa» una probabilidad fija de identidad es exagerada: el mismo número pesa distinto según la calidad de la consulta.

Cita.

starlikeness (2026). «¿Qué significa una puntuación de similitud de 0.40?»
Índice de caras, muestra de 2026-08 (n=241,792 caras; 2,333 identidades con nombre).
https://starlikeness.com/es/articles/what-similarity-score-means

Preguntas relacionadas


Puedes ver el umbral trabajando: sube un fotograma y lee las puntuaciones junto a las caras. La detección se ejecuta en tu navegador, solo se envía la región recortada de la cara para la comparación y el original nunca sale de tu dispositivo.