La búsqueda facial no compara imágenes. Convierte cada cara en una lista fija de números —un vector— y compara esos vectores. Dos fotografías de la misma persona, tomadas con años de diferencia en habitaciones distintas, producen vectores que quedan cerca el uno del otro aunque las imágenes casi no compartan píxeles.

Entender las cuatro etapas te dice exactamente por qué algunas capturas funcionan al instante y otras fallan por muchas veces que lo intentes.

¿Qué ocurre en la etapa uno, la detección?

La detección responde a una pregunta más estrecha de lo que la gente espera: ¿en qué parte de esta imagen hay una cara y dónde están sus cinco puntos clave?

El detector recorre la imagen y devuelve, por cada cara que encuentra, un recuadro delimitador más las coordenadas de cinco puntos: ojo izquierdo, ojo derecho, punta de la nariz, comisura izquierda de la boca y comisura derecha. Para esta etapa usamos YuNet. Todavía no ha ocurrido nada relacionado con la identidad; esto es geometría pura.

Si la detección falla, falla todo lo que viene después. Y la detección falla por motivos que no tienen nada que ver con la calidad de imagen en el sentido habitual: una mano cruzada sobre la boca, un perfil marcado, una cara más pequeña que el tamaño mínimo del detector.

¿Qué ocurre en la etapa dos, el alineado?

El alineado usa esos cinco puntos para deformar la cara hasta una posición canónica: los ojos sobre una línea horizontal, en coordenadas fijas y a una escala fija.

Este paso es la razón de que una cabeza inclinada y una cabeza de frente se vuelvan comparables. Todas las caras que entran en el codificador llegan en la misma pose, al mismo tamaño y recortadas a la misma región. Fíjate en lo que descarta ese recorte: casi todo el pelo, la ropa, el fondo, la habitación. Nada de eso forma parte de la señal de identidad.

También explica una frustración habitual. Si los puntos están algo mal situados —porque un ojo queda tapado, por ejemplo—, el alineado deforma la cara de forma incorrecta, y el vector resultante está mal de una manera que parece una respuesta segura.

¿Qué ocurre en la etapa tres, la codificación?

Una red codificadora convierte la cara alineada en un vector de 512 números. Para esto usamos ArcFace. Ese vector es la descripción matemática de la cara.

Lo que lo hace útil es el objetivo de entrenamiento: la red se entrena para que los vectores de una misma identidad se agrupen muy juntos y los de identidades distintas se separen. No se entrena para describir cómo se ve una cara; se entrena para describir quién es.

Etapa Entrada Salida Falla cuando
Detección (YuNet) Imagen completa Recuadro + 5 puntos clave La cara está tapada, es muy pequeña o el ángulo es extremo
Alineado Recuadro + puntos clave Recorte facial estandarizado Los puntos clave son imprecisos
Codificación (ArcFace) Recorte alineado Vector de 512 números El recorte está degradado, borroso o muy comprimido
Comparación Vector Lista ordenada con puntuaciones Nunca: siempre devuelve algo

La última fila es la importante, y merece su propia sección.

¿Qué ocurre en la etapa cuatro, la comparación?

La comparación mide la similitud coseno entre tu vector y todos los vectores del índice, y después devuelve los más cercanos por orden.

La similitud coseno va de 0 a 1 y describe el ángulo entre dos vectores. Con nuestros datos, el umbral calibrado para fotogramas de vídeo es 0.40. Por encima, se trata al par como probablemente la misma persona; por debajo, el resultado es ruido que resultó ser lo más cercano.

Ese último punto es lo que peor se entiende de la búsqueda vectorial: nunca devuelve nada vacío. Pídele las diez caras más cercanas y te da diez, incluso cuando la persona correcta no está en absoluto en el índice. La puntuación es lo único que distingue una respuesta real de la desconocida más parecida que había disponible. Una lista ordenada sin puntuaciones es ilegible.

¿Por qué es el índice el que decide qué se puede encontrar?

Porque la comparación solo puede ordenar lo que ya se ha codificado. Un índice no es una búsqueda por la web; es un conjunto fijo de vectores calculados de antemano.

El nuestro contiene 241,792 caras, de las cuales 2,333 están asociadas a una actriz con nombre, extraídas de portadas y fotogramas de 106 sitios (nuestro índice, instantánea de 2026-08). De ahí se siguen dos consecuencias directas:

  • Una cara que existe en el índice pero que nunca se asoció a un nombre vuelve como identidad sin nombre. Eso es habitual: solo nuestros datos de actrices parecidas contienen 7,004 referencias a identidades que no tienen ningún nombre asociado.
  • Una cara que nunca se indexó no puede devolverse con ninguna puntuación. La herramienta te seguirá mostrando sus conjeturas más cercanas.

Un límite que conviene decir: nuestras fuentes están concentradas. 2,246 de 2,333 actrices con nombre tienen su imagen representativa de un solo sitio. La cobertura refleja, por tanto, lo que publicaron esas fuentes, no toda la producción del sector.

¿En qué se diferencia esto de la búsqueda inversa de imágenes?

La búsqueda inversa de imágenes busca copias de tu imagen entera. La búsqueda facial busca la misma identidad en imágenes distintas. Fallan y aciertan en condiciones opuestas.

Búsqueda inversa de imágenes Búsqueda facial
Compara Huella de la imagen completa Vector facial
Necesita que la imagen exacta exista en línea No
Le ayuda recortar hasta la cara No, empeora Sí, esa es la entrada
Aguanta cambios de iluminación y de pose Mal Por diseño
Funciona con un fotograma capturado por ti No

Si una herramienta empeora cuando recortas hasta la cara, no está haciendo búsqueda facial. Ese es un diagnóstico fiable de una sola prueba.

Preguntas relacionadas


La forma más rápida de entender el proceso es verlo funcionar. Sube aquí un fotograma: la detección y el alineado ocurren en tu navegador, solo se envían para la comparación la región facial recortada y sus cinco puntos clave, y el original nunca sale de tu dispositivo.