La búsqueda facial no compara imágenes. Convierte cada cara en una lista fija de números —un vector— y compara esos vectores. Dos fotografías de la misma persona, tomadas con años de diferencia en habitaciones distintas, producen vectores que quedan cerca el uno del otro aunque las imágenes casi no compartan píxeles.
Entender las cuatro etapas te dice exactamente por qué algunas capturas funcionan al instante y otras fallan por muchas veces que lo intentes.
¿Qué ocurre en la etapa uno, la detección?
La detección responde a una pregunta más estrecha de lo que la gente espera: ¿en qué parte de esta imagen hay una cara y dónde están sus cinco puntos clave?
El detector recorre la imagen y devuelve, por cada cara que encuentra, un recuadro delimitador más las coordenadas de cinco puntos: ojo izquierdo, ojo derecho, punta de la nariz, comisura izquierda de la boca y comisura derecha. Para esta etapa usamos YuNet. Todavía no ha ocurrido nada relacionado con la identidad; esto es geometría pura.
Si la detección falla, falla todo lo que viene después. Y la detección falla por motivos que no tienen nada que ver con la calidad de imagen en el sentido habitual: una mano cruzada sobre la boca, un perfil marcado, una cara más pequeña que el tamaño mínimo del detector.
¿Qué ocurre en la etapa dos, el alineado?
El alineado usa esos cinco puntos para deformar la cara hasta una posición canónica: los ojos sobre una línea horizontal, en coordenadas fijas y a una escala fija.
Este paso es la razón de que una cabeza inclinada y una cabeza de frente se vuelvan comparables. Todas las caras que entran en el codificador llegan en la misma pose, al mismo tamaño y recortadas a la misma región. Fíjate en lo que descarta ese recorte: casi todo el pelo, la ropa, el fondo, la habitación. Nada de eso forma parte de la señal de identidad.
También explica una frustración habitual. Si los puntos están algo mal situados —porque un ojo queda tapado, por ejemplo—, el alineado deforma la cara de forma incorrecta, y el vector resultante está mal de una manera que parece una respuesta segura.
¿Qué ocurre en la etapa tres, la codificación?
Una red codificadora convierte la cara alineada en un vector de 512 números. Para esto usamos ArcFace. Ese vector es la descripción matemática de la cara.
Lo que lo hace útil es el objetivo de entrenamiento: la red se entrena para que los vectores de una misma identidad se agrupen muy juntos y los de identidades distintas se separen. No se entrena para describir cómo se ve una cara; se entrena para describir quién es.
| Etapa | Entrada | Salida | Falla cuando |
|---|---|---|---|
| Detección (YuNet) | Imagen completa | Recuadro + 5 puntos clave | La cara está tapada, es muy pequeña o el ángulo es extremo |
| Alineado | Recuadro + puntos clave | Recorte facial estandarizado | Los puntos clave son imprecisos |
| Codificación (ArcFace) | Recorte alineado | Vector de 512 números | El recorte está degradado, borroso o muy comprimido |
| Comparación | Vector | Lista ordenada con puntuaciones | Nunca: siempre devuelve algo |
La última fila es la importante, y merece su propia sección.
¿Qué ocurre en la etapa cuatro, la comparación?
La comparación mide la similitud coseno entre tu vector y todos los vectores del índice, y después devuelve los más cercanos por orden.
La similitud coseno va de 0 a 1 y describe el ángulo entre dos vectores. Con nuestros datos, el umbral calibrado para fotogramas de vídeo es 0.40. Por encima, se trata al par como probablemente la misma persona; por debajo, el resultado es ruido que resultó ser lo más cercano.
Ese último punto es lo que peor se entiende de la búsqueda vectorial: nunca devuelve nada vacío. Pídele las diez caras más cercanas y te da diez, incluso cuando la persona correcta no está en absoluto en el índice. La puntuación es lo único que distingue una respuesta real de la desconocida más parecida que había disponible. Una lista ordenada sin puntuaciones es ilegible.
¿Por qué es el índice el que decide qué se puede encontrar?
Porque la comparación solo puede ordenar lo que ya se ha codificado. Un índice no es una búsqueda por la web; es un conjunto fijo de vectores calculados de antemano.
El nuestro contiene 241,792 caras, de las cuales 2,333 están asociadas a una actriz con nombre, extraídas de portadas y fotogramas de 106 sitios (nuestro índice, instantánea de 2026-08). De ahí se siguen dos consecuencias directas:
- Una cara que existe en el índice pero que nunca se asoció a un nombre vuelve como identidad sin nombre. Eso es habitual: solo nuestros datos de actrices parecidas contienen 7,004 referencias a identidades que no tienen ningún nombre asociado.
- Una cara que nunca se indexó no puede devolverse con ninguna puntuación. La herramienta te seguirá mostrando sus conjeturas más cercanas.
Un límite que conviene decir: nuestras fuentes están concentradas. 2,246 de 2,333 actrices con nombre tienen su imagen representativa de un solo sitio. La cobertura refleja, por tanto, lo que publicaron esas fuentes, no toda la producción del sector.
¿En qué se diferencia esto de la búsqueda inversa de imágenes?
La búsqueda inversa de imágenes busca copias de tu imagen entera. La búsqueda facial busca la misma identidad en imágenes distintas. Fallan y aciertan en condiciones opuestas.
| Búsqueda inversa de imágenes | Búsqueda facial | |
|---|---|---|
| Compara | Huella de la imagen completa | Vector facial |
| Necesita que la imagen exacta exista en línea | Sí | No |
| Le ayuda recortar hasta la cara | No, empeora | Sí, esa es la entrada |
| Aguanta cambios de iluminación y de pose | Mal | Por diseño |
| Funciona con un fotograma capturado por ti | No | Sí |
Si una herramienta empeora cuando recortas hasta la cara, no está haciendo búsqueda facial. Ese es un diagnóstico fiable de una sola prueba.
Preguntas relacionadas
- Por qué la búsqueda inversa de imágenes de Google no funciona con vídeos para adultos
- Cómo encontrar un vídeo a partir de una sola captura
- ¿Es seguro subir una foto a una herramienta de búsqueda?
- Comparativa de herramientas de búsqueda inversa de imágenes
- Cómo hacer una captura que la búsqueda facial pueda aprovechar
La forma más rápida de entender el proceso es verlo funcionar. Sube aquí un fotograma: la detección y el alineado ocurren en tu navegador, solo se envían para la comparación la región facial recortada y sus cinco puntos clave, y el original nunca sale de tu dispositivo.