검색 실패는 운이 나빠서 생기는 일이 드뭅니다. 되풀이되는 여덟 가지쯤의 잘못으로 모이고, 그 대부분은 애초에 그 문제를 위해 만들어지지 않은 방법을 갖다 쓴 뒤, 안 되니까 더 세게 되풀이하는 데서 옵니다.

아래에 각 실수와, 그것이 왜 그럴듯해 보이는지, 대신 무엇을 해야 하는지를 적었습니다.

시간을 가장 많이 잡아먹는 실수는 무엇인가?

포기하기 전까지 얼마나 많은 노력을 헛되게 하는지 순으로 정리했습니다.

실수 왜 맞아 보이는가 실제로 벌어지는 일 대신 할 일
직접 캡처한 화면에 Google/TinEye 쓰기 가장 먼저 떠오르는 도구다 그 화면은 공개된 파일로 존재한 적이 없어서 찾아낼 사본 자체가 없다 얼굴 벡터 검색을 쓴다
점수를 무시하고 순위만 읽기 1위 결과가 자신 있어 보인다 벡터 검색은 답이 없을 때도 언제나 무언가를 돌려준다 점수를 기준값과 견줘 읽는다
똑같이 나쁜 프레임으로 재시도 끈기 있는 행동처럼 느껴진다 처리 과정은 매번 똑같이 실패한다 다른 프레임을 캡처한다
올리기 전에 얼굴만 바짝 잘라 내기 검색을 집중시켜 줄 것 같다 정렬에 필요한 여백이 사라지고 실효 해상도가 떨어진다 캡처한 그대로 올린다
"배우를 찾았다"를 "작품을 찾았다"로 여기기 반쪽 답이 온전한 답처럼 보인다 결국 엉뚱한 작품을 단정하게 된다 출연작 목록과 장면 정보로 확인한다
화면에 보이는 품번을 지나치기 이미지가 주된 단서처럼 느껴진다 텍스트 한 번 찾으면 몇 초에 끝날 일을 이미지 감식으로 하고 있다 처음 30초에 품번이 있는지 확인한다
눈으로 확인하지 않고 출연작 목록 믿기 기록은 권위 있어 보인다 동명이인과 병합된 레코드가 잘못된 목록을 만든다 그 레코드에 붙은 얼굴들과 비교한다
화면을 휴대폰으로 찍기 스크린숏 단축키 찾는 것보다 빠르다 모아레, 반사광, 흔들림이 특징점 정밀도를 망친다 기기의 스크린숏 기능을 쓴다

"그냥 다른 도구를 써 보자"가 대개 틀린 이유는 무엇인가?

같은 계열의 도구는 같은 구조적 이유로 실패하고, 그 안에서 갈아타는 것은 아무것도 바꾸지 못하기 때문입니다.

근접 중복 매칭기, 즉 Google Images, Bing Visual Search, TinEye, Yandex는 모두 웹 크롤링 안에서 당신의 그림 전체와 같은 사본을 찾습니다. 플레이어에서 직접 캡처한 화면은 파일로 공개된 적이 없으니 그중 어느 곳도 사본을 갖고 있지 않습니다. 네 개를 다 돌리는 것은 하나의 실험을 네 번 되풀이하는 일입니다.

계열을 바꾸는 것은 해 볼 만합니다. 근접 중복 매칭에서 얼굴 벡터 매칭으로 넘어가면 던지는 질문 자체가 바뀌고, 따라서 실패 조건도 바뀝니다. 기대값이 있는 도구 전환은 그것 하나뿐입니다.

틀렸는데도 1위 결과가 그럴듯해 보이는 이유는 무엇인가?

순위 기반 검색에는 "없음"이라는 개념이 없기 때문입니다. 가장 가까운 얼굴 열 개를 달라고 하면 정답이 색인에 있든 없든 열 개를 받습니다.

이것이 가장 흔한 오독이므로 딱 잘라 말해 둡니다. 목록에서의 위치는 그 자체로 아무 의미가 없습니다. 저희 데이터에서 코사인 유사도는 0에서 1 사이이며, 영상 스틸에 대한 보정된 기준값은 0.40입니다.

점수 무엇을 뜻하는가 흔한 오독
0.31 기준값 아래 — 일치하지 않는 것으로 본다 "1위니까 이 사람이 맞겠지"
0.44 약함. 다른 근거가 하나 더 필요하다 "확정"
0.72 강함. 같은 사람일 가능성이 높다 대개 제대로 읽힘

어떤 도구가 점수 없이 순위 목록만 보여 준다면, 그 도구는 위 세 줄을 구분해 주는 유일한 정보를 없애 버린 것입니다.

배우를 특정하는 것이 작품을 특정하는 것과 같지 않은 이유는?

한 얼굴은 그 배우가 출연한 모든 작품에 나오고, 얼굴 벡터에는 지금 보고 있는 것이 그중 어느 작품인지가 전혀 담겨 있지 않기 때문입니다.

얼굴 검색은 누구인가에 답합니다. 어느 작품인가에 이르려면 두 번째 단계가 필요합니다. 배경, 의상, 머리 길이, 문신이나 피어싱, 화면에 보이는 글자 같은 장면 정보로 그 배우의 알려진 작품들을 좁혀 간 다음, 품번으로 확인하는 것입니다. 사람들이 이 단계를 건너뛰는 이유는, 첫 답이 워낙 구체적으로 도착해서 그것으로 다 된 것처럼 느껴지기 때문입니다.

시작하기 전에 수집 범위에 대해 무엇을 전제해야 하는가?

저희 것을 포함해 완전한 색인은 없다는 것, 그리고 없을 때에는 오류 메시지가 아니라 그럴듯해 보이는 틀린 답이 나온다는 것입니다.

저희 색인에는 106개 사이트에서 모은 241,792개의 얼굴이 있고, 그중 2,333개가 이름이 확인된 배우와 연결돼 있습니다(저희 색인, 2026-08 스냅숏). 두 수치가 기대치를 정직하게 잡아 줍니다.

  • 이름이 확인된 배우 2,333명 가운데 2,246명은 대표 이미지가 출처 한 곳에서 나옵니다. 수집이 심하게 쏠려 있어서, 저희가 색인하지 않는 카탈로그의 자료는 보이지 않습니다.
  • 저희 유사 배우 데이터에는 이름이 붙지 않은 신원을 가리키는 참조가 7,004건 있습니다. 점수가 높은데 이름이 없는 것은 정상적인 결과입니다. 얼굴은 색인됐지만 신원 확인 단계를 거치지 않았다는 뜻입니다.

수집 범위가 완전하다고 전제하는 것 자체가 실수입니다. "색인에 없음"을 "이 결과들 중 하나일 것"으로 바꿔 놓기 때문입니다.

절제된 시도는 어떤 모습인가?

네 수를 순서대로 두고 멈추는 것입니다.

  1. 좋은 프레임 한 장. 두 눈이 다 보이고, 흔들림이 없고, 플레이어를 일시정지한 상태에서 캡처한 것.
  2. 최고 점수를 0.40 기준값과 견줘 읽는다. 그 위면 진행하고, 아래면 사람이 아니라 프레임이나 수집 범위를 의심한다.
  3. 다른 프레임 한 장, 또는 장면 속 다른 사람.
  4. 화면이나 파일명에 품번이 보인다면 품번 확인.

이 넷이 모두 실패했다면, 정직한 결론은 그 자료가 지금 닿을 수 있는 출처들로는 도달할 수 없다는 것입니다. 오늘 다섯 번째 시도를 하는 것보다 몇 달 뒤에 다시 확인해 보는 편이 낫습니다.

관련 질문


같은 프레임으로 계속 재시도하고 있었다면, 해법은 다른 도구가 아니라 다른 프레임입니다. 새 프레임을 여기에 올려 보십시오. 검출은 브라우저 안에서 돌아가고, 모든 결과에 그것을 판단할 점수가 함께 표시됩니다.