저희 "닮은 배우" 데이터 안에는 이름이 붙지 않은 신원을 가리키는 참조가 7,004건 있습니다. 그 목록에 들어 있는 전체 참조 13,420건의 52%입니다 — 저희가 보유한 "이 사람을 닮은 사람은 누구인가" 포인터의 절반 이상이, 공개된 기록이 끝내 이름을 붙이지 않은 사람으로 이어진다는 뜻입니다(저희 색인, 2026-08 스냅숏).
이것은 저희가 저희 데이터에 대해 공개할 수 있는 가장 정직한 숫자이고, 동시에 가장 쓸모 있는 숫자이기도 합니다. 모든 얼굴 검색 도구가 안고 있으면서 아무도 보여주지 않는 것, 즉 존재하는 얼굴과 누군가 굳이 신원을 확인해 준 얼굴 사이의 간격을 수치로 보여주기 때문입니다.
7,004이라는 숫자는 정확히 무엇을 센 것인가?
7,004는 사람이 아니라 참조를 센 값입니다. 그 점을 정확히 해두는 것이 이 글의 목적입니다.
저희 색인의 신원 레코드 하나하나에는 벡터 공간에서 가장 가까운 이웃들의 짧은 목록 — 모델이 가장 닮았다고 보는 얼굴들 — 이 딸려 있습니다. 그 목록의 어떤 항목은 이름이 있는 배우 프로필로 이어집니다. 나머지는 내부 키와 대표 이미지와 벡터로만 존재하는 신원으로 이어집니다.
| 항목 | 값 | 무엇인가 |
|---|---|---|
| "닮은 배우" 참조 총계 | 13,420 | 모든 이웃 목록의 전체 항목 |
| 이름 있는 프로필을 가리키는 참조 | 6,416 | 전체의 48% |
| 무명 신원을 가리키는 참조 | 7,004 | 전체의 52% |
| 참조된 서로 다른 무명 신원 | 589 | 그 7,004개 포인터 뒤에 있는 사람들 |
| 무명 이웃이 하나 이상 있는 배우 | 1,899 | 이웃 목록이 있는 2,070건 중 |
| 색인의 신원 레코드 | 2,333 | 그중 1,707건이 연결 가능한 이름 프로필을 가짐 |
출처: 저희 색인, 2026-08 스냅숏, n=2,333 신원 레코드.
정리하면 포인터 7,004개, 사람 589명입니다. 무명 신원 하나는 평균적으로 열두 번쯤 누군가의 가까운 이웃으로 등장합니다. 표제 숫자만 읽으면 문제를 대략 열두 배로 부풀려 이해하게 되는데 — 그래서 그 옆에 내역을 함께 공개합니다.
얼굴은 왜 이름 없이 색인에 남는가?
얼굴과 이름이 서로 다른 경로로 들어오는데, 그중 하나만 믿을 만하기 때문입니다.
얼굴은 색인 대상 이미지에서 검출기가 하나를 찾을 때마다 색인에 들어옵니다. 이 과정은 기계적이고 거의 빠짐이 없습니다. 이름은 어떤 공개된 페이지가 저희가 파싱하고 연결할 수 있는 형태로 그것을 적어 놓았을 때에만 들어옵니다. 이쪽은 편집상의 판단이고, 사이트마다 제각각이며, 아예 없는 경우도 많습니다.
흔한 원인을 저희가 자주 보는 순서대로 대략 적으면 이렇습니다.
- 출처 페이지에 배우 크레딧이 아예 없는 경우 — 메타데이터를 벗긴 채 자료를 다시 올리는 수집 사이트에서 아주 흔합니다.
- 페이지가 이름을 일본어로만, 그것도 정규 프로필에 끝내 연결되지 못한 형태로 적어 놓은 경우. 저희 신원 레코드 2,333건 중 626건은 연결된 프로필도 인물 정보 항목도 전혀 없이 이름 문자열로만 존재합니다.
- 배우가 여러 이름으로 활동했는데 그것들을 연결해 주는 출처가 없는 경우.
- 그 얼굴이 제작에 우연히 걸린 사람의 것이고 애초에 크레딧에 오른 배우가 아니었던 경우.
마지막 항목은 분명히 말해둘 만합니다. AV 색인에 있는 얼굴이 전부 배우인 것은 아니며, 그렇다고 전제한 색인은 중요한 방식으로 틀리게 됩니다.
검색 결과에서 이름 없는 이웃은 무엇을 알려주는가?
닮음은 실재하고 신원 확인이 빠져 있다는 것을 알려줍니다 — 검색 실패와는 다른 이야기이고, 사용자들이 생각하는 것보다 훨씬 흔합니다.
이웃 목록이 있는 레코드 2,070건 중 1,899건(92%)은 가장 가까운 이웃 가운데 무명 신원을 하나 이상 가지고 있습니다. 얼굴 검색을 돌려서 기준선을 넘는 점수가 나왔는데 이름이 없다면, 버그를 만난 것이 아닙니다. 공개된 기록의 실제 상태를 만난 것입니다.
저희가 무명 신원을 결과에서 걸러내지 않는 이유도 이것입니다. 그것들을 감추면 겉보기에는 깔끔하지만 데이터를 슬쩍 왜곡한 목록이 나옵니다. "이 사람은 존재하지만 크레딧에 오른 적이 없다"가 "여기에는 아무도 없다"로 바뀌는 것입니다. 앞의 진술은 참이고 뒤의 진술은 참이 아닙니다.
이것은 보유율 수치를 어떻게 만드는가?
수치를 끌어내리며, 저희는 듣기 좋은 쪽이 아니라 낮은 쪽을 보고합니다.
저희가 공개하는 모든 보유율 백분율은 신원 레코드 2,333건 전체를 분모로 씁니다 — 이름 문자열만 있고 그 외에는 아무것도 없는 626건까지 포함해서입니다.
| 항목 | 값이 있는 레코드 | n=2,333 대비 보유율 |
|---|---|---|
| "닮은 배우" 목록 | 2,070 | 89% |
| 컵 사이즈 | 1,375 | 59% |
| 데뷔일 | 1,371 | 59% |
| 키 | 1,340 | 57% |
| 스리 사이즈 | 1,316 | 56% |
| 생년월일 | 1,301 | 56% |
| 출생지 | 716 | 31% |
| 혈액형 | 547 | 23% |
출처: 저희 색인, 2026-08 스냅숏, n=2,333.
분모를 실제 프로필이 있는 1,707건으로 슬쩍 바꾸면 이 수치들을 전부 올릴 수 있습니다. 혈액형은 23%에서 32%로, 출생지는 31%에서 42%로 올라갑니다. 저희는 그렇게 하지 않습니다. 그 626건도 색인 안에 있고 검색 결과로 반환되기 때문에, 집계에서 빼면 저희가 실제로 운영하지 않는 데이터베이스를 설명하게 되기 때문입니다.
데이터와 방법
출처. starlikeness 얼굴 색인. 106개 사이트의 패키지 이미지와 스틸에서 뽑아낸 얼굴 벡터와 신원 레코드입니다.
표본. 얼굴 벡터 241,792건, 신원 레코드 2,333건, 이웃 목록 2,070건에 걸친 "닮은 배우" 참조 13,420건.
방법. 얼굴은 YuNet으로 검출하고 다섯 개 랜드마크로 정렬한 뒤 ArcFace로 512차원 벡터에 인코딩합니다. 이웃 목록은 코사인 유사도로 가장 가까운 벡터들이며, 동일인 기준선 0.40을 적용합니다. 참조는 연결된 배우 프로필 없이 내부 해시만으로 식별되는 신원으로 귀결될 때 "무명"으로 분류됩니다.
스냅숏 날짜. 2026-08. 모든 집계는 그날의 실제 데이터 파일에서 다시 계산했습니다.
알려진 편향. 저희 출처는 매우 편중되어 있습니다. 대표 이미지 2,333건 중 2,246건이 한 사이트에서 나오고, 저희가 색인하는 106개 사이트 중 일본 콘텐츠 ID를 달고 있는 곳은 13개 남짓뿐입니다 — 나머지는 대체로 해외 튜브 사이트와 수집 사이트입니다. 따라서 저희가 재는 이름 공백은 부분적으로는 업계 전체가 아니라 그 출처들의 메타데이터 관행이 만든 성질입니다. 이 색인이 재는 것은 수집 사이트에서의 노출도이지 발매량이 아닙니다. 기록이 잘 남아 있는 배우라도 그 작품이 저희 출처에 없으면 여기서는 없는 것으로 나타나고, 크레딧이 부실한 수집 사이트 업로드는 무명 건수를 부풀립니다.
계산할 수 없는 것. 색인은 작품이 아니라 얼굴을 저장합니다. 발매일, 제작사, 작품 수 항목이 없으므로 생산량, 제작사 점유율, 전년 대비 산출량에 대한 어떤 진술도 여기서 끌어낼 수 없습니다.
인용.
starlikeness (2026). "Our Index Contains 7,004 Faces With No Name."
Face index, 2026-08 snapshot (n=2,333 identity records; 13,420 neighbour
references). https://starlikeness.com/ko/articles/faces-without-names
관련 질문
무명 신원을 직접 보고 싶다면 얼굴 검색을 돌린 뒤, 점수는 높은데 뒤에 프로필이 없는 결과를 찾아보십시오. 얼굴 인식은 브라우저 안에서 일어나고, 매칭에는 잘라낸 얼굴 영역만 전송됩니다.