대표 숫자만 보고 짐작하는 것보다 훨씬 적습니다. 저희 색인에는 얼굴 벡터 241,792개가 있지만 신원 레코드는 2,333건뿐이고, 그중 인물 정보 필드가 채워진 프로필까지 이어지는 것은 1,707건입니다. **색인한 얼굴 중 이름이 붙은 것은 약 1%**입니다(저희 색인, 2026-08 스냅숏).
이 비율이 "데이터가 얼마나 완전한가"에 대한 정직한 답입니다. 이 글의 나머지는 그 1%가 정확히 어느 1%인지, 그리고 나머지 99%가 왜 시스템의 실패가 아니라 소재 자체의 성질인지를 말하려는 시도입니다.
대표 숫자들은 실제로 무엇을 세는가?
각 숫자는 들리는 것보다 좁은 것을 세므로, 하나씩 진짜 정의와 함께 늘어놓습니다.
| 항목 | 값 | 세는 것 | 세지 않는 것 |
|---|---|---|---|
| 얼굴 벡터 | 241,792 | 색인한 이미지에서 검출된 얼굴 | 서로 다른 사람 수. 한 사람이 여러 번 등장함 |
| 신원 레코드 | 2,333 | 한 사람으로 묶고 이름표를 붙인 군집 | 색인 안의 모든 사람. 대다수 얼굴에는 이름표가 없음 |
| 전체 프로필이 있는 레코드 | 1,707 | 고유 slug와 메타데이터를 가진 신원 | 이름 문자열만 있는 626건 |
| 색인한 사이트 | 106 | 이미지를 수집한 호스트 | 일본 품번을 다루는 사이트. 약 13곳 |
| 키워드 랜딩 페이지 | 300 | 색인 위에 만든 질의 페이지 | 이 산업의 태그 어휘 전반 |
| 언어 | 13 | 인터페이스와 이름 번역 언어 | 출처. 대부분의 출처는 영어 |
출처: 저희 색인, 2026-08 스냅숏.
얼굴 검색 마케팅의 대부분은 첫 줄에 얹혀 있는데, 그것이 가장 의미가 적은 숫자입니다. 241,792는 이미지를 몇 장 처리했는지를 재는 값이지, 몇 사람을 식별할 수 있는지가 아닙니다.
색인의 1%에만 이름이 붙어 있는 이유는?
얼굴은 기계적으로 찾아내지만 이름은 편집으로 채워야 하고, 저희가 색인하는 출처에서는 그 편집 재료가 빈약하기 때문입니다.
검출기는 처리하는 모든 이미지에서 모든 얼굴을 찾아냅니다. 반면 이름은 출처 페이지가 그것을 파싱하고 연결할 수 있는 형태로 적어 두었을 때만 붙습니다. 저희가 색인한 106개 호스트의 대부분을 차지하는 해외 애그리게이터 사이트에서는 크레딧이 재게시 과정에서 통째로 제거되는 경우가 많습니다.
그 결과는 저희 유사 배우 데이터 안에서도 그대로 보입니다. 이웃 참조 13,420건 중 7,004건(52%)이 이름 없는 신원을 가리킵니다. "이 사람과 닮은 사람은 누구인가"를 가리키는 포인터의 절반 이상이, 공개 기록이 비워 둔 곳으로 이어집니다.
이름을 붙인 사람들에 대한 데이터는 얼마나 채워져 있나?
필드에 따라 23%에서 89% 사이이며, 저희는 높은 수치 옆에 낮은 수치도 함께 공개합니다.
| 필드 | 값이 있는 레코드 | n=2,333 대비 커버리지 |
|---|---|---|
| 유사 배우 목록 | 2,070 | 89% |
| 컵 사이즈 | 1,375 | 59% |
| 데뷔일 | 1,371 | 59% |
| 키 | 1,340 | 57% |
| 신체 사이즈 | 1,316 | 56% |
| 생년월일 | 1,301 | 56% |
| 출생지 | 716 | 31% |
| 혈액형 | 547 | 23% |
출처: 저희 색인, 2026-08 스냅숏, n=2,333 신원 레코드.
여기서 두 가지가 따라 나옵니다. 첫째, 예를 들어 출생지 분포에 대해 저희가 낼 수 있는 통계는 716명 위에 서 있습니다. 그리고 그 716명은 무작위 표본이 아니라 프로필이 가장 잘 문서화된 사람들, 대개는 가장 유명한 사람들입니다. 둘째, 23%인 혈액형 같은 필드는 모집단에 대한 주장을 뒷받침하기에는 너무 얇고, 저희는 547건을 산업의 초상처럼 꾸미느니 그렇다고 말하는 편을 택합니다.
유일하게 튼튼한 필드인 89%의 유사 배우 목록이 튼튼한 이유는 정확히, 그것을 출처에서 물려받는 대신 저희가 벡터로 직접 계산하기 때문입니다.
이 색인이 재는 것이 산업이 아니라면 무엇인가?
애그리게이터 사이트에서의 노출을 재며, 이 구분은 학문적인 트집이 아닙니다.
신원 레코드 2,333건 중 2,246건은 대표 이미지를 단 하나의 사이트에서 가져옵니다. 전체를 통틀어도 대표 이미지의 출처는 서로 다른 호스트 네 곳뿐입니다. 저희가 색인하는 106개 사이트 중 일본 품번을 다루는 곳은 약 13곳이고, 나머지는 대체로 해외 튜브·애그리게이터 플랫폼입니다.
그래서 어떤 배우가 저희 데이터에 잘 나타난다면, 그 발견은 이 사람의 이미지가 저희가 색인하는 애그리게이터들에서 널리 돌아다닌다는 것입니다. 그것은 실재하고 쓸모 있는 신호입니다. 하지만 다작이라는 뜻도, 일본에서 인기가 많다는 뜻도, 상업적으로 중요하다는 뜻도 아니며, 저희는 그렇게 내세우지도 않습니다.
이것은 저희가 결코 주장하지 않을 것의 경계이기도 합니다. 저희는 어떤 제작사가 N편을 냈다고 말하지 않습니다. 저희가 N편을 색인했다고만 말합니다. 색인에는 출시일 필드도, 제작사 필드도, 작품 레코드 자체도 없으므로, 연도별 제작 추이나 제작사 점유율, 포맷 전환 시기는 여기서 계산할 수 없습니다. 그것으로 만든 차트가 아무리 그럴듯해 보이더라도 마찬가지입니다.
데이터와 방법
출처. starlikeness 얼굴 색인. 106개 사이트의 커버 이미지와 영상 스틸에서 얻은 얼굴 벡터와 신원 레코드입니다.
표본. 얼굴 벡터 241,792개, 신원 레코드 2,333건(전체 프로필 1,707건, 이름 문자열만 626건), 유사 배우 참조 13,420건.
방법. YuNet으로 검출하고, 얼굴 특징점 다섯 개로 정렬한 뒤, ArcFace로 512차원 벡터로 인코딩하고, 코사인 유사도로 검색하되 동일인 임계값은 0.40입니다. 커버리지 백분율은 해당 필드에 빈 값이 아닌 값을 가진 레코드 수를 전체 모집단 2,333으로 나눈 값입니다.
스냅숏 시점. 2026-08. 그 시점의 실데이터 파일에서 수치를 다시 계산했으며, 이 페이지에 표시되는 갱신일은 재구축이 아니라 데이터의 시점을 가리킵니다.
알려진 편향.
- 출처 쏠림. 대표 이미지 2,333건 중 2,246건이 한 사이트에서 오고, 호스트 네 곳이 전부를 차지합니다. 그 출처들에 없는 것은 저희 측정에도 없습니다.
- 언어와 지역 편향. 색인한 사이트 대부분이 해외 애그리게이터이므로, 국제적으로 유통되는 이미지가 일본에서만 배포된 소재에 비해 과대 대표됩니다.
- 문서화 편향. 이름이 붙은 1,707명은 구조적으로 가장 잘 문서화된 배우들입니다. 그들 위에서 계산한 커버리지 통계는 전형적인 경우가 아니라 잘 문서화된 경우를 설명합니다.
- 과거 이력. 이 사이트에 이전에 실렸던 일부 필드 커버리지 수치는 자리표시자 문자열이 값으로 집계되어 부풀려져 있었습니다. 이번 스냅숏 전에 그것들을 제거했으며, 위의 수치는 바로잡은 값이고 이전에 발표한 것보다 낮습니다.
인용.
starlikeness (2026). "How Much of the Industry Can We Actually See?"
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites). https://starlikeness.com/ko/articles/how-complete-is-our-index
관련 질문
- 저희 데이터는 어디서 오고, 무엇이 빠져 있나
- 저희 색인에는 이름 없는 얼굴이 7,004개 있습니다
- 유사도 점수 0.40은 무슨 뜻인가?
- 얼굴 검색은 단계별로 어떻게 작동하나
- 일본 AV 산업은 어떻게 구성되어 있나
커버리지를 확인하는 실질적인 방법은 검색해 보는 것입니다. 한 장면을 올리고 점수를 읽어 보세요. 점수가 낮은 결과만 늘어선 목록은 이 사람이 그 1% 바깥에 있다는 색인의 대답입니다. 검출은 브라우저 안에서 이루어지며 원본 이미지는 기기를 떠나지 않습니다.