저희 데이터는 중간에서 만나는 두 갈래에서 옵니다. 얼굴 벡터는 106개 공개 사이트에 올라온 표지 이미지와 영상 스틸에서 계산합니다. 배우 메타데이터, 즉 이름과 번역명과 신상 항목은 공개 프로필 페이지에서 읽어 냅니다. 저희가 공개하는 모든 것은 이 둘 중 하나 또는 둘 모두에서 나오고, 둘이 어긋나거나 침묵하는 지점에서 저희에게 남는 것은 답이 아니라 빈칸입니다.
출처에 대해 가장 먼저 알아야 할 것은 그것이 얼마나 좁으냐입니다. 저희 신원 기록 2,333건 중 2,246건이 대표 이미지를 단 하나의 사이트에서 가져오고, 색인 전체를 통틀어 대표 이미지를 공급하는 호스트는 단 네 곳뿐입니다.
두 갈래의 데이터는 정확히 무엇인가?
한쪽은 저희가 계산하고, 다른 쪽은 게시자에게서 물려받습니다. 둘은 완전히 다른 방식으로 실패합니다.
| 얼굴 벡터 | 배우 메타데이터 | |
|---|---|---|
| 출처 | 색인한 106개 사이트에 올라온 이미지 | 공개 프로필 페이지 |
| 만든 주체 | 저희 파이프라인(YuNet, ArcFace) | 제3자 편집자 |
| 완전성 | 색인한 이미지에 대해서는 거의 전부 | 항목별로 23%–89% |
| 실패 양상 | 검출 실패. 나쁜 각도, 가림, 작은 얼굴 | 빈칸으로 남은 항목, 자리표시 문자열, 서로 모순된 값 |
| 개선할 수 있나? | 예 — 출처를 더 색인하면 됨 | 어딘가가 공개해야만 가능 |
이 비대칭이 중요합니다. 얼굴 데이터가 없다면 그 이미지를 저희가 색인하지 않았기 때문입니다. 메타데이터가 없다면 애초에 아무도 적어 두지 않은 것이고, 어떤 기술로도 되살릴 수 없습니다.
어떤 출처가 얼마나 심하게 지배하고 있나?
한 사이트가 거의 완전히 지배하고 있고, "106개 사이트"라는 말이 저희에게 없는 폭을 암시하도록 두느니 그 사실을 공개하는 편을 택합니다.
| 대표 이미지 호스트 | 신원 기록 | 비중 |
|---|---|---|
| 주 출처(jable) | 2,246 | 96.3% |
| 두 번째 호스트 | 67 | 2.9% |
| 세 번째 호스트 | 14 | 0.6% |
| 네 번째 호스트 | 6 | 0.3% |
출처: 저희 색인, 2026-08 스냅숏, n=2,333 신원 기록.
106이라는 숫자는 얼굴 색인에, 즉 241,792개 벡터에 기여한 사이트의 수입니다. 위의 네 호스트는 각 신원의 대표 이미지가 어디서 왔는지를 말합니다. 둘 다 사실이지만, 신원 계층이 얼마나 한쪽에 몰려 있는지를 알려 주는 것은 뒤의 것뿐입니다.
첫 번째 편중 위에 두 번째 편중이 얹혀 있습니다. 색인한 106개 사이트 중 일본 작품 ID를 다루는 곳은 약 13곳뿐입니다. 나머지는 대체로 국제 튜브 사이트와 애그리게이터입니다. 따라서 일본 AV에 대한 저희의 시야는 거의 전적으로 국제적인 재게시를 거쳐 만들어진 것입니다.
항목별로 무엇이 빠져 있나?
항목에 따라 기록의 11%에서 77%가 빠져 있습니다. 보기 좋은 일부가 아니라 전체 내역을 그대로 싣습니다.
| 항목 | 있음 | 없음 | n=2,333 대비 커버리지 |
|---|---|---|---|
| 비슷한 배우 목록 | 2,070 | 263 | 89% |
| 컵 사이즈 | 1,375 | 958 | 59% |
| 데뷔일 | 1,371 | 962 | 59% |
| 키 | 1,340 | 993 | 57% |
| 신체 치수 | 1,316 | 1,017 | 56% |
| 생년월일 | 1,301 | 1,032 | 56% |
| 출생지 | 716 | 1,617 | 31% |
| 혈액형 | 547 | 1,786 | 23% |
출처: 저희 색인, 2026-08 스냅숏, n=2,333 신원 기록.
저희가 단서가 아니라 데이터의 일부라고 여기는 참고 사항이 셋 있습니다.
- 빠진 것들은 무작위가 아닙니다. 메타데이터가 온전한 기록은 가장 잘 기록된 배우들의 것이고, 그것은 대개 가장 유명한 배우라는 뜻입니다. 있는 값들로 계산한 통계는 무엇이든 유명하고 국제적으로 유통되는 배우들에 관한 이야기입니다.
- 626건은 이름만 있고 나머지가 전혀 없습니다. 신상 항목이 하나도 없습니다. 그 기록들도 위의 분모에 포함되어 있고, 그래서 모든 비율이 그것들을 슬쩍 빼 버렸을 때보다 낮습니다.
- 이 사이트의 예전 수치 일부는 너무 높았습니다. 출처 데이터의 자리표시 문자열이 실제 값으로 계산되고 있었고, 그 탓에 여러 커버리지 수치가 부풀려졌으며, 더 나쁘게는 배우 페이지의 구조화 데이터로까지 나가고 있었습니다. 그 값들은 제거했습니다. 위의 표가 바로잡은 내역이며, 이전 숫자는 인용하지 말아 주십시오.
이 데이터가 결코 알려 줄 수 없는 것은?
작품이나 제작사나 출시량에 대해서는 아무것도 알려 줄 수 없습니다. 애초에 담고 있지 않기 때문입니다.
색인이 저장하는 것은 얼굴이지 작품이 아닙니다. 발매일 항목도, 제작사나 레이블 항목도, 작품 기록도 없습니다. 그래서 만들어 내기는 쉽고 뒷받침하기는 불가능한 통계 한 무리가 통째로 배제됩니다. 연간 제작 편수, 제작사 점유율, 포맷 도입 흐름, 연도별 장르 변화 같은 것들입니다.
이는 저희가 쓰는 표현의 범위도 정해 줍니다. 저희는 어떤 제작사가 N편을 냈다고 쓰지 않습니다. 저희가 N편을 색인했다고 씁니다. 저희가 센 것은 애그리게이터의 재게시이고, 그 두 문장 사이의 간극이 곧 저희 데이터와 업계 사이의 간극이기 때문입니다.
데이터와 방법
출처. 106개 공개 사이트에 올라온 표지 이미지와 영상 스틸, 메타데이터를 위한 공개 배우 프로필 페이지, 그리고 확실하게 대응되는 경우의 Wikidata 식별자.
표본. 얼굴 벡터 241,792개, 신원 기록 2,333건(프로필이 온전한 것 1,707건, 이름 문자열만 있는 것 626건), 비슷한 배우 참조 13,420건, 그중 7,004건은 이름 없는 신원을 가리킴.
방법. YuNet으로 얼굴을 검출하고, 랜드마크 다섯 개로 정렬하고, ArcFace로 512차원 벡터로 인코딩하고, 동일 인물 기준값 0.40으로 코사인 유사도 검색을 합니다. 메타데이터는 공개 프로필에서 읽어 내 자료형과 형식을 검증하고, 검증에 실패하면 다른 값으로 대체하지 않고 비워 둡니다. 비슷한 배우 목록은 물려받는 것이 아니라 벡터로 계산합니다.
스냅숏 날짜. 2026-08.
저장하지 않는 것. 영상 파일. 이용자가 올린 원본. 검출은 방문자의 브라우저 안에서 돌아가고, 대조에는 잘라 낸 얼굴 영역과 랜드마크 다섯 개만 전송되며, 질의 결과는 보관하지 않습니다. 색인은 공개된 소재로 만들어지지, 사람들이 무엇을 검색했는지로 만들어지지 않습니다.
알려진 편향.
- 극단적인 출처 편중. 대표 이미지의 96.3%가 한 호스트에서 오고, 네 호스트가 전부를 차지합니다.
- 애그리게이터를 거친 시야. 색인한 106개 사이트 중 일본 작품 ID를 다루는 곳은 약 13곳뿐이라, 저희가 보는 소재는 국제적으로 유통되는 것들입니다.
- 기록의 쏠림. 존재하는 메타데이터는 유명한 배우 쪽에 과하게 몰려 있습니다.
- 그 결과. 이 수치들이 재는 것은 저희가 색인한 사이트에서의 노출이지 출시량이나 업계 구성이 아닙니다. 여기 나오는 모든 숫자를 먼저 저희 출처에 관한 진술로 받아들이고, 업계에 관해서는 추론으로만 받아들이세요.
인용.
starlikeness (2026). "저희 데이터는 어디서 오고, 무엇이 빠져 있나."
얼굴 색인, 2026-08 스냅숏 (n=241,792 얼굴; 신원 기록 2,333건;
사이트 106곳; 대표 이미지 호스트 4곳).
https://starlikeness.com/ko/articles/where-our-data-comes-from
관련 질문
- 업계의 얼마만큼을 실제로 볼 수 있나?
- 저희 색인에는 이름 없는 얼굴이 7,004개 있습니다
- 유사도 점수 0.40은 무슨 뜻인가?
- 얼굴 검색은 어떻게 작동하나, 단계별로
- 구글 이미지 역검색이 성인 영상에 통하지 않는 이유
위의 모든 이야기는 색인에 관한 것이지 당신에 관한 것이 아닙니다. 얼굴 검출은 당신의 브라우저에서 돌아가고, 대조에는 잘라 낸 얼굴 영역만 전송되며, 당신의 검색에 관한 어떤 것도 이 데이터에 되쓰이지 않습니다.