이 분야의 데이터베이스는 같은 목록을 놓고 경쟁하는 여러 판본이 아닙니다. 서로 다른 출처에서 서로 다른 목적으로 만들어진 네 종류의 기록이며, 저마다 좁은 범위의 항목에 대해서만 권위가 있고 그 바깥에서는 믿을 수 없습니다.

실전에서 필요한 기술은 사이트 하나를 고르는 것이 아닙니다. 지금 보고 있는 것이 어느 종류인지 알고, 그중 어떤 항목을 믿어야 하는지 아는 것입니다. 판매 사이트는 자기가 파는 것만 압니다. 커뮤니티형은 더 많은 작품을 알고, 그만큼 더 많이 틀립니다. 어느 쪽도 거짓말을 하는 게 아닙니다. 애초에 답하도록 만들어진 질문이 다를 뿐입니다.

데이터베이스의 네 가지 종류는 무엇인가요?

네 가지는 판매 사이트 카탈로그, 커뮤니티형 메타데이터 데이터베이스, 배우 중심 색인, 이미지·얼굴 색인입니다. 차이는 데이터가 어디서 오느냐에 있고, 그것이 각자의 고장 방식을 전부 결정합니다.

종류 데이터 출처 가장 강한 부분 알려진 약점
판매 사이트 카탈로그 판매자 자신의 상품 기록 정식 품번, 공식 타이틀, 패키지 이미지, 지금 구매 가능한지 여부 그 판매자가 취급하는 것만 다룸. 내려간 작품은 통째로 사라지기도 함
커뮤니티형 메타데이터 데이터베이스 이용자 투고. 대개 스크래핑한 뒤 손으로 수정 제작사와 시대를 넘나드는 폭넓음. 절판 작품 포함 정확도가 들쭉날쭉. 오래된 항목, 기여자마다 다른 항목 정의
배우 중심 색인 사람에 묶어 모은 출연작 목록 제작사와 시기를 가로질러 한 사람의 작업을 따라가기 예명 변경에서 끊김. 초기작이나 크레딧 없는 작업은 대체로 누락
이미지·얼굴 색인 패키지 이미지와 스틸을 시각적 유사도로 대조 텍스트는 전혀 없고 사진만 있을 때 사람을 찾아내기 색인된 것만 반환. 작품명은 직접 알 수 없고 사람만 알 수 있음

각 행의 약점은 그 출처에서 곧바로 따라 나온 결과입니다. 아무리 애써도 판매 사이트가 절판 작품을 다루지 못하는 것도, 커뮤니티형 데이터베이스가 판매자의 상품 테이블만큼 내부적으로 일관될 수 없는 것도 그 때문입니다.

판매 사이트 카탈로그를 봐야 할 때는 언제인가요?

기록의 정식 형태가 필요할 때입니다. 정확한 품번, 유통사가 쓴 그대로의 공식 타이틀, 패키지 이미지, 그리고 지금 구할 수 있는지 여부입니다.

판매 사이트의 데이터는 장사의 부산물이고, 그래서 자기 범위 안에서는 유난히 믿을 만합니다. 판매자에게는 품번과 타이틀과 재고 상태를 정확히 유지할 운영상의 직접적인 이유가 있기 때문입니다. 그 항목들이 자사 검색과 주문 처리를 굴러가게 하니까요. 몇 년 전에 파는 것을 그만둔 작품에 대해서는 아무도 그런 동기가 없습니다. 그리고 판매 사이트가 텅 비는 지점이 바로 거기입니다.

흔한 실수는 판매 사이트를 인구조사처럼 다루는 것입니다. 판매 사이트에 없다는 것은 "여기서는 안 판다"는 뜻이지 "존재하지 않는다"는 뜻이 결코 아닙니다. 어떤 작품이 나온 적이 있는지 확인하려는 것이라면 판매 사이트는 잘못된 도구입니다.

판매 사이트의 데이터는 이 분야에서 기계가 읽기 가장 좋은 데이터이기도 합니다. 뭔가를 만들려는 사람이라면 알아둘 값어치가 있습니다. FANZA 운영사는 api.dmm.com/affiliate/v3/에서 상품 API를 공개하고 있는데, 상품·배우·제작사·시리즈·장르·카탈로그 플로어별로 엔드포인트가 따로 있고 콘텐츠 ID, 타이틀, 날짜, 이미지 URL을 반환합니다. 사용하려면 API ID와 제휴 ID가 필요하므로 완전 공개가 아니라 제휴 계정 뒤에 잠겨 있습니다(DMM.com Labo 자체 Go SDK, pkg.go.dev/github.com/dmmcomlabo/dmm-go-sdk/api 로 대조 확인, 2026-08-03 기준). 이것이 이 시장 전체의 패턴입니다. 카탈로그는 통째로 받을 수 있지만 어디까지나 제휴 피드로서이고, 거기에는 상업적인 끈이 딸려 옵니다.

커뮤니티형 데이터베이스는 언제 믿어야 하나요?

존재 여부와 폭에 대해서는 믿으십시오. 어떤 작품이나 배우가 존재한다는 것을 확인하는 일, 그리고 이제 어디서도 팔지 않는 자료를 찾아내는 일입니다.

이건 정말로 가치가 있고, 상업적 출처로는 대체되지 않습니다. 대가는 기여자마다 항목의 정의가 흔들린다는 점입니다. "발매일"은 발표일일 수도, 디지털 배급일일 수도, 패키지 발매일일 수도 있습니다. 크레딧은 패키지에서 옮겨 적은 것일 수도, 판매 페이지에서 가져온 것일 수도, 또 어딘가에서 베낀 다른 데이터베이스에서 온 것일 수도 있습니다. 데이터베이스끼리 서로를 스크래핑하기 때문에 오류는 퍼져 나갑니다. 똑같이 틀린 출생 연도가 네 개 사이트에 실려 마치 교차 검증된 것처럼 보이는 이유가 그것입니다.

커뮤니티형 데이터베이스끼리 일치한다는 사실은 강한 증거가 아니라 약한 증거로 다루십시오. 두 사이트가 일치한다는 것은 독립된 기록이 둘이라는 뜻일 수도 있고, 기록 하나가 두 번 복사됐다는 뜻일 수도 있습니다.

배우 중심 색인이 다른 곳은 못 하는 일은 무엇인가요?

배우 색인은 상품이 아니라 사람에 묶여 있고, 제작사를 넘나드는 경력을 따라갈 수 있는 유일한 구조입니다.

그것이 이 색인의 진짜 기능입니다. 판매 사이트는 파는 물건을 기준으로 정리하고, 배우 색인은 누가 나오는지를 기준으로 정리합니다. 어떤 사람이 소속 제작사를 옮기기 전후로 무슨 작업을 했는지 알고 싶다면, 한 번의 조회로 답해 주는 것은 사람에 묶인 구조뿐입니다.

이 종류의 특징적인 고장은 개명입니다. 예명은 소속사를 옮길 때, 제작사를 옮길 때, 때로는 데뷔와 재데뷔 사이에도 바뀝니다. 그러면 같은 사람이 각각 반쪽짜리 출연작 목록을 가진 두 개의 항목이 됩니다. 텍스트 기반 데이터베이스에는 이것을 자동으로 감지할 수단이 없습니다. 두 레코드가 공유하는 항목이 하나도 없기 때문입니다.

출연작 목록을 하한선으로 읽어야 하는 이유도 그것입니다. 그것은 "이 색인이 이 이름으로 크레딧됐다고 알고 있는 작품"의 목록이지, "그 사람이 만든 것"의 목록이 아닙니다.

이미지·얼굴 색인은 어디에 자리하나요?

이미지 색인은 다른 종류가 구조적으로 답할 수 없는 단 하나의 질문에 답합니다. 가진 게 사진 한 장뿐일 때, 이 사람은 누구인가입니다.

텍스트 데이터베이스는 하나같이 이름이든 품번이든 타이틀이든 이미 알고 있을 것을 전제합니다. 영상의 한 프레임만 있고 텍스트가 전혀 없다면 들어갈 입구가 없습니다. 얼굴 매칭은 그것을 뒤집습니다. 얼굴을 검출하고, 벡터로 인코딩하고, 이미 색인된 얼굴들과 비교해서 작품이 아니라 사람을 돌려줍니다.

저희 색인은 106개 사이트의 패키지 이미지와 스틸에서 모은 241,792건의 얼굴2,333명의 배우에 걸쳐 보유하고 있습니다(저희 색인, 2026-08 스냅샷).

숫자보다 그 경계가 더 중요합니다. 수록 범위는 고르게 퍼져 있지 않습니다. 2,333명의 배우 가운데 2,246명은 대표 이미지를 단일 사이트에서 가져왔습니다. 상당한 쏠림이고, 그 지배적인 출처에 한 번도 등장하지 않은 배우는 찾아낼 가능성이 훨씬 낮다는 뜻입니다. 그런데도 도구는 아슬아슬하게 빗나간 후보들을 순위 매긴 목록으로 계속 돌려줍니다. 어떤 이미지 색인에도 이런 형태의 한계가 있고, 쓸 만한 쪽은 그것을 알려 줍니다.

이미지 색인은 작품명도 알려 주지 않습니다. 알려 주는 것은 사람이고, 작품명은 그다음 단계에서 나옵니다. 그 사람의 알려진 작업을 장면의 세부로 좁혀 가는 단계입니다. 얼굴 검색과 출연작 데이터베이스는 대체재가 아니라 보완재입니다.

개별 항목 하나가 믿을 만한지는 어떻게 판별하나요?

사이트가 아니라 그 항목을 평가하십시오. 확인을 거친 기록과 그냥 베낀 기록을 갈라내는 신호가 넷 있습니다.

  1. 출처 품번이 적혀 있는가? 유통사 자체의 상품 코드가 실린 항목은 거슬러 올라갈 수 있습니다. 타이틀만 실린 항목은 그럴 수 없습니다.
  2. 옛 예명과 현재 예명을 구분하는가? 별칭을 명시적으로 모델링한 데이터베이스는 개명 문제를 고민해 본 곳입니다. 이름 항목이 하나뿐인 곳은 한 사람의 경력을 소리 없이 둘로 쪼갭니다.
  3. 기록에 날짜가 있는가? "최종 업데이트"가 없는 항목은 2015년에 방치된 항목과 구별할 방법이 없습니다.
  4. 빈 항목은 비어 있는가, 그럴듯한 쓰레기로 채워져 있는가? 자리 채우기용 값 — 딱 떨어지는 숫자의 신체 사이즈, 기본값 생년월일 — 은 그 항목이 한 번도 검증되지 않았다는 강력한 신호입니다. 빈칸이 추측보다 정직합니다.

이 네 가지 질문을 일관되게 적용하는 편이 "최고의" 사이트를 고르는 것보다 정확도에 훨씬 크게 기여합니다. 출처를 통째로 믿는 대신 기록을 한 건씩 채점할 수 있게 해 주기 때문입니다.

관련 질문


저희가 색인하는 출처와 각각이 무엇을 제공하는지는 사이트 목록에 정리돼 있습니다.