Os bancos de dados desse mundo não são versões concorrentes da mesma lista. São quatro tipos diferentes de registro, construídos a partir de fontes diferentes e com finalidades diferentes, e cada um é autoritativo num conjunto estreito de campos e pouco confiável fora dele.

A habilidade que importa não é escolher um site. É saber qual categoria você está olhando, para saber em quais campos dela acreditar. Uma loja sabe o que vende e nada mais. Um banco comunitário conhece mais títulos e erra mais deles. Nenhum dos dois está mentindo para você; eles foram construídos para responder a perguntas diferentes.

Quais são as quatro categorias de banco de dados?

As quatro são: catálogos de loja, bancos comunitários de metadados, índices centrados em atrizes e índices de imagem ou rosto. Elas diferem na origem dos dados, e isso determina tudo sobre como cada uma falha.

Categoria Origem dos dados No que é boa Fraqueza conhecida
Catálogo de loja Os próprios registros de produto do vendedor Códigos canônicos, títulos oficiais, capas, o que está à venda hoje Só cobre o que aquele vendedor comercializa; títulos retirados podem sumir por completo
Banco comunitário de metadados Envios da comunidade, muitas vezes raspados e depois corrigidos à mão Abrangência entre estúdios e épocas, incluindo material fora de catálogo Precisão irregular, registros desatualizados, definições de campo inconsistentes entre colaboradores
Índice centrado em atrizes Filmografias agregadas e indexadas por pessoa Acompanhar o trabalho de uma pessoa entre estúdios e ao longo do tempo Quebra quando o nome artístico muda; trabalhos antigos ou sem crédito faltam com frequência
Índice de imagem / rosto Capas e frames, casados por semelhança visual Achar uma pessoa quando você tem uma imagem e nenhum texto Só devolve o que foi indexado; não informa um título diretamente, apenas uma pessoa

A fraqueza de cada linha é consequência direta da sua fonte. É por isso que nenhum esforço faz uma loja cobrir títulos fora de catálogo, e por isso que nenhum banco comunitário será tão consistente internamente quanto a tabela de produtos de um vendedor.

Quando o catálogo de uma loja é a fonte certa para consultar?

Consulte uma loja quando você precisa da forma canônica de um registro: o código exato, o título oficial como o distribuidor o escreve, a capa e se o título está disponível no momento.

Os dados de loja são um subproduto do comércio, o que os torna incomumente confiáveis dentro do seu escopo: o vendedor tem um motivo operacional direto para manter códigos, títulos e disponibilidade corretos, porque esses campos alimentam a busca e a entrega dele. Ninguém tem esse incentivo para um título que parou de vender anos atrás, e é exatamente aí que as lojas ficam em branco.

O erro é tratar uma loja como um censo. Ausência de uma loja significa "não é vendido aqui", nunca "não existe". Se você quer estabelecer se algo chegou a ser lançado, uma loja é o instrumento errado.

Os dados de loja também são os mais legíveis por máquina desse mercado, o que vale saber se você está construindo alguma coisa. A operadora da FANZA publica uma API de produtos em api.dmm.com/affiliate/v3/ com endpoints separados para produtos, atrizes, fabricantes, séries, gêneros e seções do catálogo, devolvendo IDs de conteúdo, títulos, datas e URLs de imagem; ela exige um API ID e um ID de afiliado, então está atrás de uma conta de afiliado em vez de ser aberta (confirmado no SDK em Go da própria DMM.com Labo, pkg.go.dev/github.com/dmmcomlabo/dmm-go-sdk/api, verificado em 2026-08-03). Esse é o padrão do mercado: o catálogo está disponível em massa, mas como feed de afiliado, com as amarras comerciais que isso implica.

Quando você deve confiar num banco comunitário?

Confie num banco comunitário para existência e abrangência — estabelecer que um título ou uma atriz existe, e encontrar material que não é mais vendido em lugar nenhum.

Isso tem valor real, e nenhuma fonte comercial reproduz. O custo é que as definições de campo derivam de um colaborador para outro. "Data de lançamento" pode significar o anúncio, o lançamento digital ou o físico. Os créditos podem ter sido copiados de uma capa, de um anúncio de venda ou de outro banco que os copiou de mais algum lugar. Erros se propagam porque os bancos raspam uns aos outros, e é por isso que o mesmo ano de nascimento errado aparece em quatro sites e parece uma confirmação.

Trate a concordância entre bancos comunitários como evidência fraca, não forte. Dois sites concordando pode significar dois registros independentes — ou um registro copiado duas vezes.

O que os índices centrados em atrizes fazem que os outros não fazem?

Os índices de atrizes são indexados por pessoa, e não por produto, que é a única estrutura capaz de acompanhar uma carreira entre estúdios.

Essa é a função real deles. Uma loja se organiza pelo que vende; um índice de atrizes se organiza por quem aparece. Se você quer saber em que alguém trabalhou antes e depois de trocar de estúdio, só a estrutura indexada por pessoa responde isso numa consulta só.

A falha característica deles é a mudança de nome. Nomes artísticos mudam entre agências, entre estúdios e às vezes entre uma estreia e um relançamento, e a mesma pessoa vira duas fichas com duas filmografias parciais. Nada num banco de dados baseado em texto detecta isso automaticamente — os dois registros não compartilham nenhum campo.

É também por isso que uma filmografia deve ser lida como um piso. Ela é uma lista do que aquele índice sabe ter sido creditado àquele nome, não uma lista do que a pessoa fez.

Onde entra um índice de imagem ou rosto?

Um índice de imagem responde à única pergunta que os outros estruturalmente não conseguem responder: quem é esta pessoa, quando tudo o que você tem é uma imagem.

Todo banco de dados textual exige que você já saiba um nome, um código ou um título. Se você tem um frame de um vídeo e nenhum texto, eles não têm porta de entrada. O casamento facial inverte isso: detecta o rosto, codifica como vetor e compara com os rostos já indexados, devolvendo pessoas em vez de títulos.

Nosso próprio índice guarda 241,792 rostos de 2,333 atrizes identificadas, extraídos de capas e frames de 106 sites (nosso índice, amostra de 2026-08).

O limite importa mais que o número. A cobertura não é distribuída por igual: das 2,333 atrizes identificadas, 2,246 têm a imagem representativa vinda de um único site. Isso é um desequilíbrio considerável, e significa que uma atriz que nunca apareceu na nossa fonte dominante tem muito menos chance de ser encontrada — enquanto a ferramenta continua devolvendo uma lista ordenada de quase-acertos. Qualquer índice de imagem tem esse formato de limitação; os úteis avisam você sobre ele.

Um índice de imagem também não entrega um título. Ele entrega uma pessoa, e o título vem de um segundo passo — estreitar o trabalho conhecido dessa pessoa pelos detalhes da cena. Busca por rosto e bancos de filmografia são complementares, não substitutos.

Como saber se um registro específico é confiável?

Julgue o registro, não o site. Quatro sinais separam uma ficha que foi verificada de uma que foi copiada:

  1. Ela cita um código de origem? Uma ficha que traz o código de produto do próprio distribuidor pode ser rastreada. Uma que traz só um título, não.
  2. Ela distingue apelido de nome artístico atual? Um banco que modela nomes alternativos de forma explícita pensou sobre mudanças de nome. Um com um único campo de nome vai partir carreiras em duas silenciosamente.
  3. A ficha tem data? Uma entrada sem "última atualização" não pode ser distinguida de uma entrada abandonada em 2015.
  4. Os campos vazios estão vazios, ou preenchidos com lixo plausível? Valores de preenchimento — medidas em números redondos, datas de nascimento padrão — são um sinal forte de que aquele campo nunca foi verificado. Um campo em branco é mais honesto que um chutado.

Aplicadas com consistência, essas quatro perguntas fazem mais pela precisão do que escolher o "melhor" site jamais fará, porque permitem avaliar registros individuais em vez de confiar numa fonte inteira.

Perguntas relacionadas


As fontes que indexamos, e o que cada uma contribui, estão listadas na nossa página de sites.