Nossos dados vêm de duas correntes que se encontram no meio do caminho. Os vetores faciais são calculados a partir de imagens de capa e stills de vídeo publicados em 106 sites públicos. Os metadados das atrizes — nomes, traduções, campos biográficos — são extraídos de páginas de perfil públicas. Tudo que publicamos deriva de uma das duas ou das duas, e onde elas discordam ou se calam, o que temos é uma lacuna, não uma resposta.

O mais importante a saber sobre as fontes é o quanto elas são estreitas. 2,246 dos nossos 2,333 registros de identidade tiram a imagem representativa de um único site, e no índice inteiro apenas quatro hosts distintos fornecem imagens representativas.

Quais são as duas correntes de dados, exatamente?

Uma corrente é calculada por nós; a outra é herdada de quem publica. Elas falham de maneiras completamente diferentes.

Vetores faciais Metadados das atrizes
Origem Imagens publicadas em 106 sites indexados Páginas de perfil públicas
Produzidos por Nosso próprio pipeline (YuNet, ArcFace) Editores de terceiros
Completude Quase total para as imagens indexadas 23%–89% conforme o campo
Modo de falha Detecção que erra; ângulos ruins, oclusão, rostos pequenos Campos em branco, strings de placeholder, valores contraditórios
Dá para melhorar? Dá — indexando mais fontes Só se alguma fonte publicar

A assimetria importa. Quando falta dado facial, é porque não indexamos a imagem. Quando falta metadado, ninguém anotou aquilo em lugar nenhum, e não há engenharia que recupere.

Quais fontes dominam, e o quanto?

Um site domina quase por completo, e preferimos publicar isso a deixar que "106 sites" sugira uma amplitude que não temos.

Host da imagem representativa Registros de identidade Participação
Fonte principal (jable) 2,246 96.3%
Segundo host 67 2.9%
Terceiro host 14 0.6%
Quarto host 6 0.3%

Fonte: nosso índice, amostra de 2026-08, n=2,333 registros de identidade.

O número 106 descreve os sites que contribuem para o índice de rostos — os 241,792 vetores. Os quatro hosts acima descrevem de onde vem a imagem representativa de cada identidade. As duas coisas são verdadeiras; só a segunda te diz o quanto a camada de identidade é concentrada.

Há uma segunda concentração em cima da primeira. Dos 106 sites indexados, só uns 13 carregam IDs de conteúdo japonês. O resto são, em boa parte, plataformas internacionais de tube e agregadores. Nossa visão do vídeo adulto japonês é, portanto, mediada quase inteiramente por republicação internacional.

O que está faltando, campo a campo?

Entre 11% e 77% dos registros, dependendo do campo. Aqui vai a contabilidade completa, não o recorte lisonjeiro.

Campo Presente Faltando Cobertura de n=2,333
Lista de atrizes parecidas 2,070 263 89%
Tamanho de busto 1,375 958 59%
Data de estreia 1,371 962 59%
Altura 1,340 993 57%
Medidas 1,316 1,017 56%
Data de nascimento 1,301 1,032 56%
Local de nascimento 716 1,617 31%
Tipo sanguíneo 547 1,786 23%

Fonte: nosso índice, amostra de 2026-08, n=2,333 registros de identidade.

Três observações que consideramos parte dos dados, não ressalvas a eles:

  • O que falta não falta ao acaso. Os registros com metadados completos são os das atrizes mais bem documentadas, o que em geral significa as mais proeminentes. Qualquer estatística calculada sobre os valores presentes descreve atrizes proeminentes, de circulação internacional.
  • 626 registros guardam um nome e nada mais — nenhum campo biográfico. Eles estão contados no denominador acima, e é por isso que toda porcentagem é mais baixa do que seria se a gente os descartasse na surdina.
  • Alguns números anteriores neste site estavam altos demais. Strings de placeholder nos dados de origem estavam sendo contadas como valores reais, o que inflava várias cifras de cobertura e, pior, estava sendo emitido em dados estruturados nas páginas de atriz. Esses valores foram removidos. A tabela acima é a contabilidade corrigida, e os números anteriores não devem ser citados.

O que estes dados nunca vão poder te dizer?

Eles nunca vão poder te dizer nada sobre títulos, estúdios ou volume de lançamentos, porque não contêm essas coisas.

O índice guarda rostos, não obras. Não existe campo de data de lançamento, nem campo de estúdio ou selo, nem registro de título. Isso descarta uma família inteira de estatísticas que seriam fáceis de forjar e impossíveis de sustentar: volume anual de produção, participação de mercado por estúdio, linhas do tempo de adoção de formatos, mudanças de gênero ano a ano.

Isso também limita a linguagem que usamos. Nunca escrevemos que um estúdio lançou N títulos. Escrevemos que indexamos N — porque o que contamos foi republicação em agregadores, e a distância entre essas duas frases é exatamente a distância entre os nossos dados e a indústria.

Dados e método

Fonte. Imagens de capa e stills de vídeo publicados em 106 sites públicos; páginas públicas de perfil de atrizes para os metadados; identificadores da Wikidata onde existe um mapeamento confiável.

Amostra. 241,792 vetores faciais; 2,333 registros de identidade (1,707 com perfil completo, 626 só com string de nome); 13,420 referências a atrizes parecidas, das quais 7,004 apontam para identidades sem nome.

Método. Rostos detectados com YuNet, alinhados a partir de cinco pontos de referência, codificados com ArcFace em vetores de 512 dimensões, recuperados por similaridade de cosseno com limiar de 0.40 para mesma pessoa. Os metadados são extraídos de perfis públicos, validados quanto a tipo e formato, e deixados vazios quando a validação falha, em vez de substituídos. As listas de atrizes parecidas são calculadas a partir dos vetores, não herdadas.

Data da amostra. 2026-08.

O que não é guardado. Arquivos de vídeo. Os uploads originais dos usuários — a detecção roda no navegador do visitante, só um recorte do rosto e seus cinco pontos de referência são transmitidos para a comparação, e os resultados de consulta não são retidos. O índice é construído a partir de material publicado, nunca a partir daquilo que as pessoas buscam.

Viés conhecido.

  • Concentração extrema de fontes. 96.3% das imagens representativas vêm de um host; quatro hosts respondem por todas elas.
  • Mediação por agregadores. Só uns 13 dos 106 sites indexados carregam IDs de conteúdo japonês, então o material que enxergamos é o que circula internacionalmente.
  • Viés de documentação. Os metadados presentes super-representam as atrizes proeminentes.
  • Consequência. Estes números medem exposição nos sites que indexamos, não volume de lançamentos nem composição da indústria. Trate cada número daqui como uma afirmação sobre as nossas fontes primeiro, e sobre a indústria só por inferência.

Citação.

starlikeness (2026). "De onde vêm nossos dados, e o que está faltando."
Índice de rostos, amostra de 2026-08 (n=241,792 rostos; 2,333 registros de identidade;
106 sites; 4 hosts de imagem representativa).
https://starlikeness.com/pt-BR/articles/where-our-data-comes-from

Perguntas relacionadas


Tudo que está acima descreve o índice, não você: a detecção de rosto roda no seu navegador, só um recorte do rosto é enviado para a comparação, e nada da sua busca é gravado de volta nestes dados.