Nossos dados vêm de duas correntes que se encontram no meio do caminho. Os vetores faciais são calculados a partir de imagens de capa e stills de vídeo publicados em 106 sites públicos. Os metadados das atrizes — nomes, traduções, campos biográficos — são extraídos de páginas de perfil públicas. Tudo que publicamos deriva de uma das duas ou das duas, e onde elas discordam ou se calam, o que temos é uma lacuna, não uma resposta.
O mais importante a saber sobre as fontes é o quanto elas são estreitas. 2,246 dos nossos 2,333 registros de identidade tiram a imagem representativa de um único site, e no índice inteiro apenas quatro hosts distintos fornecem imagens representativas.
Quais são as duas correntes de dados, exatamente?
Uma corrente é calculada por nós; a outra é herdada de quem publica. Elas falham de maneiras completamente diferentes.
| Vetores faciais | Metadados das atrizes | |
|---|---|---|
| Origem | Imagens publicadas em 106 sites indexados | Páginas de perfil públicas |
| Produzidos por | Nosso próprio pipeline (YuNet, ArcFace) | Editores de terceiros |
| Completude | Quase total para as imagens indexadas | 23%–89% conforme o campo |
| Modo de falha | Detecção que erra; ângulos ruins, oclusão, rostos pequenos | Campos em branco, strings de placeholder, valores contraditórios |
| Dá para melhorar? | Dá — indexando mais fontes | Só se alguma fonte publicar |
A assimetria importa. Quando falta dado facial, é porque não indexamos a imagem. Quando falta metadado, ninguém anotou aquilo em lugar nenhum, e não há engenharia que recupere.
Quais fontes dominam, e o quanto?
Um site domina quase por completo, e preferimos publicar isso a deixar que "106 sites" sugira uma amplitude que não temos.
| Host da imagem representativa | Registros de identidade | Participação |
|---|---|---|
| Fonte principal (jable) | 2,246 | 96.3% |
| Segundo host | 67 | 2.9% |
| Terceiro host | 14 | 0.6% |
| Quarto host | 6 | 0.3% |
Fonte: nosso índice, amostra de 2026-08, n=2,333 registros de identidade.
O número 106 descreve os sites que contribuem para o índice de rostos — os 241,792 vetores. Os quatro hosts acima descrevem de onde vem a imagem representativa de cada identidade. As duas coisas são verdadeiras; só a segunda te diz o quanto a camada de identidade é concentrada.
Há uma segunda concentração em cima da primeira. Dos 106 sites indexados, só uns 13 carregam IDs de conteúdo japonês. O resto são, em boa parte, plataformas internacionais de tube e agregadores. Nossa visão do vídeo adulto japonês é, portanto, mediada quase inteiramente por republicação internacional.
O que está faltando, campo a campo?
Entre 11% e 77% dos registros, dependendo do campo. Aqui vai a contabilidade completa, não o recorte lisonjeiro.
| Campo | Presente | Faltando | Cobertura de n=2,333 |
|---|---|---|---|
| Lista de atrizes parecidas | 2,070 | 263 | 89% |
| Tamanho de busto | 1,375 | 958 | 59% |
| Data de estreia | 1,371 | 962 | 59% |
| Altura | 1,340 | 993 | 57% |
| Medidas | 1,316 | 1,017 | 56% |
| Data de nascimento | 1,301 | 1,032 | 56% |
| Local de nascimento | 716 | 1,617 | 31% |
| Tipo sanguíneo | 547 | 1,786 | 23% |
Fonte: nosso índice, amostra de 2026-08, n=2,333 registros de identidade.
Três observações que consideramos parte dos dados, não ressalvas a eles:
- O que falta não falta ao acaso. Os registros com metadados completos são os das atrizes mais bem documentadas, o que em geral significa as mais proeminentes. Qualquer estatística calculada sobre os valores presentes descreve atrizes proeminentes, de circulação internacional.
- 626 registros guardam um nome e nada mais — nenhum campo biográfico. Eles estão contados no denominador acima, e é por isso que toda porcentagem é mais baixa do que seria se a gente os descartasse na surdina.
- Alguns números anteriores neste site estavam altos demais. Strings de placeholder nos dados de origem estavam sendo contadas como valores reais, o que inflava várias cifras de cobertura e, pior, estava sendo emitido em dados estruturados nas páginas de atriz. Esses valores foram removidos. A tabela acima é a contabilidade corrigida, e os números anteriores não devem ser citados.
O que estes dados nunca vão poder te dizer?
Eles nunca vão poder te dizer nada sobre títulos, estúdios ou volume de lançamentos, porque não contêm essas coisas.
O índice guarda rostos, não obras. Não existe campo de data de lançamento, nem campo de estúdio ou selo, nem registro de título. Isso descarta uma família inteira de estatísticas que seriam fáceis de forjar e impossíveis de sustentar: volume anual de produção, participação de mercado por estúdio, linhas do tempo de adoção de formatos, mudanças de gênero ano a ano.
Isso também limita a linguagem que usamos. Nunca escrevemos que um estúdio lançou N títulos. Escrevemos que indexamos N — porque o que contamos foi republicação em agregadores, e a distância entre essas duas frases é exatamente a distância entre os nossos dados e a indústria.
Dados e método
Fonte. Imagens de capa e stills de vídeo publicados em 106 sites públicos; páginas públicas de perfil de atrizes para os metadados; identificadores da Wikidata onde existe um mapeamento confiável.
Amostra. 241,792 vetores faciais; 2,333 registros de identidade (1,707 com perfil completo, 626 só com string de nome); 13,420 referências a atrizes parecidas, das quais 7,004 apontam para identidades sem nome.
Método. Rostos detectados com YuNet, alinhados a partir de cinco pontos de referência, codificados com ArcFace em vetores de 512 dimensões, recuperados por similaridade de cosseno com limiar de 0.40 para mesma pessoa. Os metadados são extraídos de perfis públicos, validados quanto a tipo e formato, e deixados vazios quando a validação falha, em vez de substituídos. As listas de atrizes parecidas são calculadas a partir dos vetores, não herdadas.
Data da amostra. 2026-08.
O que não é guardado. Arquivos de vídeo. Os uploads originais dos usuários — a detecção roda no navegador do visitante, só um recorte do rosto e seus cinco pontos de referência são transmitidos para a comparação, e os resultados de consulta não são retidos. O índice é construído a partir de material publicado, nunca a partir daquilo que as pessoas buscam.
Viés conhecido.
- Concentração extrema de fontes. 96.3% das imagens representativas vêm de um host; quatro hosts respondem por todas elas.
- Mediação por agregadores. Só uns 13 dos 106 sites indexados carregam IDs de conteúdo japonês, então o material que enxergamos é o que circula internacionalmente.
- Viés de documentação. Os metadados presentes super-representam as atrizes proeminentes.
- Consequência. Estes números medem exposição nos sites que indexamos, não volume de lançamentos nem composição da indústria. Trate cada número daqui como uma afirmação sobre as nossas fontes primeiro, e sobre a indústria só por inferência.
Citação.
starlikeness (2026). "De onde vêm nossos dados, e o que está faltando."
Índice de rostos, amostra de 2026-08 (n=241,792 rostos; 2,333 registros de identidade;
106 sites; 4 hosts de imagem representativa).
https://starlikeness.com/pt-BR/articles/where-our-data-comes-from
Perguntas relacionadas
- Quanto da indústria a gente realmente consegue ver?
- Nosso índice contém 589 pessoas sem nome
- O que significa uma pontuação de similaridade de 0.40?
- Como funciona a busca por rosto, passo a passo
- Por que a busca reversa de imagens do Google não funciona para vídeo adulto
Tudo que está acima descreve o índice, não você: a detecção de rosto roda no seu navegador, só um recorte do rosto é enviado para a comparação, e nada da sua busca é gravado de volta nestes dados.