Menos do que o número de manchete sugere. Nosso índice guarda 241,792 vetores faciais, mas só 2,333 registros de identidade, e apenas 1,707 deles têm um perfil resolvível com campos biográficos. Cerca de 1% dos rostos que indexamos está ligado a um nome (nosso índice, retrato de 2026-08).
Essa proporção é a resposta honesta para "quão completos são seus dados". Todo o resto deste artigo é uma tentativa de dizer exatamente qual é esse 1%, e por que os outros 99% não são uma falha do sistema, e sim uma propriedade do material.
O que os números de manchete contam de verdade?
Cada número conta algo mais estreito do que parece, então aqui está cada um com a sua definição real.
| Número | Valor | O que conta | O que não conta |
|---|---|---|---|
| Vetores faciais | 241,792 | Rostos detectados nas imagens indexadas | Pessoas distintas; uma pessoa aparece muitas vezes |
| Registros de identidade | 2,333 | Agrupamentos tratados como uma pessoa com rótulo | Todo mundo no índice; a maioria dos rostos não tem rótulo |
| Registros com perfil completo | 1,707 | Identidades com slug canônico e metadados | Os 626 que guardam apenas um nome solto |
| Sites indexados | 106 | Servidores de onde rastreamos imagens | Sites que trazem códigos japoneses — cerca de 13 |
| Páginas de palavra-chave | 300 | Páginas de consulta construídas sobre o índice | Cobertura do vocabulário de tags da indústria |
| Idiomas | 13 | Idiomas da interface e da tradução de nomes | Fontes; a maioria das fontes é em inglês |
Fonte: nosso índice, retrato de 2026-08.
A primeira linha é onde mora quase todo o marketing de busca por rosto, e é a menos significativa de todas. 241,792 é uma medida de quantas imagens processamos, não de quantas pessoas conseguimos identificar.
Por que só 1% do índice tem nome?
Porque rostos são achados mecanicamente e nomes são fornecidos editorialmente, e a oferta editorial é magra nas fontes que indexamos.
Um detector encontra todo rosto em toda imagem que processamos. Um nome só gruda quando uma página de origem o informa de forma legível e vinculável. Nos sites agregadores internacionais, que formam o grosso dos nossos 106 servidores, os créditos costumam ser removidos por completo na republicação.
A consequência é visível dentro dos nossos próprios dados de semelhança: de 13,420 referências de vizinhança, 7,004 (52%) apontam para identidades sem nome. Mais da metade de todos os ponteiros de "quem se parece com esta pessoa" leva a um ponto onde o registro público ficou em branco.
Quão completos são os dados sobre as pessoas que já nomeamos?
Entre 23% e 89%, dependendo do campo, e nós publicamos os números baixos ao lado dos altos.
| Campo | Registros com valor | Cobertura de n=2,333 |
|---|---|---|
| Lista de semelhantes | 2,070 | 89% |
| Tamanho de busto | 1,375 | 59% |
| Data de estreia | 1,371 | 59% |
| Altura | 1,340 | 57% |
| Medidas | 1,316 | 56% |
| Data de nascimento | 1,301 | 56% |
| Local de nascimento | 716 | 31% |
| Tipo sanguíneo | 547 | 23% |
Fonte: nosso índice, retrato de 2026-08, n=2,333 registros de identidade.
Duas coisas decorrem disso. Primeira: qualquer estatística que pudéssemos publicar sobre, digamos, distribuição de local de nascimento se apoia em 716 pessoas — e essas 716 não são uma amostra aleatória, são aquelas cujos perfis estavam mais bem documentados, o que em geral significa as mais proeminentes. Segunda: um campo como tipo sanguíneo, a 23%, é magro demais para sustentar qualquer afirmação sobre a população, e preferimos dizer isso a fantasiar 547 registros como retrato de uma indústria.
O único campo forte, a lista de semelhantes a 89%, é forte justamente porque nós mesmos a calculamos a partir dos vetores, em vez de herdá-la de uma fonte.
O que o índice mede, se não é a indústria?
Ele mede exposição em sites agregadores, e a distinção não é acadêmica.
2,246 dos nossos 2,333 registros de identidade tiram sua imagem representativa de um único site. No conjunto inteiro, as imagens representativas vêm de apenas quatro servidores distintos. Dos 106 sites que indexamos, só cerca de 13 trazem códigos japoneses; o restante são em grande parte plataformas internacionais de tube e agregação.
Então, quando uma atriz está bem representada nos nossos dados, o achado é: as imagens dessa pessoa circulam bastante nos agregadores que indexamos. Esse é um sinal real e útil. Não é o mesmo que ser prolífica, popular no Japão ou comercialmente relevante, e não apresentamos o dado como nenhuma dessas coisas.
Isso também delimita o que nunca vamos afirmar. Não vamos dizer que um estúdio lançou N títulos — apenas que indexamos N. O índice não tem campo de data de lançamento, não tem campo de estúdio e não tem registro de títulos, então tendências de produção ano a ano, participação de mercado por estúdio e linhas do tempo de adoção de formato simplesmente não são calculáveis a partir dele, por mais convincente que um gráfico feito com ele pudesse parecer.
Dados e método
Fonte. O índice facial da starlikeness: vetores faciais e registros de identidade derivados de imagens de capa e quadros de vídeo em 106 sites.
Amostra. 241,792 vetores faciais; 2,333 registros de identidade (1,707 com perfil completo, 626 apenas com nome solto); 13,420 referências de semelhança.
Método. Detecção com YuNet; alinhamento a partir de cinco pontos faciais; codificação com ArcFace em vetores de 512 dimensões; recuperação por semelhança de cosseno com limiar de 0.40 para mesma pessoa. As porcentagens de cobertura são a contagem de registros com valor não vazio em um campo, dividida pela população completa de 2,333.
Data do retrato. 2026-08. Contagens recalculadas a partir do arquivo de dados vigente naquela data; a data de atualização visível nesta página reflete os dados, não uma reconstrução.
Viés conhecido.
- Concentração de fontes. 2,246 de 2,333 imagens representativas vêm de um único site; quatro servidores respondem por todas elas. O que estiver ausente dessas fontes está ausente das nossas medições.
- Viés de idioma e região. A maioria dos sites indexados é de agregadores internacionais, então as imagens que circulam internacionalmente ficam sobrerrepresentadas em relação ao material distribuído só no Japão.
- Viés de documentação. As 1,707 pessoas nomeadas são, por construção, as mais bem documentadas. Estatísticas de cobertura calculadas sobre elas descrevem quem está bem documentado, não quem é típico.
- Antecedente histórico. Alguns números de cobertura por campo publicados antes neste site estavam inflados porque cadeias de preenchimento eram contadas como valores. Elas foram removidas antes deste retrato; os números acima são os corrigidos, e são mais baixos do que os que divulgamos antes.
Citação.
starlikeness (2026). "Quanto da indústria a gente realmente consegue ver?"
Índice facial, retrato de 2026-08 (n=241,792 rostos; 2,333 registros de
identidade; 106 sites). https://starlikeness.com/pt-BR/articles/how-complete-is-our-index
Perguntas relacionadas
- De onde vêm nossos dados, e o que está faltando
- Nosso índice contém 589 pessoas sem nome
- O que significa uma pontuação de semelhança de 0.40?
- Como funciona a busca por rosto, passo a passo
- Como a indústria japonesa de vídeo adulto é estruturada
O teste prático de cobertura é uma busca. Envie um quadro e leia as pontuações: uma lista de resultados com pontuação baixa é o índice te dizendo que essa pessoa está fora do 1%. A detecção roda no seu navegador e a imagem original nunca sai do seu dispositivo.