Menos do que o número de manchete sugere. Nosso índice guarda 241,792 vetores faciais, mas só 2,333 registros de identidade, e apenas 1,707 deles têm um perfil resolvível com campos biográficos. Cerca de 1% dos rostos que indexamos está ligado a um nome (nosso índice, retrato de 2026-08).

Essa proporção é a resposta honesta para "quão completos são seus dados". Todo o resto deste artigo é uma tentativa de dizer exatamente qual é esse 1%, e por que os outros 99% não são uma falha do sistema, e sim uma propriedade do material.

O que os números de manchete contam de verdade?

Cada número conta algo mais estreito do que parece, então aqui está cada um com a sua definição real.

Número Valor O que conta O que não conta
Vetores faciais 241,792 Rostos detectados nas imagens indexadas Pessoas distintas; uma pessoa aparece muitas vezes
Registros de identidade 2,333 Agrupamentos tratados como uma pessoa com rótulo Todo mundo no índice; a maioria dos rostos não tem rótulo
Registros com perfil completo 1,707 Identidades com slug canônico e metadados Os 626 que guardam apenas um nome solto
Sites indexados 106 Servidores de onde rastreamos imagens Sites que trazem códigos japoneses — cerca de 13
Páginas de palavra-chave 300 Páginas de consulta construídas sobre o índice Cobertura do vocabulário de tags da indústria
Idiomas 13 Idiomas da interface e da tradução de nomes Fontes; a maioria das fontes é em inglês

Fonte: nosso índice, retrato de 2026-08.

A primeira linha é onde mora quase todo o marketing de busca por rosto, e é a menos significativa de todas. 241,792 é uma medida de quantas imagens processamos, não de quantas pessoas conseguimos identificar.

Por que só 1% do índice tem nome?

Porque rostos são achados mecanicamente e nomes são fornecidos editorialmente, e a oferta editorial é magra nas fontes que indexamos.

Um detector encontra todo rosto em toda imagem que processamos. Um nome só gruda quando uma página de origem o informa de forma legível e vinculável. Nos sites agregadores internacionais, que formam o grosso dos nossos 106 servidores, os créditos costumam ser removidos por completo na republicação.

A consequência é visível dentro dos nossos próprios dados de semelhança: de 13,420 referências de vizinhança, 7,004 (52%) apontam para identidades sem nome. Mais da metade de todos os ponteiros de "quem se parece com esta pessoa" leva a um ponto onde o registro público ficou em branco.

Quão completos são os dados sobre as pessoas que já nomeamos?

Entre 23% e 89%, dependendo do campo, e nós publicamos os números baixos ao lado dos altos.

Campo Registros com valor Cobertura de n=2,333
Lista de semelhantes 2,070 89%
Tamanho de busto 1,375 59%
Data de estreia 1,371 59%
Altura 1,340 57%
Medidas 1,316 56%
Data de nascimento 1,301 56%
Local de nascimento 716 31%
Tipo sanguíneo 547 23%

Fonte: nosso índice, retrato de 2026-08, n=2,333 registros de identidade.

Duas coisas decorrem disso. Primeira: qualquer estatística que pudéssemos publicar sobre, digamos, distribuição de local de nascimento se apoia em 716 pessoas — e essas 716 não são uma amostra aleatória, são aquelas cujos perfis estavam mais bem documentados, o que em geral significa as mais proeminentes. Segunda: um campo como tipo sanguíneo, a 23%, é magro demais para sustentar qualquer afirmação sobre a população, e preferimos dizer isso a fantasiar 547 registros como retrato de uma indústria.

O único campo forte, a lista de semelhantes a 89%, é forte justamente porque nós mesmos a calculamos a partir dos vetores, em vez de herdá-la de uma fonte.

O que o índice mede, se não é a indústria?

Ele mede exposição em sites agregadores, e a distinção não é acadêmica.

2,246 dos nossos 2,333 registros de identidade tiram sua imagem representativa de um único site. No conjunto inteiro, as imagens representativas vêm de apenas quatro servidores distintos. Dos 106 sites que indexamos, só cerca de 13 trazem códigos japoneses; o restante são em grande parte plataformas internacionais de tube e agregação.

Então, quando uma atriz está bem representada nos nossos dados, o achado é: as imagens dessa pessoa circulam bastante nos agregadores que indexamos. Esse é um sinal real e útil. Não é o mesmo que ser prolífica, popular no Japão ou comercialmente relevante, e não apresentamos o dado como nenhuma dessas coisas.

Isso também delimita o que nunca vamos afirmar. Não vamos dizer que um estúdio lançou N títulos — apenas que indexamos N. O índice não tem campo de data de lançamento, não tem campo de estúdio e não tem registro de títulos, então tendências de produção ano a ano, participação de mercado por estúdio e linhas do tempo de adoção de formato simplesmente não são calculáveis a partir dele, por mais convincente que um gráfico feito com ele pudesse parecer.

Dados e método

Fonte. O índice facial da starlikeness: vetores faciais e registros de identidade derivados de imagens de capa e quadros de vídeo em 106 sites.

Amostra. 241,792 vetores faciais; 2,333 registros de identidade (1,707 com perfil completo, 626 apenas com nome solto); 13,420 referências de semelhança.

Método. Detecção com YuNet; alinhamento a partir de cinco pontos faciais; codificação com ArcFace em vetores de 512 dimensões; recuperação por semelhança de cosseno com limiar de 0.40 para mesma pessoa. As porcentagens de cobertura são a contagem de registros com valor não vazio em um campo, dividida pela população completa de 2,333.

Data do retrato. 2026-08. Contagens recalculadas a partir do arquivo de dados vigente naquela data; a data de atualização visível nesta página reflete os dados, não uma reconstrução.

Viés conhecido.

  • Concentração de fontes. 2,246 de 2,333 imagens representativas vêm de um único site; quatro servidores respondem por todas elas. O que estiver ausente dessas fontes está ausente das nossas medições.
  • Viés de idioma e região. A maioria dos sites indexados é de agregadores internacionais, então as imagens que circulam internacionalmente ficam sobrerrepresentadas em relação ao material distribuído só no Japão.
  • Viés de documentação. As 1,707 pessoas nomeadas são, por construção, as mais bem documentadas. Estatísticas de cobertura calculadas sobre elas descrevem quem está bem documentado, não quem é típico.
  • Antecedente histórico. Alguns números de cobertura por campo publicados antes neste site estavam inflados porque cadeias de preenchimento eram contadas como valores. Elas foram removidas antes deste retrato; os números acima são os corrigidos, e são mais baixos do que os que divulgamos antes.

Citação.

starlikeness (2026). "Quanto da indústria a gente realmente consegue ver?"
Índice facial, retrato de 2026-08 (n=241,792 rostos; 2,333 registros de
identidade; 106 sites). https://starlikeness.com/pt-BR/articles/how-complete-is-our-index

Perguntas relacionadas


O teste prático de cobertura é uma busca. Envie um quadro e leia as pontuações: uma lista de resultados com pontuação baixa é o índice te dizendo que essa pessoa está fora do 1%. A detecção roda no seu navegador e a imagem original nunca sai do seu dispositivo.