Меньшую, чем можно предположить по громкой цифре. В нашем индексе 241,792 вектора лиц, но всего 2,333 записи об идентичности, и лишь 1,707 из них имеют разрешимый профиль с биографическими полями. Имя привязано примерно к 1% проиндексированных нами лиц (наш индекс, срез 2026-08).

Это соотношение и есть честный ответ на вопрос «насколько полны ваши данные». Всё остальное в этой статье — попытка сказать точно, какой именно это 1% и почему оставшиеся 99% — не сбой системы, а свойство самого материала.

Что на самом деле считают заглавные цифры?

Каждая цифра считает нечто более узкое, чем кажется, поэтому вот они все с настоящими определениями.

Показатель Значение Что считает Чего не считает
Векторы лиц 241,792 Лица, обнаруженные в проиндексированных изображениях Разных людей; один человек встречается многократно
Записи об идентичности 2,333 Кластеры, принятые за одного человека и подписанные Всех в индексе; большинство лиц без подписи
Записи с полным профилем 1,707 Идентичности с каноническим slug и метаданными 626 записей, где есть только строка с именем
Проиндексированных сайтов 106 Хосты, с которых мы собирали изображения Сайты с японскими кодами — их около 13
Ключевых страниц-посадок 300 Страницы запросов, построенные над индексом Охват отраслевого словаря тегов
Локалей 13 Языки интерфейса и перевода имён Источники; большинство источников англоязычные

Источник: наш индекс, срез 2026-08.

Первая строка — то, на чём строится почти весь маркетинг поиска по лицу, и она же наименее содержательная. 241,792 — это мера того, сколько изображений мы обработали, а не того, скольких людей мы способны опознать.

Почему имя есть только у 1% индекса?

Потому что лица находятся механически, а имена поступают редакционно, и на индексируемых нами источниках этот редакционный поток тонкий.

Детектор находит каждое лицо в каждом обрабатываемом изображении. Имя привязывается только тогда, когда страница-источник указывает его в разбираемом и связываемом виде. На международных сайтах-агрегаторах, которые составляют основную массу наших 106 хостов, титры при перезаливе часто срезаются целиком.

Следствие видно внутри наших же данных о похожих актрисах: из 13,420 ссылок на соседей 7,004 (52%) указывают на идентичности без имени. Больше половины всех указателей «кто похож на этого человека» ведут туда, где публичная запись оставила пробел.

Насколько полны данные о тех, кого мы назвали по имени?

От 23% до 89% в зависимости от поля, и низкие цифры мы публикуем рядом с высокими.

Поле Записей со значением Охват от n=2,333
Список похожих актрис 2,070 89%
Размер груди 1,375 59%
Дата дебюта 1,371 59%
Рост 1,340 57%
Параметры фигуры 1,316 56%
Дата рождения 1,301 56%
Место рождения 716 31%
Группа крови 547 23%

Источник: наш индекс, срез 2026-08, n=2,333 записи об идентичности.

Отсюда следуют две вещи. Во-первых, любая статистика, которую мы могли бы опубликовать, скажем, о распределении мест рождения, опирается на 716 человек — и эти 716 не случайная выборка, а те, чьи профили задокументированы лучше всех, то есть обычно самые заметные. Во-вторых, поле вроде группы крови с 23% слишком разрежено, чтобы вообще что-то утверждать о совокупности, и мы предпочтём это сказать, а не выдавать 547 записей за портрет индустрии.

Единственное сильное поле — списки похожих актрис с 89% — сильно ровно потому, что мы считаем его сами из векторов, а не наследуем из источника.

Что же измеряет индекс, если не индустрию?

Он измеряет присутствие на сайтах-агрегаторах, и различие тут не академическое.

У 2,246 из наших 2,333 записей об идентичности репрезентативное изображение взято с одного сайта. По всему набору репрезентативные изображения приходят всего с четырёх разных хостов. Из 106 индексируемых нами сайтов японские коды несут лишь около 13; остальные — в основном международные тьюб-площадки и агрегаторы.

Поэтому, когда актриса хорошо представлена в наших данных, вывод звучит так: изображения этого человека широко расходятся по агрегаторам, которые мы индексируем. Это реальный и полезный сигнал. Но это не то же самое, что быть плодовитой, популярной в Японии или коммерчески значимой, и мы не выдаём его ни за что из перечисленного.

Отсюда же понятно, чего мы никогда не будем утверждать. Мы не скажем, что студия выпустила N тайтлов, — только что мы проиндексировали N. В индексе нет поля даты релиза, нет поля студии и нет вообще записей о тайтлах, поэтому годовая динамика производства, доли студий на рынке и сроки перехода на новые форматы попросту из него не вычисляются, каким бы уверенным ни выглядел построенный по ним график.

Данные и метод

Источник. Индекс лиц starlikeness: векторы лиц и записи об идентичности, полученные из обложек и кадров видео со 106 сайтов.

Выборка. 241,792 вектора лиц; 2,333 записи об идентичности (1,707 с полным профилем, 626 только со строкой имени); 13,420 ссылок на похожих актрис.

Метод. Детекция через YuNet; выравнивание по пяти лицевым точкам; кодирование через ArcFace в векторы размерности 512; поиск по косинусной близости с порогом совпадения 0.40. Проценты охвата — это число записей с непустым значением поля, делённое на всю совокупность в 2,333.

Дата среза. 2026-08. Значения пересчитаны из рабочего файла данных на эту дату; видимая дата обновления на странице отражает данные, а не пересборку.

Известные смещения.

  • Концентрация источников. 2,246 из 2,333 репрезентативных изображений приходят с одного сайта; на четыре хоста приходятся все они. Чего нет в этих источниках, того нет и в наших измерениях.
  • Языковой и региональный перекос. Большинство проиндексированных сайтов — международные агрегаторы, поэтому изображения, расходящиеся по миру, представлены избыточно по сравнению с материалом, который распространяется только в Японии.
  • Перекос документированности. Названные по имени 1,707 — это по построению наиболее задокументированные актрисы. Статистика охвата, посчитанная по ним, описывает хорошо задокументированных, а не типичных.
  • Историческое наследие. Часть ранее опубликованных на этом сайте цифр охвата была завышена из-за того, что строки-заглушки считались значениями. Их убрали до этого среза; цифры выше — исправленные, и они ниже тех, о которых мы сообщали раньше.

Цитирование.

starlikeness (2026). "How Much of the Industry Can We Actually See?"
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites). https://starlikeness.com/ru/articles/how-complete-is-our-index

Похожие вопросы


Практическая проверка охвата — это поиск. Загрузите кадр и прочитайте баллы: список результатов с низкими баллами и есть сообщение индекса о том, что этот человек находится за пределами того самого 1%. Детекция выполняется в вашем браузере, а исходное изображение никогда не покидает ваше устройство.