Меньшую, чем можно предположить по громкой цифре. В нашем индексе 241,792 вектора лиц, но всего 2,333 записи об идентичности, и лишь 1,707 из них имеют разрешимый профиль с биографическими полями. Имя привязано примерно к 1% проиндексированных нами лиц (наш индекс, срез 2026-08).
Это соотношение и есть честный ответ на вопрос «насколько полны ваши данные». Всё остальное в этой статье — попытка сказать точно, какой именно это 1% и почему оставшиеся 99% — не сбой системы, а свойство самого материала.
Что на самом деле считают заглавные цифры?
Каждая цифра считает нечто более узкое, чем кажется, поэтому вот они все с настоящими определениями.
| Показатель | Значение | Что считает | Чего не считает |
|---|---|---|---|
| Векторы лиц | 241,792 | Лица, обнаруженные в проиндексированных изображениях | Разных людей; один человек встречается многократно |
| Записи об идентичности | 2,333 | Кластеры, принятые за одного человека и подписанные | Всех в индексе; большинство лиц без подписи |
| Записи с полным профилем | 1,707 | Идентичности с каноническим slug и метаданными | 626 записей, где есть только строка с именем |
| Проиндексированных сайтов | 106 | Хосты, с которых мы собирали изображения | Сайты с японскими кодами — их около 13 |
| Ключевых страниц-посадок | 300 | Страницы запросов, построенные над индексом | Охват отраслевого словаря тегов |
| Локалей | 13 | Языки интерфейса и перевода имён | Источники; большинство источников англоязычные |
Источник: наш индекс, срез 2026-08.
Первая строка — то, на чём строится почти весь маркетинг поиска по лицу, и она же наименее содержательная. 241,792 — это мера того, сколько изображений мы обработали, а не того, скольких людей мы способны опознать.
Почему имя есть только у 1% индекса?
Потому что лица находятся механически, а имена поступают редакционно, и на индексируемых нами источниках этот редакционный поток тонкий.
Детектор находит каждое лицо в каждом обрабатываемом изображении. Имя привязывается только тогда, когда страница-источник указывает его в разбираемом и связываемом виде. На международных сайтах-агрегаторах, которые составляют основную массу наших 106 хостов, титры при перезаливе часто срезаются целиком.
Следствие видно внутри наших же данных о похожих актрисах: из 13,420 ссылок на соседей 7,004 (52%) указывают на идентичности без имени. Больше половины всех указателей «кто похож на этого человека» ведут туда, где публичная запись оставила пробел.
Насколько полны данные о тех, кого мы назвали по имени?
От 23% до 89% в зависимости от поля, и низкие цифры мы публикуем рядом с высокими.
| Поле | Записей со значением | Охват от n=2,333 |
|---|---|---|
| Список похожих актрис | 2,070 | 89% |
| Размер груди | 1,375 | 59% |
| Дата дебюта | 1,371 | 59% |
| Рост | 1,340 | 57% |
| Параметры фигуры | 1,316 | 56% |
| Дата рождения | 1,301 | 56% |
| Место рождения | 716 | 31% |
| Группа крови | 547 | 23% |
Источник: наш индекс, срез 2026-08, n=2,333 записи об идентичности.
Отсюда следуют две вещи. Во-первых, любая статистика, которую мы могли бы опубликовать, скажем, о распределении мест рождения, опирается на 716 человек — и эти 716 не случайная выборка, а те, чьи профили задокументированы лучше всех, то есть обычно самые заметные. Во-вторых, поле вроде группы крови с 23% слишком разрежено, чтобы вообще что-то утверждать о совокупности, и мы предпочтём это сказать, а не выдавать 547 записей за портрет индустрии.
Единственное сильное поле — списки похожих актрис с 89% — сильно ровно потому, что мы считаем его сами из векторов, а не наследуем из источника.
Что же измеряет индекс, если не индустрию?
Он измеряет присутствие на сайтах-агрегаторах, и различие тут не академическое.
У 2,246 из наших 2,333 записей об идентичности репрезентативное изображение взято с одного сайта. По всему набору репрезентативные изображения приходят всего с четырёх разных хостов. Из 106 индексируемых нами сайтов японские коды несут лишь около 13; остальные — в основном международные тьюб-площадки и агрегаторы.
Поэтому, когда актриса хорошо представлена в наших данных, вывод звучит так: изображения этого человека широко расходятся по агрегаторам, которые мы индексируем. Это реальный и полезный сигнал. Но это не то же самое, что быть плодовитой, популярной в Японии или коммерчески значимой, и мы не выдаём его ни за что из перечисленного.
Отсюда же понятно, чего мы никогда не будем утверждать. Мы не скажем, что студия выпустила N тайтлов, — только что мы проиндексировали N. В индексе нет поля даты релиза, нет поля студии и нет вообще записей о тайтлах, поэтому годовая динамика производства, доли студий на рынке и сроки перехода на новые форматы попросту из него не вычисляются, каким бы уверенным ни выглядел построенный по ним график.
Данные и метод
Источник. Индекс лиц starlikeness: векторы лиц и записи об идентичности, полученные из обложек и кадров видео со 106 сайтов.
Выборка. 241,792 вектора лиц; 2,333 записи об идентичности (1,707 с полным профилем, 626 только со строкой имени); 13,420 ссылок на похожих актрис.
Метод. Детекция через YuNet; выравнивание по пяти лицевым точкам; кодирование через ArcFace в векторы размерности 512; поиск по косинусной близости с порогом совпадения 0.40. Проценты охвата — это число записей с непустым значением поля, делённое на всю совокупность в 2,333.
Дата среза. 2026-08. Значения пересчитаны из рабочего файла данных на эту дату; видимая дата обновления на странице отражает данные, а не пересборку.
Известные смещения.
- Концентрация источников. 2,246 из 2,333 репрезентативных изображений приходят с одного сайта; на четыре хоста приходятся все они. Чего нет в этих источниках, того нет и в наших измерениях.
- Языковой и региональный перекос. Большинство проиндексированных сайтов — международные агрегаторы, поэтому изображения, расходящиеся по миру, представлены избыточно по сравнению с материалом, который распространяется только в Японии.
- Перекос документированности. Названные по имени 1,707 — это по построению наиболее задокументированные актрисы. Статистика охвата, посчитанная по ним, описывает хорошо задокументированных, а не типичных.
- Историческое наследие. Часть ранее опубликованных на этом сайте цифр охвата была завышена из-за того, что строки-заглушки считались значениями. Их убрали до этого среза; цифры выше — исправленные, и они ниже тех, о которых мы сообщали раньше.
Цитирование.
starlikeness (2026). "How Much of the Industry Can We Actually See?"
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites). https://starlikeness.com/ru/articles/how-complete-is-our-index
Похожие вопросы
- Откуда берутся наши данные и чего в них нет
- В нашем индексе 589 человек без имени
- Что означает балл сходства 0.40?
- Как работает поиск по лицу, шаг за шагом
- Как устроена индустрия японского видео для взрослых
Практическая проверка охвата — это поиск. Загрузите кадр и прочитайте баллы: список результатов с низкими баллами и есть сообщение индекса о том, что этот человек находится за пределами того самого 1%. Детекция выполняется в вашем браузере, а исходное изображение никогда не покидает ваше устройство.