Наши данные приходят из двух потоков, которые сходятся посередине. Векторы лиц считаются по обложкам и кадрам видео, опубликованным на 106 открытых сайтах. Метаданные об актрисах — имена, варианты написания, биографические поля — разбираются со страниц публичных профилей. Всё, что мы публикуем, выведено из одного или обоих, и там, где они расходятся или молчат, у нас пробел, а не ответ.

Самое важное, что стоит знать об источниках, — насколько они узки. 2,246 из наших 2,333 записей об идентичности берут репрезентативное изображение с одного-единственного сайта, а по всему индексу репрезентативные изображения вообще дают лишь четыре разных хоста.

Что представляют собой эти два потока данных?

Один поток считаем мы сами, другой достаётся нам от публикаторов. Ломаются они совершенно по-разному.

Векторы лиц Метаданные об актрисах
Происхождение Изображения, опубликованные на 106 проиндексированных сайтах Страницы публичных профилей
Кто производит Наш собственный конвейер (YuNet, ArcFace) Сторонние редакторы
Полнота Почти полная для проиндексированных изображений 23%–89% в зависимости от поля
Как ломается Промахи детекции: неудачные ракурсы, перекрытия, мелкие лица Пустые поля, строки-заглушки, противоречивые значения
Можем ли улучшить? Да — проиндексировать больше источников Только если источник это опубликует

Асимметрия здесь важна. Когда нет данных о лице — это потому, что мы не проиндексировали изображение. Когда нет метаданных — их изначально никто не записал, и никакая инженерия их не восстановит.

Какие источники доминируют и насколько сильно?

Один сайт доминирует почти полностью, и мы предпочтём это опубликовать, чем позволить цифре «106 сайтов» намекать на широту, которой у нас нет.

Хост репрезентативных изображений Записей об идентичности Доля
Основной источник (jable) 2,246 96.3%
Второй хост 67 2.9%
Третий хост 14 0.6%
Четвёртый хост 6 0.3%

Источник: наш индекс, срез 2026-08, n=2,333 записи об идентичности.

Цифра 106 описывает сайты, вносящие вклад в индекс лиц — те самые 241,792 вектора. Четыре хоста выше описывают, откуда берётся репрезентативное изображение каждой идентичности. Верно и то и другое; но насколько сконцентрирован слой идентичностей, говорит только второе.

Поверх первой концентрации лежит вторая. Из 106 проиндексированных сайтов лишь около 13 несут японские идентификаторы контента. Остальные — по большей части международные тьюб-платформы и агрегаторы. Наш взгляд на японское взрослое видео поэтому почти целиком опосредован международной перепубликацией.

Чего не хватает, поле за полем?

От 11% до 77% записей, смотря какое поле. Ниже полный расклад, а не льстящая нам выборка.

Поле Есть Нет Охват от n=2,333
Список похожих актрис 2,070 263 89%
Размер чашки 1,375 958 59%
Дата дебюта 1,371 962 59%
Рост 1,340 993 57%
Мерки 1,316 1,017 56%
Дата рождения 1,301 1,032 56%
Место рождения 716 1,617 31%
Группа крови 547 1,786 23%

Источник: наш индекс, срез 2026-08, n=2,333 записи об идентичности.

Три замечания, которые мы считаем частью данных, а не оговорками к ним:

  • Пропуски не случайны. Записи с полными метаданными — это наиболее задокументированные актрисы, что обычно означает наиболее заметных. Любая статистика, посчитанная по имеющимся значениям, описывает заметных, расходящихся по миру актрис.
  • 626 записей содержат имя и больше ничего — ни одного биографического поля. Они посчитаны в знаменателе выше, поэтому все проценты ниже, чем были бы, если бы мы их тихо выкинули.
  • Часть более ранних цифр на этом сайте была завышена. Строки-заглушки в исходных данных считались настоящими значениями, что раздувало несколько показателей охвата и, что хуже, попадало в структурированные данные на страницах актрис. Эти значения убрали. Таблица выше — исправленный расклад, а прежние цифры цитировать не следует.

Чего эти данные не скажут никогда?

Они никогда не скажут ничего о тайтлах, студиях или объёмах выпуска, потому что не содержат их.

Индекс хранит лица, а не произведения. В нём нет поля даты выхода, нет поля студии или лейбла и нет записей о тайтлах. Это исключает целое семейство статистик, которые легко подделать и невозможно обосновать: годовые объёмы производства, доли студий на рынке, сроки перехода на новые форматы, сдвиги жанров по годам.

Это же ограничивает и наши формулировки. Мы никогда не пишем, что студия выпустила N тайтлов. Мы пишем, что мы проиндексировали N, — потому что считали мы перепубликацию на агрегаторах, и разрыв между этими двумя утверждениями и есть разрыв между нашими данными и индустрией.

Данные и метод

Источник. Обложки и кадры видео, опубликованные на 106 открытых сайтах; страницы публичных профилей для метаданных; идентификаторы Wikidata там, где сопоставление уверенное.

Выборка. 241,792 вектора лиц; 2,333 записи об идентичности (1,707 с полным профилем, 626 только со строкой имени); 13,420 ссылок на похожих актрис, из которых 7,004 указывают на безымянные идентичности.

Метод. Лица детектируются через YuNet, выравниваются по пяти опорным точкам, кодируются через ArcFace в векторы размерности 512 и ищутся по косинусной близости с порогом «тот же человек» 0.40. Метаданные разбираются с публичных профилей, проверяются на тип и формат и оставляются пустыми, когда проверка не проходит, а не подставляются. Списки похожих актрис считаются по векторам, а не наследуются.

Дата среза. 2026-08.

Что не хранится. Видеофайлы. Загруженные пользователями оригиналы — детекция идёт в браузере посетителя, на сопоставление передаётся только вырезанная область лица и её пять опорных точек, а результаты запросов не сохраняются. Индекс построен на опубликованном материале, никогда — на том, что люди ищут.

Известные смещения.

  • Крайняя концентрация источников. 96.3% репрезентативных изображений приходят с одного хоста; на четыре хоста приходятся все они.
  • Опосредование агрегаторами. Лишь около 13 из 106 проиндексированных сайтов несут японские идентификаторы контента, так что мы видим то, что расходится по миру.
  • Перекос документированности. Имеющиеся метаданные избыточно представляют заметных актрис.
  • Следствие. Эти цифры измеряют представленность на индексируемых нами сайтах, а не объём выпуска или состав индустрии. Считайте каждое число здесь утверждением в первую очередь о наших источниках и лишь по выводу — об индустрии.

Цитирование.

starlikeness (2026). "Where Our Data Comes From, and What's Missing."
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites; 4 representative-image hosts).
https://starlikeness.com/ru/articles/where-our-data-comes-from

Похожие вопросы


Всё сказанное выше описывает индекс, а не вас: детекция лица идёт в вашем браузере, на сопоставление уходит только вырезанная область лица, и ничего о вашем поиске в эти данные не записывается.