В наших данных о похожих актрисах есть 7,004 ссылки на личности, к которым не привязано имя. Это 52% от всех 13,420 ссылок в этих списках — больше половины всех указателей «кто похож на этого человека», которыми мы располагаем, ведут к тому, кого опубликованные источники так и не назвали по имени (наш индекс, срез за 2026-08).
Это самое честное число, которое мы можем опубликовать о собственных данных, и одновременно самое полезное: оно измеряет то, что есть у любого инструмента поиска по лицу и чего не показывает ни один, — зазор между лицами, которые существуют, и лицами, которые кто-то потрудился опознать.
Что именно считает число 7,004?
7,004 считает ссылки, а не людей. Точность в этом и есть смысл всей статьи.
Каждая запись о личности в нашем индексе несёт короткий список ближайших соседей в векторном пространстве — тех лиц, которые модель считает наиболее похожими. Часть позиций в этих списках сводится к профилю актрисы с именем. Остальные — к личности, которая существует лишь как внутренний ключ, репрезентативное изображение и вектор.
| Величина | Значение | Что это |
|---|---|---|
| Всего ссылок на похожих актрис | 13,420 | Все позиции во всех списках соседей |
| Ссылок на именованный профиль | 6,416 | 48% от общего числа |
| Ссылок на безымянную личность | 7,004 | 52% от общего числа |
| Различных безымянных личностей | 589 | Люди, стоящие за этими 7,004 указателями |
| Актрис хотя бы с одним безымянным соседом | 1,899 | Из 2,070 записей, у которых есть список соседей |
| Записей о личностях в индексе | 2,333 | Из них 1,707 ведут на разрешимый именованный профиль |
Источник: наш индекс, срез за 2026-08, n=2,333 записи о личностях.
Итак: 7,004 указателя, 589 человек. Средняя безымянная личность оказывается чьим-то ближайшим соседом примерно двенадцать раз. Если читать только заголовочное число, масштаб проблемы завышается примерно в двенадцать раз — поэтому мы публикуем разбивку рядом с ним.
Почему лица попадают в индекс без имени?
Потому что лицо и имя приходят по разным каналам, и надёжен из них только один.
Лицо попадает в индекс всякий раз, когда детектор находит его на проиндексированном изображении. Это механика, и она почти полна. Имя появляется, только если какая-то опубликованная страница называет его в форме, которую мы можем разобрать и связать. Это редакторская работа: она непоследовательна от сайта к сайту и часто отсутствует вовсе.
Типичные причины, примерно в порядке того, как часто мы их видим:
- Страница-источник вообще не указывает актрису — это очень частый случай на агрегаторах, которые перепубликуют материал с вычищенными метаданными.
- Страница указывает имя только по-японски, в форме, которая так и не была сопоставлена с каноническим профилем. Из наших 2,333 записей о личностях 626 существуют как сырая строка с именем — без привязанного профиля и без единого биографического поля.
- Актриса работала под несколькими именами, и ни один источник их не связывает.
- Лицо принадлежит человеку, случайному для съёмки, который вообще никогда не был указан как актриса.
Последнее стоит сказать прямо: не всякое лицо в индексе взрослого видео принадлежит актрисе, и индекс, который считал бы иначе, ошибался бы в том, что имеет значение.
О чём говорит безымянный сосед в результатах поиска?
О том, что сходство настоящее, а опознания нет, — а это не то же самое, что неудачный поиск, и встречается куда чаще, чем думают пользователи.
У 1,899 из 2,070 записей со списком соседей (92%) среди ближайших соседей есть хотя бы одна безымянная личность. Если вы запустили поиск по лицу и получили результат с оценкой выше порога, но без имени, вы не наткнулись на баг. Вы наткнулись на фактическое состояние публичного учёта.
Поэтому же мы не отфильтровываем безымянные личности из результатов. Их подавление дало бы более чистый на вид список, который тихо искажает данные: «этот человек существует, но его нигде не указали» превратилось бы в «здесь никого нет». Первое утверждение верно, второе — нет.
Как это отражается на цифрах покрытия?
Тянет их вниз — и мы публикуем именно заниженные цифры, а не льстящие себе.
Каждый процент покрытия, который мы публикуем, берёт знаменателем полную совокупность из 2,333 записей о личностях — включая те 626, у которых есть строка с именем и больше ничего.
| Поле | Записей со значением | Покрытие от n=2,333 |
|---|---|---|
| Список похожих актрис | 2,070 | 89% |
| Размер груди | 1,375 | 59% |
| Дата дебюта | 1,371 | 59% |
| Рост | 1,340 | 57% |
| Параметры | 1,316 | 56% |
| Дата рождения | 1,301 | 56% |
| Место рождения | 716 | 31% |
| Группа крови | 547 | 23% |
Источник: наш индекс, срез за 2026-08, n=2,333.
Мы могли бы поднять каждое из этих чисел, тихо сменив знаменатель на 1,707 записей с настоящим профилем. Группа крови выросла бы с 23% до 32%, место рождения — с 31% до 42%. Мы этого не делаем, потому что те 626 лежат в индексе и возвращаются в поиске, так что исключить их из подсчёта значило бы описывать базу, которой мы на самом деле не располагаем.
Данные и метод
Источник. Индекс лиц starlikeness: лицевые векторы и записи о личностях, полученные из обложек и кадров с 106 сайтов.
Выборка. 241,792 лицевых вектора; 2,333 записи о личностях; 13,420 ссылок на похожих актрис в 2,070 списках соседей.
Метод. Лица находятся детектором YuNet, выравниваются по пяти опорным точкам, кодируются ArcFace в векторы из 512 измерений. Списки соседей — это ближайшие векторы по косинусной близости при пороге совпадения 0.40. Ссылка классифицируется как «безымянная», когда она сводится к личности, ключом которой служит только внутренний хеш, без привязанного профиля актрисы.
Дата среза. 2026-08. Все подсчёты пересчитаны из рабочего файла данных на эту дату.
Известное смещение. Наши источники сильно сконцентрированы. 2,246 из 2,333 репрезентативных изображений приходят с одного сайта, а из 106 индексируемых нами сайтов лишь около 13 вообще содержат японские номера релизов — остальные это в основном международные тьюбы и агрегаторы. Значит, измеряемый нами провал в именовании отчасти свойство привычек к метаданным именно этих источников, а не индустрии в целом. Этот индекс измеряет представленность на агрегаторах, а не объём выпуска. Хорошо задокументированная актриса, чьих работ нет в наших источниках, выглядела бы здесь отсутствующей, а плохо подписанная заливка на агрегаторе раздувает счёт безымянных.
Что мы не можем вычислить. Индекс хранит лица, а не релизы. В нём нет полей даты выхода, студии или числа релизов, поэтому никакое утверждение об объёмах производства, доле студии на рынке или динамике выпуска по годам из него не выводится.
Цитирование.
starlikeness (2026). «В нашем индексе 7,004 лица без имени».
Индекс лиц, срез за 2026-08 (n=2,333 записи о личностях; 13,420 ссылок
на соседей). https://starlikeness.com/ru/articles/faces-without-names
Смежные вопросы
- Какую часть индустрии мы вообще видим?
- Откуда берутся наши данные и чего в них нет
- Что означает оценка сходства 0.40?
- Как работает поиск по лицу, шаг за шагом
Если хотите увидеть безымянную личность своими глазами, запустите поиск по лицу и следите за результатом с высокой оценкой, за которым нет профиля. Детекция происходит в вашем браузере; на сопоставление отправляется только вырезанная область лица.