当サイトの「似ている女優」データの中には、名前の付いていない身元を指す参照が7,004件あります。それらのリストにある全13,420件の参照の52%にあたります。つまり「この人に似ているのは誰か」を指し示すポインタの半分以上が、公開された記録が一度も名前を与えなかった誰かへつながっている、ということです(当サイトの索引、2026-08時点のスナップショット)。
これは自分たちのデータについて公表できるいちばん正直な数字であり、同時にいちばん役に立つ数字でもあります。どの顔検索ツールも抱えていながら、どこも見せていないもの —— 存在する顔と誰かが同定する手間をかけた顔とのあいだの隔たり —— を数量化しているからです。
7,004という数字は、正確には何を数えているのか?
7,004が数えているのは人ではなく参照です。そこを厳密にすることが、この記事の目的です。
当サイトの索引にある身元レコードは、それぞれベクトル空間で最も近い隣人 —— モデルが最も似ていると判断した顔 —— の短いリストを持っています。そのリストの一部の項目は、名前の付いた女優プロフィールに行き着きます。残りは、内部用のキーと代表画像とベクトルとしてしか存在しない身元に行き着きます。
| 項目 | 値 | 中身 |
|---|---|---|
| 「似ている女優」の参照の総数 | 13,420 | すべての近傍リストにある全項目 |
| 名前付きプロフィールへの参照 | 6,416 | 全体の48% |
| 無名の身元への参照 | 7,004 | 全体の52% |
| 参照されている無名の身元の実数 | 589 | この7,004個のポインタの先にいる人たち |
| 無名の近傍を1つ以上持つ女優 | 1,899 | 近傍リストを持つ2,070レコードのうち |
| 索引にある身元レコード | 2,333 | うち1,707件は名前付きプロフィールに行き着く |
出典:当サイトの索引、2026-08時点のスナップショット、n=2,333件の身元レコード。
つまり、ポインタが7,004個で、人は589人。無名の身元は平均すると、およそ12回ずつ誰かの近傍になっている計算です。見出しの数字だけを読むと、問題の大きさをおよそ12倍に見積もることになります。だからこそ、内訳を並べて公表しています。
なぜ、名前のないまま索引に入る顔があるのか?
顔と名前は別々の経路でやってきて、そのうち信頼できるのは片方だけだからです。
顔は、索引に取り込んだ画像の中から検出器が見つけたときに入ります。これは機械的で、ほぼ漏れがありません。名前のほうは、どこかの公開ページが、こちらで解析して紐づけられる形で書いていたときにしか入りません。こちらは人手の編集作業で、サイトごとにばらつきがあり、まるごと存在しないことも頻繁にあります。
よくある原因を、目にする頻度のおおよその順に挙げます。
- 元のページに出演者のクレジットがまったくない —— メタデータを落としたまま素材を再掲載するまとめサイトでは、非常に多いパターンです。
- ページに名前が日本語でしか書かれておらず、正規のプロフィールに対応づけられないままの形になっている。当サイトの2,333件の身元レコードのうち、626件は生の名前の文字列だけが存在し、紐づいたプロフィールもプロフィール項目も一切ありません。
- その女優が複数の名前で活動していて、それらを結びつける情報源がどこにもない。
- その顔が制作に付随して写り込んだだけの人物のもので、そもそもクレジットされる出演者ではなかった。
最後の1つははっきり書いておく価値があります。AVの索引に入っている顔がすべて出演者だとはかぎりませんし、そう思い込んだ索引は、無視できない形で間違うことになります。
検索結果に無名の近傍が出てきたら、それは何を意味するのか?
似ているのは本当で、同定のほうが欠けている、ということです。これは検索の失敗とは別物であり、利用者が思っているよりずっとよくあることです。
近傍リストを持つ2,070レコードのうち1,899件(92%)が、最近傍のなかに無名の身元を少なくとも1つ含んでいます。顔検索を実行して、しきい値を超えるスコアなのに名前のない結果が返ってきたなら、それは不具合を踏んだのではありません。公開された記録の実際の状態を踏んだのです。
無名の身元を結果から除外していないのも、これが理由です。取り除けば見た目のきれいなリストにはなりますが、それはデータを黙って偽ることになります。「この人物は存在するが、クレジットされたことがない」を「ここには誰もいない」に変えてしまうからです。前者は真で、後者は偽です。
これは網羅率の数字にどう影響しているのか?
数字を押し下げます。そして当サイトは、見栄えのよいほうではなく低いほうの数字を公表しています。
公表している網羅率の百分率は、すべて2,333件の身元レコード全体を分母にしています。名前の文字列しか持たない626件も、そこに含めています。
| 項目 | 値のあるレコード | n=2,333に対する網羅率 |
|---|---|---|
| 「似ている女優」リスト | 2,070 | 89% |
| カップサイズ | 1,375 | 59% |
| デビュー日 | 1,371 | 59% |
| 身長 | 1,340 | 57% |
| スリーサイズ | 1,316 | 56% |
| 生年月日 | 1,301 | 56% |
| 出身地 | 716 | 31% |
| 血液型 | 547 | 23% |
出典:当サイトの索引、2026-08時点のスナップショット、n=2,333。
分母を、実際のプロフィールを持つ1,707件へこっそり差し替えれば、この数字はどれも上げられます。血液型は23%から32%へ、出身地は31%から42%へ上がります。そうしないのは、626件も索引の中にあり、検索結果として返っているからです。集計から外せば、実際には運営していないデータベースを説明することになってしまいます。
データと手法
出典。 starlikenessの顔索引。106サイトのパッケージ画像と場面写真から作った顔ベクトルと身元レコードです。
サンプル。 顔ベクトル241,792件、身元レコード2,333件、2,070件の近傍リストにまたがる「似ている女優」参照13,420件。
手法。 顔はYuNetで検出し、5つの特徴点で位置を揃え、ArcFaceで512次元のベクトルに符号化しています。近傍リストはコサイン類似度で最も近いベクトルを並べたもので、同一人物のしきい値0.40を条件としています。参照が、内部ハッシュだけをキーとし女優プロフィールに紐づかない身元に行き着く場合、その参照を「無名」と分類しています。
スナップショットの日付。 2026-08。すべての件数はその日の実データファイルから再計算しています。
既知の偏り。 情報源は強く偏っています。代表画像の2,333件中2,246件が単一のサイトから来ており、索引対象の106サイトのうち、日本の品番を持つコンテンツを扱っているのは13サイト程度にすぎません。残りはおおむね海外のチューブサイトやまとめサイトです。したがって、ここで測っている名前の欠落は、業界全体の性質というより、それらの情報源のメタデータの扱い方の性質でもあります。この索引が測っているのはまとめサイト上での露出であって、リリース本数ではありません。よく記録されている女優でも、その作品が当サイトの情報源に載っていなければ、ここでは存在しないものとして現れますし、クレジットの雑なまとめサイトのアップロードは無名の件数を押し上げます。
計算できないこと。 この索引が保持しているのは顔であって、作品ではありません。発売日、メーカー、作品数といった項目がないため、制作本数、メーカーのシェア、前年比の産出量について、ここから導ける言明は何もありません。
引用。
starlikeness (2026). "Our Index Contains 7,004 Faces With No Name."
Face index, 2026-08 snapshot (n=2,333 identity records; 13,420 neighbour
references). https://starlikeness.com/ja/articles/faces-without-names
関連する疑問
無名の身元を自分の目で見てみたいなら、顔検索を実行して、スコアは高いのにプロフィールが後ろにない結果を探してみてください。検出はブラウザ内で行われ、照合に送られるのは切り出した顔の領域だけです。