当サイトのデータは、途中で合流する2つの流れから来ています。顔の特徴ベクトルは、 106の公開サイトに掲載されたカバー画像と動画のキャプチャから計算しています。 女優のメタデータ(名前、各言語での表記、プロフィール項目)は、公開されているプロフィールページから解析しています。当サイトが出しているものはすべてこのどちらか、あるいは両方に由来し、2つが食い違ったり黙り込んだりする場所には、答えではなく空白があります。

情報源について何より知っておくべきなのは、その幅がどれほど狭いかです。人物レコード2,333件のうち2,246件が単一のサイトから代表画像を取っており、索引全体を見ても、代表画像を出しているホストは4つしかありません。

2つのデータの流れとは、正確には何か?

一方は当サイトが計算したもので、もう一方は公開元から受け継いだものです。壊れ方がまったく違います。

顔の特徴ベクトル 女優のメタデータ
出どころ 索引対象106サイトに掲載された画像 公開プロフィールページ
作っているのは 当サイトのパイプライン(YuNet、ArcFace) 第三者の編集者
充足度 索引済みの画像についてはほぼ完全 項目により23%〜89%
壊れ方 検出漏れ。角度が悪い、隠れている、顔が小さい 空欄、プレースホルダーの文字列、矛盾した値
改善できるか できる——情報源を増やせばよい 公開元が書かないかぎり不可能

この非対称は重要です。顔のデータが欠けているのは、当サイトがその画像を索引していないからです。メタデータが欠けている場合は、そもそも誰も書き残していないのであり、どれだけ手を尽くしても取り戻せません。

どの情報源が支配的で、その偏りはどれほどか?

1つのサイトがほぼ完全に支配しています。「106サイト」という数字が、実際にはない幅広さを思わせるくらいなら、この事実を出しておきます。

代表画像のホスト 人物レコード数 割合
主要な情報源(jable) 2,246 96.3%
2番目のホスト 67 2.9%
3番目のホスト 14 0.6%
4番目のホスト 6 0.3%

出典:当サイトの索引、2026-08 時点のスナップショット、n=2,333 人物レコード。

106という数字は、顔の索引——241,792件のベクトル——に寄与しているサイトの数です。上の4ホストは、それぞれの人物の代表画像がどこから来ているかを表します。どちらも事実ですが、人物の層がどれほど集中しているかを教えてくれるのは後者だけです。

集中は二重になっています。索引対象の106サイトのうち、日本の品番を持つものは 13前後しかありません。残りの多くは海外のチューブサイトやアグリゲーターです。つまり当サイトから見えるAVの姿は、ほぼすべて海外での再掲載を経由したものです。

項目ごとに、何が欠けているのか?

項目によって、レコードの11%から77%が欠けています。都合のよい一部ではなく、全体を出します。

項目 あり なし n=2,333 に対するカバー率
類似女優リスト 2,070 263 89%
カップサイズ 1,375 958 59%
デビュー日 1,371 962 59%
身長 1,340 993 57%
スリーサイズ 1,316 1,017 56%
生年月日 1,301 1,032 56%
出身地 716 1,617 31%
血液型 547 1,786 23%

出典:当サイトの索引、2026-08 時点のスナップショット、n=2,333 人物レコード。

これは注意書きではなくデータの一部だと考えている点が、3つあります。

  • 欠けているレコードは無作為ではありません。 メタデータが揃っているのは記録がよく残っている女優、つまりたいていは知名度の高い女優です。存在する値だけを使って計算した統計は、知名度が高く国際的に流通している女優について述べたものになります。
  • 626件は名前だけを持ち、それ以外は何もありません。 プロフィール項目が1つもないということです。上の表ではこれらも分母に数えており、だからこそすべての割合が、黙って除外した場合より低くなっています。
  • このサイトに以前載っていた数字のいくつかは高すぎました。 元データのプレースホルダー文字列が実際の値として数えられており、いくつかのカバー率が水増しされていました。さらに悪いことに、その値が女優ページの構造化データにも出力されていました。それらの値は削除しました。上の表が訂正後の集計であり、以前の数字は引用しないでください。

このデータでは決して分からないことは何か?

作品、メーカー、リリース本数については何も分かりません。そもそも含んでいないからです。

索引が保存しているのはであって、作品ではありません。発売日の項目も、メーカーやレーベルの項目も、作品名のレコードもありません。そのため、捏造するのは簡単で裏づけるのは不可能な統計が、まるごと除外されます。年間の制作本数、メーカーのシェア、フォーマット普及の推移、年ごとのジャンルの移り変わりといったものです。

このことは使う言葉も縛ります。当サイトは「あるメーカーがN本をリリースした」とは書きません。書くのは「N本を索引した」です。数えたのはアグリゲーターへの再掲載であり、この2つの文の差は、そのまま当サイトのデータと業界そのものとの差だからです。

データと手法

情報源。 106の公開サイトに掲載されたカバー画像と動画のキャプチャ。メタデータについては、公開されている女優のプロフィールページ。確度の高い対応づけができる場合は Wikidataの識別子。

サンプル。 顔の特徴ベクトル241,792件。人物レコード2,333件(プロフィールが揃っているもの1,707件、名前の文字列のみ626件)。類似女優の参照13,420件、うち 7,004件は名前のない人物を指しています。

手法。 YuNetで顔を検出し、5つの特徴点で位置合わせをしたうえで、ArcFaceにより 512次元のベクトルへ符号化。コサイン類似度で検索し、同一人物の閾値は0.40。メタデータは公開プロフィールから解析し、型と書式を検証したうえで、検証に通らない場合は代わりの値を入れず空のままにしています。類似女優のリストはベクトルから計算したもので、他所から受け継いだものではありません。

スナップショットの時点。 2026-08。

保存していないもの。 動画ファイル。ユーザーがアップロードした元画像——検出は閲覧者のブラウザ内で動き、照合のために送られるのは切り出した顔の領域と5つの特徴点だけで、検索結果は保持しません。索引は公開された素材から作っており、人々が検索した内容からは作っていません。

既知の偏り。

  • 情報源の極端な集中。 代表画像の96.3%が1つのホストに由来し、4つのホストで全体を占めます。
  • アグリゲーター経由という性質。 索引対象106サイトのうち日本の品番を持つのは 13前後にとどまるため、当サイトが見ているのは国際的に流通している素材です。
  • 記録の偏り。 存在するメタデータは、知名度の高い女優に偏っています。
  • 帰結。 これらの数字が測っているのは索引対象サイト上での露出であって、リリース本数や業界の構成ではありません。 ここにあるすべての数字は、まず情報源についての記述であり、業界については推論を通じてのみ当てはまるものとして扱ってください。

引用の書式。

starlikeness (2026)「このデータはどこから来ているのか、そして何が欠けているのか」
顔索引、2026-08 時点のスナップショット(n=241,792 顔、2,333 人物レコード、
106 サイト、代表画像ホスト4件)。
https://starlikeness.com/ja/articles/where-our-data-comes-from

関連する疑問


上に書いたことはすべて索引についての説明であって、あなたについてではありません。顔の検出はあなたのブラウザ内で動き、照合に送られるのは切り出した顔の領域だけで、あなたの検索について何かがこのデータに書き戻されることはありません。