類似度スコアとは、2つの顔ベクトル——512個の数値の並び2つ——のコサイン類似度のことで、0から1のあいだの値をとります。当インデックスでは、0.40を超えたところから、その組を同一人物とみなして扱います。パーセンテージでも、確信度でも、確率でもありません。これは角度です。

この数字が重要なのは、多くの顔検索ツールが説明しない事実があるからです。密ベクトル検索は、何も返さないということがありません。 求めた件数はそのまま返ってきます。探している人物がそもそもインデックスにいるかどうかとは無関係にです。答えと「たまたまいちばん近かった別人」とを分けているのは、スコアだけです。

スコアは実際に何を測っているのか?

コサイン類似度は、2つのベクトルの長さを無視して、そのあいだの角度を測ります。512次元のベクトルに変換された2つの顔は、そのベクトルがほぼ同じ方向を向いているときに「似ている」ことになります。

エンコーダ——ここではArcFace——は、同一人物の画像からは同じ方向を向くベクトルが、別人の画像からは離れた方向を向くベクトルが出るように学習させてあります。姿勢、照明、背景、髪型は、エンコーダが顔を見る前の検出とアライメントの段階でおおむね捨てられます。

だからこそ、スコアは見た目の印象どおりには動きません。あなたの目には似て見える2枚が低いスコアになることもありますし、まったく似て見えない2枚——照明も違えば年代も違い、髪型も違う——が高いスコアになることもあります。

それぞれのスコア帯はどう読めばいいのか?

スコアは判定ではなく帯として扱ってください。以下は、私たちが自分たちのデータで実際に使っている目安です。

スコア 読み方 どう扱うか
0.70以上 同一人物である可能性が非常に高い 一致とみなす。それでも出典ページは確認する
0.55〜0.70 おそらく同一人物 一致とするが、別の画像でも確かめる
0.40〜0.55 しきい値は超えているが弱い ありうる。悪い角度でも他人の空似でもこの値になる
0.25〜0.40 しきい値未満 似ているというだけで、同一人物ではない
0.25未満 いちばん近かったベクトル インデックスが何かを返さざるをえなかった、という以上のことは言っていない

読み違えられやすいのは0.40より下の行です。0.31という結果は「31%の可能性」ではありません。探している人物は手元になく、代わりに手元にあるものを見せている、とシステムが言っているだけです。

出典:当インデックス、2026-08時点。この帯は自分たちの結果を読むための実務上の目安であって、公表されたベンチマークではありません。

そもそもなぜしきい値が要るのか?

しきい値は連続的な距離をイエス/ノーの判断に変換するもので、そうした変換はすべて、一方の誤りをもう一方の誤りと引き換えにするからです。

しきい値を下げれば、難しい角度や強い圧縮のもとで撮られた本物の一致をより多く拾えますが、そのぶん無関係な顔も入ってきます。上げれば残る一致はきれいになりますが、横顔や低ビットレートの配信から取った本物の一致は、リストから完全に落ちます。

両方の誤りを消せる設定は存在しません。0.40がこの位置にあるのは、私たちの典型的なクエリが動画のフレームだからです。圧縮がかかり、動きでぶれ、正面を向いていることは少なく、たいてい小さく写っています。きれいなスタジオ写真で調整したしきい値はもっと高くなり、現実のクエリのほとんどを弾いてしまうでしょう。

同じ人物なのに写真によってスコアが違うのはなぜか?

エンコーダによる姿勢や照明の除去が完全ではなく、カメラからあなたのスクリーンショットに至るまでの劣化のひとつひとつがベクトルを動かすからです。

条件 スコアへの影響
正面、鮮明、照明が良い 最も高いスコア。エンコーダにとっての最良の条件
おおむね4分の3正面より横を向いている 大幅に低下。顔の一部がそもそも写っていない
動画の圧縮が強い、ビットレートが低い 低下。ブロックノイズが細かい顔の情報を壊す
画面のなかで顔が小さい 低下。エンコード以前に検出そのものが失敗することもある
遮蔽——手、髪、顔の前の物 ランドマークがずれ、アライメントが歪み、出てくるベクトルが間違ったものになる
2枚の画像のあいだに何年もの開きがある 中程度の低下。同一人物であるという信号は残るが弱まる
美容整形、大きな体重の変化 本物の一致がしきい値を下回ることがある
メイク、髪型、髪色 ほとんど影響しない。アライメントの切り出しでその大半が外れる

最後の行は驚かれ、その1つ上の行はがっかりされます。髪はほぼ無料ですが、変わった顔はそうではありません。

スコアを隠すツールを信用してはいけないのはなぜか?

スコアを隠すことは、一致と当てずっぽうの違いを隠すことであり、その違いこそが結果のすべてだからです。

スコアのない順位つきリストは、1位が0.85でも0.19でも見た目はまったく同じです。どちらも「これがいちばん近い一致です」として表示されます。意味があるのは片方だけです。顔をずらりと並べて数字を出さないツールは、いちばん情報量の多いフィールドを取り除いたことになります。しかもそれを、真偽にかかわらずシステムが必ず何かを出力すると分かっている場面でやっているのです。

誠実な顔検索の結果には3つのものが含まれます。スコア、それが照らし合わされているしきい値、そして自分の目で確かめられるように元画像へのリンクです。このうち1つでも欠けていれば、その答えを検証することはできません。

データと手法

出典。 starlikenessがインデックス化した106サイトのジャケット画像とスチルから算出した顔ベクトル。

サンプル。 インデックス内の顔ベクトル241,792件、名前が結びついた人物レコード2,333件(当インデックス、2026-08時点)。

手法。 YuNetで検出し、バウンディングボックスと5点のランドマークを得る。そのランドマークから正規化された姿勢へアライメントする。ArcFaceで512次元のベクトルにエンコードする。インデックス全体に対してコサイン類似度で検索する。0.40というしきい値は、このインデックスに対する動画フレームのクエリ向けに調整したものです。

スナップショット日。 2026-08。

既知の偏り。 カバー範囲は大きく偏っています。名前つきの人物レコードのうち2,333件中2,246件は、代表画像を単一のサイトから取っており、インデックスにある106サイトのうち日本式のコンテンツIDを持つものはごく一部にすぎません。したがって私たちが測っているのは、アグリゲーターサイト上の露出であって、発売本数ではありません。インデックス化していないサイトにしか作品がない女優は見つかりませんし、そのことはどのスコアも教えてくれません——検索はそれでも、いちばん近い別人たちを並べて返してきます。

しきい値の限界。 0.40はこのエンコーダとこのインデックスに対する値です。別のツール、別のモデル、別の種類のクエリ画像には持ち越せません。あるスコアが同一人物である一定の確率を「意味する」という主張はすべて言いすぎです。同じ数字でも、クエリの品質によって重みが変わります。

引用。

starlikeness (2026). "What Does a Similarity Score of 0.40 Mean?"
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 named identities).
https://starlikeness.com/ja/articles/what-similarity-score-means

関連する疑問


しきい値が働くところは実際に見られます。フレームを1枚アップロードして、顔と並んだスコアを読んでみてください。検出はブラウザ内で走り、照合に送られるのは切り出した顔の領域だけで、元の画像が端末を離れることはありません。