Lebih sedikit daripada dugaan Anda kalau melihat angka utamanya. Indeks kami memuat 241,792 vektor wajah tetapi hanya 2,333 rekaman identitas, dan hanya 1,707 di antaranya yang punya profil terselesaikan dengan kolom biografis. Sekitar 1% wajah yang kami indeks terpaut pada sebuah nama (indeks kami, cuplikan 2026-08).
Rasio itulah jawaban jujur untuk "seberapa lengkap data Anda". Sisa artikel ini adalah upaya menyebut secara persis 1% yang mana, dan mengapa 99% sisanya bukan kegagalan sistem melainkan sifat bawaan materinya.
Apa yang sebenarnya dihitung angka-angka utama itu?
Setiap angka menghitung sesuatu yang lebih sempit daripada kesan yang ditimbulkannya, jadi berikut masing-masing dengan definisi sebenarnya.
| Angka | Nilai | Yang dihitungnya | Yang tidak dihitungnya |
|---|---|---|---|
| Vektor wajah | 241,792 | Wajah yang terdeteksi dalam gambar terindeks | Orang yang berbeda; satu orang muncul berkali-kali |
| Rekaman identitas | 2,333 | Klaster yang diperlakukan sebagai satu orang berlabel | Semua orang di dalam indeks; sebagian besar wajah tanpa label |
| Rekaman dengan profil lengkap | 1,707 | Identitas dengan slug kanonis dan metadata | 626 yang hanya memuat untaian nama mentah |
| Situs terindeks | 106 | Host yang citranya kami rayapi | Situs yang memuat kode konten Jepang — sekitar 13 |
| Halaman pendaratan kata kunci | 300 | Halaman kueri yang dibangun di atas indeks | Cakupan kosakata tag industri |
| Lokal | 13 | Bahasa antarmuka dan terjemahan nama | Sumber; sebagian besar sumber berbahasa Inggris |
Sumber: indeks kami, cuplikan 2026-08.
Baris pertama adalah tempat sebagian besar pemasaran pencarian wajah bermukim, dan justru itulah yang paling tidak bermakna. 241,792 adalah ukuran berapa banyak gambar yang kami proses, bukan berapa banyak orang yang bisa kami kenali.
Mengapa hanya 1% dari indeks yang punya nama?
Karena wajah ditemukan secara mekanis sedangkan nama dipasok secara redaksional, dan pasokan redaksional itu tipis di sumber-sumber yang kami indeks.
Detektor menemukan setiap wajah di setiap gambar yang kami proses. Sebuah nama hanya menempel kalau halaman sumbernya menyebutkannya dalam bentuk yang bisa diurai dan ditautkan. Di situs agregator internasional, yang merupakan mayoritas dari 106 host kami, kredit sering dihapus seluruhnya saat penerbitan ulang.
Akibatnya terlihat di dalam data aktris serupa milik kami sendiri: dari 13,420 rujukan tetangga, 7,004 (52%) menunjuk ke identitas tanpa nama. Lebih dari separuh penunjuk "siapa yang mirip orang ini" mengarah ke tempat yang dibiarkan kosong oleh catatan publik.
Seberapa lengkap data tentang orang-orang yang sudah kami beri nama?
Antara 23% dan 89% tergantung kolomnya, dan kami menerbitkan angka rendahnya berdampingan dengan yang tinggi.
| Kolom | Rekaman yang punya nilai | Cakupan dari n=2,333 |
|---|---|---|
| Daftar aktris serupa | 2,070 | 89% |
| Ukuran cup | 1,375 | 59% |
| Tanggal debut | 1,371 | 59% |
| Tinggi badan | 1,340 | 57% |
| Ukuran tubuh | 1,316 | 56% |
| Tanggal lahir | 1,301 | 56% |
| Tempat lahir | 716 | 31% |
| Golongan darah | 547 | 23% |
Sumber: indeks kami, cuplikan 2026-08, n=2,333 rekaman identitas.
Ada dua hal yang mengikuti. Pertama, statistik apa pun yang bisa kami terbitkan tentang, katakanlah, sebaran tempat lahir bertumpu pada 716 orang — dan 716 itu bukan sampel acak, melainkan mereka yang profilnya paling terdokumentasi, yang biasanya berarti yang paling menonjol. Kedua, kolom seperti golongan darah pada 23% terlalu tipis untuk menopang klaim tentang populasi, dan kami lebih memilih mengatakannya daripada mendandani 547 rekaman sebagai potret industri.
Satu-satunya kolom yang kuat, daftar aktris serupa pada 89%, kuat justru karena kami menghitungnya sendiri dari vektor alih-alih mewarisinya dari sumber.
Kalau bukan industri, lalu apa yang diukur indeks ini?
Yang diukurnya adalah keterpaparan di situs agregator, dan perbedaan itu bukan sekadar akademis.
2,246 dari 2,333 rekaman identitas kami mengambil citra representatifnya dari satu situs saja. Di seluruh himpunan itu, citra representatif hanya berasal dari empat host berbeda. Dari 106 situs yang kami indeks, hanya sekitar 13 yang memuat kode konten Jepang; sisanya sebagian besar platform tube dan agregator internasional.
Jadi ketika seorang aktris terwakili dengan baik dalam data kami, temuannya adalah: citra orang ini beredar luas di agregator yang kami indeks. Itu sinyal yang nyata dan berguna. Itu tidak sama dengan produktif, populer di Jepang, atau signifikan secara komersial, dan kami tidak menyajikannya sebagai salah satu dari itu.
Ini juga membatasi apa yang tidak akan pernah kami klaim. Kami tidak akan mengatakan sebuah studio merilis N judul — hanya bahwa kami sudah mengindeks N. Indeks ini tidak punya kolom tanggal rilis, tidak punya kolom studio, dan sama sekali tidak punya rekaman judul, jadi tren produksi antartahun, pangsa pasar studio, dan lini masa adopsi format sama sekali tidak bisa dihitung darinya, sepercaya diri apa pun tampilan grafik yang dibuat darinya.
Data dan metode
Sumber. Indeks wajah starlikeness: vektor wajah dan rekaman identitas yang diturunkan dari gambar sampul dan cuplikan video di 106 situs.
Sampel. 241,792 vektor wajah; 2,333 rekaman identitas (1,707 dengan profil lengkap, 626 hanya untaian nama); 13,420 rujukan aktris serupa.
Metode. Deteksi dengan YuNet; penyelarasan dari lima titik acuan wajah; pengodean dengan ArcFace menjadi vektor 512 dimensi; pengambilan dengan kemiripan kosinus memakai ambang orang-sama 0.40. Persentase cakupan adalah jumlah rekaman yang memuat nilai tidak kosong untuk sebuah kolom, dibagi populasi penuh 2,333.
Tanggal cuplikan. 2026-08. Hitungan dihitung ulang dari berkas data langsung pada tanggal itu; tanggal pembaruan yang tampak di halaman ini mencerminkan datanya, bukan pembangunan ulang.
Bias yang diketahui.
- Konsentrasi sumber. 2,246 dari 2,333 citra representatif berasal dari satu situs; empat host mencakup seluruhnya. Apa pun yang tidak ada di sumber-sumber itu tidak ada dalam pengukuran kami.
- Kemiringan bahasa dan wilayah. Sebagian besar situs terindeks adalah agregator internasional, jadi citra yang beredar secara internasional terwakili berlebih dibandingkan materi yang hanya diedarkan di Jepang.
- Kemiringan dokumentasi. Yang 1,707 bernama itu, secara konstruksi, adalah aktris yang paling terdokumentasi. Statistik cakupan yang dihitung atas mereka menggambarkan yang terdokumentasi baik, bukan yang tipikal.
- Riwayat sebelumnya. Sebagian angka cakupan kolom yang dulu diterbitkan di situs ini menggelembung karena untaian pengganti ikut dihitung sebagai nilai. Untaian itu sudah dihapus sebelum cuplikan ini; angka di atas adalah angka yang sudah dikoreksi, dan lebih rendah daripada yang kami laporkan sebelumnya.
Sitasi.
starlikeness (2026). "Seberapa Banyak dari Industri Ini yang Sebenarnya Bisa Kita Lihat?"
Indeks wajah, cuplikan 2026-08 (n=241,792 wajah; 2,333 rekaman identitas;
106 situs). https://starlikeness.com/id/articles/how-complete-is-our-index
Pertanyaan terkait
- Dari mana data kami berasal, dan apa yang hilang
- Indeks kami berisi 589 orang tanpa nama
- Apa arti skor kemiripan 0.40?
- Cara kerja pencarian wajah, langkah demi langkah
- Bagaimana industri video dewasa Jepang disusun
Uji cakupan yang paling praktis adalah pencarian. Unggah satu bingkai dan baca skornya: daftar hasil berskor rendah adalah cara indeks memberi tahu Anda bahwa orang ini berada di luar 1% itu. Deteksi berjalan di peramban Anda dan gambar aslinya tidak pernah meninggalkan perangkat Anda.