Data kami berasal dari dua aliran yang bertemu di tengah. Vektor wajah dihitung dari gambar sampul dan still video yang diterbitkan di 106 situs publik. Metadata aktris — nama, terjemahan, bidang biografis — diurai dari halaman profil publik. Semua yang kami terbitkan diturunkan dari salah satu atau keduanya, dan ketika keduanya bertentangan atau sama-sama diam, yang kami punya adalah lubang, bukan jawaban.
Hal terpenting yang perlu diketahui tentang sumbernya adalah betapa sempitnya mereka. 2,246 dari 2,333 catatan identitas kami mengambil gambar representatifnya dari satu situs saja, dan di seluruh indeks hanya empat host berbeda yang memasok gambar representatif sama sekali.
Apa persisnya kedua aliran data itu?
Satu aliran kami hitung sendiri; yang lain kami warisi dari penerbitnya. Keduanya gagal dengan cara yang sama sekali berbeda.
| Vektor wajah | Metadata aktris | |
|---|---|---|
| Asal | Gambar yang diterbitkan di 106 situs terindeks | Halaman profil publik |
| Dihasilkan oleh | Pipeline kami sendiri (YuNet, ArcFace) | Penyunting pihak ketiga |
| Kelengkapan | Nyaris menyeluruh untuk gambar terindeks | 23%–89% menurut bidangnya |
| Cara gagalnya | Deteksi meleset; sudut buruk, terhalang, wajah kecil | Bidang dibiarkan kosong, untaian placeholder, nilai yang bertentangan |
| Bisakah kami memperbaikinya? | Bisa — indeks lebih banyak sumber | Hanya kalau ada sumber yang menerbitkannya |
Ketimpangan itu penting. Ketika data wajah tidak ada, itu karena kami tidak mengindeks gambarnya. Ketika metadata tidak ada, sejak awal memang tidak ada yang menuliskannya, dan tidak ada rekayasa sebanyak apa pun yang bisa memulihkannya.
Sumber mana yang mendominasi, dan seberapa parah?
Satu situs mendominasi hampir sepenuhnya, dan kami lebih memilih menerbitkan fakta itu daripada membiarkan "106 situs" mengesankan keluasan yang tidak kami punya.
| Host gambar representatif | Catatan identitas | Porsi |
|---|---|---|
| Sumber utama (jable) | 2,246 | 96.3% |
| Host kedua | 67 | 2.9% |
| Host ketiga | 14 | 0.6% |
| Host keempat | 6 | 0.3% |
Sumber: indeks kami, snapshot 2026-08, n=2,333 catatan identitas.
Angka 106 menggambarkan situs yang menyumbang ke indeks wajah — 241,792 vektor itu. Keempat host di atas menggambarkan dari mana gambar representatif tiap identitas berasal. Keduanya benar; hanya yang kedua yang memberi tahu Anda seberapa terpusat lapisan identitasnya.
Ada pemusatan kedua di atas yang pertama. Dari 106 situs terindeks, hanya sekitar 13 yang membawa ID konten Jepang. Sisanya sebagian besar platform tube dan agregator internasional. Karena itu pandangan kami atas video dewasa Jepang nyaris seluruhnya diperantarai oleh penerbitan ulang internasional.
Apa saja yang belum ada, bidang demi bidang?
Antara 11% dan 77% catatan, tergantung bidangnya. Berikut perhitungan selengkapnya, bukan cuplikan yang enak dipandang.
| Bidang | Ada | Tidak ada | Cakupan dari n=2,333 |
|---|---|---|---|
| Daftar aktris serupa | 2,070 | 263 | 89% |
| Ukuran cup | 1,375 | 958 | 59% |
| Tanggal debut | 1,371 | 962 | 59% |
| Tinggi badan | 1,340 | 993 | 57% |
| Ukuran badan | 1,316 | 1,017 | 56% |
| Tanggal lahir | 1,301 | 1,032 | 56% |
| Tempat lahir | 716 | 1,617 | 31% |
| Golongan darah | 547 | 1,786 | 23% |
Sumber: indeks kami, snapshot 2026-08, n=2,333 catatan identitas.
Tiga catatan yang kami anggap bagian dari datanya, bukan pengecualian terhadapnya:
- Yang hilang tidak acak. Catatan dengan metadata lengkap adalah aktris yang paling terdokumentasi, dan itu biasanya berarti yang paling menonjol. Statistik apa pun yang dihitung dari nilai-nilai yang ada menggambarkan aktris yang menonjol dan beredar secara internasional.
- 626 catatan hanya memuat nama dan tidak ada yang lain — tanpa satu pun bidang biografis. Semuanya ikut dihitung dalam penyebut di atas, dan itulah sebabnya setiap persentasenya lebih rendah daripada kalau kami diam-diam membuangnya.
- Sebagian angka terdahulu di situs ini terlalu tinggi. Untaian placeholder di data sumber ikut terhitung sebagai nilai sungguhan, yang menggelembungkan beberapa angka cakupan dan, lebih buruk lagi, ikut dikeluarkan ke data terstruktur di halaman aktris. Nilai-nilai itu sudah dihapus. Tabel di atas adalah perhitungan yang sudah dikoreksi dan angka-angka sebelumnya tidak boleh dikutip.
Apa yang tidak akan pernah bisa diberitahukan data ini?
Data ini tidak akan pernah bisa memberi tahu apa pun tentang judul, studio, atau volume rilis, karena ia memang tidak memuatnya.
Indeksnya menyimpan wajah, bukan karya. Tidak ada bidang tanggal rilis, tidak ada bidang studio atau label, dan tidak ada catatan judul. Itu menyingkirkan satu keluarga statistik yang mudah dikarang dan mustahil didukung: volume produksi tahunan, pangsa pasar studio, garis waktu adopsi format, pergeseran genre menurut tahun.
Hal itu juga membatasi bahasa yang kami pakai. Kami tidak pernah menulis bahwa sebuah studio merilis N judul. Kami menulis bahwa kami sudah mengindeks N — karena yang kami hitung adalah penerbitan ulang oleh agregator, dan jarak antara kedua pernyataan itu persis sama dengan jarak antara data kami dan industrinya.
Data dan metode
Sumber. Gambar sampul dan still video yang diterbitkan di 106 situs publik; halaman profil aktris publik untuk metadata; pengenal Wikidata bila ada pemetaan yang meyakinkan.
Sampel. 241,792 vektor wajah; 2,333 catatan identitas (1,707 dengan profil lengkap, 626 hanya untaian nama); 13,420 rujukan aktris serupa, yang 7,004 di antaranya menunjuk ke identitas tanpa nama.
Metode. Wajah dideteksi dengan YuNet, diselaraskan dari lima titik acuan, disandikan dengan ArcFace menjadi vektor berdimensi 512, ditarik lewat cosine similarity dengan ambang orang-yang-sama 0.40. Metadata diurai dari profil publik, divalidasi jenis dan formatnya, dan dibiarkan kosong ketika validasinya gagal alih-alih diisi pengganti. Daftar aktris serupa dihitung dari vektor, bukan diwarisi.
Tanggal snapshot. 2026-08.
Apa yang tidak disimpan. Berkas video. Unggahan asli pengguna — deteksi berjalan di peramban pengunjung, hanya area wajah yang dipangkas beserta lima titik acuannya yang dikirim untuk pencocokan, dan hasil kueri tidak disimpan. Indeksnya dibangun dari materi yang sudah diterbitkan, tidak pernah dari apa yang dicari orang.
Bias yang diketahui.
- Pemusatan sumber yang ekstrem. 96.3% gambar representatif berasal dari satu host; empat host mencakup seluruhnya.
- Perantaraan agregator. Hanya sekitar 13 dari 106 situs terindeks yang membawa ID konten Jepang, jadi materi yang kami lihat adalah yang beredar secara internasional.
- Kemiringan dokumentasi. Metadata yang ada terlalu banyak mewakili aktris yang menonjol.
- Konsekuensinya. Angka-angka ini mengukur keterpaparan di situs yang kami indeks, bukan volume rilis atau komposisi industri. Perlakukan setiap angka di sini sebagai pernyataan tentang sumber kami lebih dulu, dan tentang industrinya hanya lewat penyimpulan.
Sitasi.
starlikeness (2026). "Where Our Data Comes From, and What's Missing."
Face index, 2026-08 snapshot (n=241,792 faces; 2,333 identity records;
106 sites; 4 representative-image hosts).
https://starlikeness.com/id/articles/where-our-data-comes-from
Pertanyaan terkait
- Seberapa banyak industri ini yang sebenarnya bisa kami lihat?
- Indeks kami berisi 589 orang tanpa nama
- Apa arti skor kemiripan 0.40?
- Cara kerja pencarian wajah, langkah demi langkah
- Kenapa penelusuran gambar terbalik Google tidak berhasil untuk video dewasa
Semua di atas menggambarkan indeksnya, bukan Anda: deteksi wajah berjalan di peramban Anda, hanya area wajah yang dipangkas yang dikirim untuk pencocokan, dan tidak ada apa pun tentang pencarian Anda yang ditulis balik ke data ini.