น้อยกว่าที่คุณจะเดาจากตัวเลขพาดหัว ดัชนีของเราเก็บ เวกเตอร์ใบหน้า 241,792 รายการ แต่มี ระเบียนตัวตนเพียง 2,333 รายการ และในจำนวนนั้นมีแค่ 1,707 รายการที่มีโปรไฟล์ซึ่งเปิดดูข้อมูลประวัติได้จริง พูดอีกอย่างคือ ใบหน้าที่เราทำดัชนีไว้ราว 1% เท่านั้นที่ผูกอยู่กับชื่อ (ดัชนีของเรา ข้อมูล ณ 2026-08)
อัตราส่วนนั้นคือคำตอบตรงไปตรงมาของคำถามว่า "ข้อมูลของคุณสมบูรณ์แค่ไหน" ส่วนที่เหลือทั้งหมดในบทความนี้คือความพยายามจะบอกให้ชัดว่า 1% ไหน และทำไมอีก 99% ถึงไม่ใช่ความล้มเหลวของระบบ แต่เป็นคุณสมบัติของตัววัตถุดิบเอง
ตัวเลขพาดหัวพวกนั้นนับอะไรกันแน่?
ตัวเลขแต่ละตัวนับสิ่งที่แคบกว่าที่ชื่อมันฟังดู ข้างล่างนี้จึงเป็นแต่ละตัวพร้อมนิยามจริงของมัน
| ตัวเลข | ค่า | มันนับอะไร | มันไม่ได้นับอะไร |
|---|---|---|---|
| เวกเตอร์ใบหน้า | 241,792 | ใบหน้าที่ตรวจพบในภาพที่ทำดัชนี | จำนวนคนที่ต่างกัน คนหนึ่งปรากฏหลายครั้ง |
| ระเบียนตัวตน | 2,333 | กลุ่มใบหน้าที่ถือว่าเป็นคนเดียวกันและมีป้ายชื่อ | ทุกคนในดัชนี ใบหน้าส่วนใหญ่ไม่มีป้ายชื่อ |
| ระเบียนที่มีโปรไฟล์ครบ | 1,707 | ตัวตนที่มี slug หลักและข้อมูลกำกับ | อีก 626 รายการที่มีแค่ชื่อเป็นข้อความดิบ |
| เว็บที่ทำดัชนี | 106 | โฮสต์ที่เราเก็บภาพมา | เว็บที่มีรหัสหนังญี่ปุ่นกำกับ ซึ่งมีราว 13 แห่ง |
| หน้าคำค้น | 300 | หน้าคิวรีที่สร้างทับดัชนี | ความครอบคลุมของคลังแท็กในอุตสาหกรรม |
| ภาษา | 13 | ภาษาของหน้าจอและการแปลชื่อ | แหล่งข้อมูล ซึ่งส่วนใหญ่เป็นภาษาอังกฤษ |
ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08
แถวแรกคือแถวที่การตลาดของบริการค้นหาใบหน้าส่วนใหญ่อาศัยอยู่ และมันคือแถวที่มีความหมายน้อยที่สุด 241,792 คือมาตรวัดว่า เราประมวลผลภาพไปกี่ภาพ ไม่ใช่ว่าเราระบุตัวคนได้กี่คน
ทำไมมีแค่ 1% ของดัชนีที่มีชื่อ?
เพราะใบหน้าถูกหาเจอด้วยเครื่อง แต่ชื่อถูกป้อนเข้ามาด้วยมือกองบรรณาธิการ และปริมาณจากฝั่งบรรณาธิการก็เบาบางบนแหล่งที่เราทำดัชนี
ตัวตรวจจับจะหาใบหน้าทุกใบในทุกภาพที่เราประมวลผล แต่ ชื่อ จะติดมาก็ต่อเมื่อหน้าต้นทางระบุมันไว้ในรูปแบบที่แยกวิเคราะห์และลิงก์ได้ บนเว็บรวบรวมระดับนานาชาติ ซึ่งเป็นส่วนใหญ่ของโฮสต์ 106 แห่งของเรา เครดิตมักถูกถอดออกทั้งหมดตอนเผยแพร่ซ้ำ
ผลที่ตามมาเห็นได้ในข้อมูลนักแสดงที่หน้าคล้ายกันของเราเอง คือจากการอ้างอิงเพื่อนบ้าน 13,420 รายการ มี 7,004 รายการ (52%) ที่ชี้ไปยังตัวตนที่ไม่มีชื่อ เกินครึ่งของตัวชี้ประเภท "ใครหน้าเหมือนคนนี้" พาไปยังจุดที่บันทึกสาธารณะเว้นว่างไว้
ข้อมูลของคนที่เราระบุชื่อได้แล้วสมบูรณ์แค่ไหน?
อยู่ระหว่าง 23% ถึง 89% แล้วแต่ฟิลด์ และเราเผยแพร่ตัวเลขที่ต่ำควบคู่ไปกับตัวที่สูง
| ฟิลด์ | ระเบียนที่มีค่า | ความครอบคลุมจาก n=2,333 |
|---|---|---|
| รายชื่อนักแสดงหน้าคล้าย | 2,070 | 89% |
| ขนาดคัพ | 1,375 | 59% |
| วันเดบิวต์ | 1,371 | 59% |
| ส่วนสูง | 1,340 | 57% |
| สัดส่วน | 1,316 | 56% |
| วันเกิด | 1,301 | 56% |
| ถิ่นเกิด | 716 | 31% |
| กรุ๊ปเลือด | 547 | 23% |
ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08, n=2,333 ระเบียนตัวตน
มีสองเรื่องที่ตามมา หนึ่ง สถิติใด ๆ ที่เราจะเผยแพร่ได้ เช่นเรื่องการกระจายตัวของถิ่นเกิด ตั้งอยู่บนคน 716 คน และ 716 คนนั้นไม่ใช่ตัวอย่างสุ่ม แต่เป็นคนที่โปรไฟล์ถูกบันทึกไว้ดีที่สุด ซึ่งมักหมายถึงคนที่โด่งดังที่สุด สอง ฟิลด์อย่างกรุ๊ปเลือดที่อยู่แค่ 23% เบาบางเกินกว่าจะรองรับข้อสรุประดับประชากรได้เลย และเรายอมพูดตรง ๆ ดีกว่าเอาระเบียน 547 รายการมาแต่งตัวเป็นภาพรวมของอุตสาหกรรม
ฟิลด์เดียวที่แข็งแรง คือรายชื่อนักแสดงหน้าคล้ายที่ 89% แข็งแรงก็เพราะเราคำนวณมันเองจากเวกเตอร์ ไม่ได้รับช่วงต่อมาจากแหล่งอื่น
ถ้าไม่ใช่อุตสาหกรรม แล้วดัชนีนี้วัดอะไร?
มันวัด การปรากฏตัวบนเว็บรวบรวม และความแตกต่างนี้ไม่ใช่เรื่องวิชาการเล่น ๆ
2,246 จาก 2,333 ระเบียนตัวตนของเราดึงภาพตัวแทนมาจากเว็บเดียว และเมื่อดูทั้งชุด ภาพตัวแทนทั้งหมดมาจากโฮสต์ต่างกันเพียงสี่แห่ง จากเว็บ 106 แห่งที่เราทำดัชนี มีราว 13 แห่งเท่านั้นที่มีรหัสหนังญี่ปุ่นกำกับไว้ ที่เหลือส่วนใหญ่เป็นเว็บ tube และเว็บรวบรวมระดับนานาชาติ
ดังนั้นเมื่อนักแสดงคนหนึ่งมีตัวตนหนาแน่นในข้อมูลของเรา สิ่งที่ค้นพบคือ ภาพของคนคนนี้หมุนเวียนอยู่ทั่วบนเว็บรวบรวมที่เราทำดัชนี นั่นเป็นสัญญาณที่จริงและมีประโยชน์ แต่มันไม่เท่ากับการมีผลงานเยอะ ดังในญี่ปุ่น หรือมีความสำคัญทางการค้า และเราก็ไม่ได้นำเสนอมันเป็นอย่างใดอย่างหนึ่งในนั้น
เรื่องนี้ยังขีดเส้นว่าเราจะไม่มีวันอ้างอะไรบ้าง เราจะไม่พูดว่าสตูดิโอปล่อยหนังออกมา N เรื่อง จะพูดได้แค่ว่าเราทำดัชนีไว้ N เรื่อง ดัชนีไม่มีฟิลด์วันวางจำหน่าย ไม่มีฟิลด์สตูดิโอ และไม่มีระเบียนของตัวหนังเลย ดังนั้นแนวโน้มการผลิตรายปี ส่วนแบ่งตลาดของสตูดิโอ และไทม์ไลน์การรับฟอร์แมตใหม่ จึงคำนวณจากมันไม่ได้เลย ไม่ว่ากราฟที่ทำจากมันจะดูน่าเชื่อถือแค่ไหนก็ตาม
ข้อมูลและวิธีการ
แหล่งข้อมูล ดัชนีใบหน้าของ starlikeness คือเวกเตอร์ใบหน้าและระเบียนตัวตนที่สกัดจากภาพปกและภาพนิ่งจากวิดีโอ ครอบคลุม 106 เว็บไซต์
ตัวอย่าง เวกเตอร์ใบหน้า 241,792 รายการ ระเบียนตัวตน 2,333 รายการ (1,707 รายการมีโปรไฟล์ครบ 626 รายการมีแค่ข้อความชื่อ) และการอ้างอิงนักแสดงหน้าคล้าย 13,420 รายการ
วิธีการ ตรวจจับด้วย YuNet จัดวางแนวภาพจากจุดสังเกตบนใบหน้าห้าจุด เข้ารหัสด้วย ArcFace เป็นเวกเตอร์ 512 มิติ และสืบค้นด้วยค่าความคล้ายโคไซน์โดยใช้เกณฑ์ 0.40 ว่าเป็นคนเดียวกัน ตัวเลขความครอบคลุมคือจำนวนระเบียนที่มีค่าไม่ว่างในฟิลด์นั้น หารด้วยประชากรทั้งหมด 2,333 รายการ
วันที่ของข้อมูล 2026-08 ตัวเลขทั้งหมดคำนวณใหม่จากไฟล์ข้อมูลจริง ณ วันนั้น วันที่อัปเดตที่แสดงบนหน้านี้สะท้อนตัวข้อมูล ไม่ใช่การสร้างหน้าใหม่
อคติที่ทราบอยู่แล้ว
- การกระจุกตัวของแหล่งข้อมูล ภาพตัวแทน 2,246 จาก 2,333 ภาพมาจากเว็บเดียว และโฮสต์สี่แห่งรวมกันเป็นที่มาของทั้งหมด อะไรที่ไม่มีอยู่ในแหล่งเหล่านั้นก็ไม่มีอยู่ในการวัดของเรา
- ความเอียงด้านภาษาและภูมิภาค เว็บที่เราทำดัชนีส่วนใหญ่เป็นเว็บรวบรวมระดับนานาชาติ ภาพที่หมุนเวียนในระดับนานาชาติจึงถูกนับเกินจริงเมื่อเทียบกับเนื้อหาที่เผยแพร่เฉพาะในญี่ปุ่น
- ความเอียงด้านการบันทึกข้อมูล คน 1,707 คนที่มีชื่อ คือคนที่มีการบันทึกข้อมูลดีที่สุดโดยตัวโครงสร้างเอง สถิติความครอบคลุมที่คำนวณจากพวกเขาจึงอธิบายคนที่ถูกบันทึกไว้ดี ไม่ใช่คนทั่วไป
- ประวัติที่ผ่านมา ตัวเลขความครอบคลุมบางฟิลด์ที่เคยเผยแพร่บนเว็บนี้เคยสูงเกินจริง เพราะข้อความสำรองถูกนับเป็นค่า ข้อความเหล่านั้นถูกลบออกก่อนทำข้อมูลชุดนี้ ตัวเลขข้างบนคือตัวเลขที่แก้ไขแล้ว และมันต่ำกว่าที่เราเคยรายงานไว้
การอ้างอิง
starlikeness (2026). "เรามองเห็นอุตสาหกรรมนี้ได้มากแค่ไหนจริง ๆ?"
ดัชนีใบหน้า ข้อมูล ณ 2026-08 (n=241,792 ใบหน้า; 2,333 ระเบียนตัวตน;
106 เว็บไซต์). https://starlikeness.com/th/articles/how-complete-is-our-index
คำถามที่เกี่ยวข้อง
- ข้อมูลของเรามาจากไหน และอะไรที่ยังขาดอยู่
- ดัชนีของเรามีคนที่ไม่มีชื่ออยู่ 589 คน
- คะแนนความคล้าย 0.40 หมายความว่าอะไร?
- การค้นหาด้วยใบหน้าทำงานอย่างไร ทีละขั้น
- โครงสร้างของอุตสาหกรรม JAV เป็นอย่างไร
บททดสอบความครอบคลุมที่ใช้ได้จริงคือการลองค้นหา อัปโหลดภาพนิ่งสักเฟรมแล้วอ่านคะแนน ถ้าผลลัพธ์คะแนนต่ำกันทั้งรายการ นั่นคือดัชนีกำลังบอกคุณว่าคนคนนี้อยู่นอก 1% การตรวจจับทำงานในเบราว์เซอร์ของคุณ และภาพต้นฉบับไม่เคยออกจากเครื่องคุณเลย