ในข้อมูลนักแสดงหน้าคล้ายของเรามี การอ้างอิง 7,004 รายการที่ชี้ไปยังตัวตนซึ่งไม่มีชื่อกำกับ นั่นคือ 52% ของการอ้างอิงทั้งหมด 13,420 รายการในรายการเหล่านั้น แปลว่าตัวชี้ประเภท "ใครหน้าเหมือนคนนี้บ้าง" ที่เราถืออยู่ เกินครึ่งพาไปหาคนที่บันทึกสาธารณะไม่เคยตั้งชื่อให้ (ดัชนีของเรา ข้อมูล ณ 2026-08)
นี่คือตัวเลขที่ซื่อตรงที่สุดที่เราเผยแพร่เกี่ยวกับข้อมูลของเราเองได้ และมันก็เป็นตัวเลขที่มีประโยชน์ที่สุดด้วย เพราะมันวัดสิ่งที่เครื่องมือค้นหาใบหน้าทุกเจ้ามีแต่ไม่มีเจ้าไหนโชว์ให้ดู นั่นคือช่องว่างระหว่าง ใบหน้าที่มีอยู่จริง กับ ใบหน้าที่มีใครสักคนอุตส่าห์ระบุตัวตนให้
ตัวเลข 7,004 นับอะไรกันแน่?
7,004 นับ การอ้างอิง ไม่ใช่คน การพูดเรื่องนี้ให้แม่นยำคือแก่นของบทความนี้
ระเบียนตัวตนแต่ละอันในดัชนีของเราจะพกรายการสั้น ๆ ของเพื่อนบ้านที่ใกล้ที่สุดในปริภูมิเวกเตอร์ ซึ่งก็คือใบหน้าที่โมเดลมองว่าคล้ายที่สุด บางรายการในนั้นสาวไปถึงโปรไฟล์นักแสดงที่มีชื่อ ส่วนที่เหลือสาวไปถึงตัวตนที่มีอยู่ในรูปของคีย์ภายใน ภาพตัวแทน และเวกเตอร์ เท่านั้น
| ปริมาณ | ค่า | มันคืออะไร |
|---|---|---|
| การอ้างอิงนักแสดงหน้าคล้ายทั้งหมด | 13,420 | ทุกรายการในทุกรายการเพื่อนบ้าน |
| การอ้างอิงที่ชี้ไปยังโปรไฟล์ที่มีชื่อ | 6,416 | 48% ของทั้งหมด |
| การอ้างอิงที่ชี้ไปยังตัวตนไร้ชื่อ | 7,004 | 52% ของทั้งหมด |
| ตัวตนไร้ชื่อที่ถูกอ้างถึง นับแบบไม่ซ้ำ | 589 | คนที่อยู่เบื้องหลังตัวชี้ 7,004 อันนั้น |
| นักแสดงที่มีเพื่อนบ้านไร้ชื่ออย่างน้อยหนึ่งราย | 1,899 | จากระเบียน 2,070 อันที่มีรายการเพื่อนบ้าน |
| ระเบียนตัวตนในดัชนี | 2,333 | ในจำนวนนี้ 1,707 อันมีโปรไฟล์ที่มีชื่อและสาวถึงได้ |
ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08, n=2,333 ระเบียนตัวตน
สรุปคือ ตัวชี้ 7,004 อัน ต่อคน 589 คน ตัวตนไร้ชื่อหนึ่งตัวตนเป็นเพื่อนบ้านใกล้ชิดของใครสักคนโดยเฉลี่ยราวสิบสองครั้ง ถ้าคุณอ่านแค่ตัวเลขพาดหัว คุณจะประเมินปัญหาเกินจริงไปราวสิบสองเท่า นั่นแหละคือเหตุผลที่เราเอารายละเอียดมาวางไว้ข้าง ๆ มันด้วย
ทำไมใบหน้าถึงลงเอยอยู่ในดัชนีโดยไม่มีชื่อ?
เพราะใบหน้ากับชื่อเดินทางมาคนละสายพาน และมีแค่สายเดียวที่เชื่อถือได้
ใบหน้าเข้าสู่ดัชนีทุกครั้งที่ตัวตรวจจับเจอมันในภาพที่เราทำดัชนีไว้ ขั้นตอนนั้นเป็นกลไกล้วน ๆ และเกือบครบถ้วน ส่วนชื่อเข้ามาก็ต่อเมื่อมีหน้าเว็บที่เผยแพร่แล้วระบุมันไว้ในรูปแบบที่เราแยกวิเคราะห์และเชื่อมโยงได้ ขั้นตอนนั้นเป็นงานบรรณาธิการ ไม่สม่ำเสมอในแต่ละเว็บ และบ่อยครั้งก็ไม่มีเลย
สาเหตุที่พบบ่อย เรียงคร่าว ๆ ตามความถี่ที่เราเจอ
- หน้าต้นทางไม่ให้เครดิตนักแสดงเลย พบบ่อยมากในเว็บรวมข้อมูล ซึ่งเอาของมาลงซ้ำโดยถอดเมตาดาตาออกหมด
- หน้านั้นให้เครดิตชื่อไว้เป็นภาษาญี่ปุ่นอย่างเดียว ในรูปแบบที่ไม่เคยถูกจับคู่เข้ากับโปรไฟล์มาตรฐาน จากระเบียนตัวตน 2,333 อันของเรา มี 626 อันที่มีอยู่ในสภาพสตริงชื่อดิบ ๆ โดยไม่มีโปรไฟล์เชื่อมโยงและไม่มีข้อมูลประวัติใด ๆ เลย
- นักแสดงคนนั้นทำงานภายใต้หลายชื่อ และไม่มีแหล่งไหนเชื่อมชื่อเหล่านั้นเข้าด้วยกัน
- ใบหน้านั้นเป็นของคนที่บังเอิญอยู่ในงานผลิต และไม่เคยเป็นนักแสดงที่ได้เครดิตตั้งแต่แรก
ข้อสุดท้ายควรพูดตรง ๆ ว่าไม่ใช่ทุกใบหน้าในดัชนีหนังผู้ใหญ่จะเป็นนักแสดง และดัชนีที่เหมาเอาเองว่าใช่ก็จะผิดในแบบที่ส่งผลจริง
เพื่อนบ้านไร้ชื่อบอกอะไรคุณในผลการค้นหา?
มันบอกว่าความคล้ายนั้นเป็นเรื่องจริง แต่การระบุตัวตนหายไป ซึ่งคนละเรื่องกับการค้นหาที่ล้มเหลว และพบบ่อยกว่าที่ผู้ใช้คิดกันมาก
1,899 จากระเบียน 2,070 อัน ที่มีรายการเพื่อนบ้าน (92%) มีตัวตนไร้ชื่ออย่างน้อยหนึ่งรายอยู่ในเพื่อนบ้านที่ใกล้ที่สุด ถ้าคุณค้นหาด้วยใบหน้าแล้วได้ผลลัพธ์ที่คะแนนสูงกว่าเกณฑ์แต่ไม่มีชื่อ คุณไม่ได้เจอบั๊ก คุณเจอสภาพจริงของบันทึกสาธารณะต่างหาก
นี่คือเหตุผลที่เราไม่กรองตัวตนไร้ชื่อออกจากผลลัพธ์ด้วย การกดมันไว้จะได้รายการที่หน้าตาสะอาดกว่าแต่บิดเบือนข้อมูลอย่างเงียบ ๆ คือมันจะเปลี่ยน "คนนี้มีอยู่จริงแต่ไม่เคยได้เครดิต" ให้กลายเป็น "ตรงนี้ไม่มีใครเลย" ประโยคแรกเป็นความจริง ประโยคหลังไม่ใช่
เรื่องนี้ส่งผลต่อตัวเลขความครอบคลุมอย่างไร?
มันฉุดตัวเลขลง และเราก็รายงานตัวเลขที่ต่ำกว่านั้นแทนที่จะรายงานตัวเลขที่ฟังดูดี
ทุกเปอร์เซ็นต์ความครอบคลุมที่เราเผยแพร่ใช้ประชากรเต็มจำนวน 2,333 ระเบียนตัวตนเป็นตัวหาร รวมถึง 626 อันที่มีแค่สตริงชื่อและไม่มีอะไรอีก
| ข้อมูล | ระเบียนที่มีค่า | ความครอบคลุมของ n=2,333 |
|---|---|---|
| รายการนักแสดงหน้าคล้าย | 2,070 | 89% |
| ไซซ์คัพ | 1,375 | 59% |
| วันเดบิวต์ | 1,371 | 59% |
| ส่วนสูง | 1,340 | 57% |
| สัดส่วน | 1,316 | 56% |
| วันเกิด | 1,301 | 56% |
| บ้านเกิด | 716 | 31% |
| กรุ๊ปเลือด | 547 | 23% |
ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08, n=2,333
เราจะดันตัวเลขพวกนี้ให้สูงขึ้นทุกตัวก็ได้ แค่แอบเปลี่ยนตัวหารเป็น 1,707 ระเบียนที่มีโปรไฟล์จริง กรุ๊ปเลือดจะขยับจาก 23% เป็น 32% บ้านเกิดจาก 31% เป็น 42% แต่เราไม่ทำ เพราะ 626 อันนั้นอยู่ในดัชนีจริงและถูกส่งกลับมาในผลการค้นหาจริง การกันมันออกจากการนับจึงเท่ากับอธิบายฐานข้อมูลที่เราไม่ได้รันอยู่
ข้อมูลและวิธีการ
แหล่งข้อมูล ดัชนีใบหน้าของ starlikeness ประกอบด้วยเวกเตอร์ใบหน้าและระเบียนตัวตนที่สกัดจากภาพปกและภาพนิ่งจาก 106 เว็บไซต์
ตัวอย่าง เวกเตอร์ใบหน้า 241,792 ตัว ระเบียนตัวตน 2,333 อัน และการอ้างอิงนักแสดงหน้าคล้าย 13,420 รายการ กระจายอยู่ใน 2,070 รายการเพื่อนบ้าน
วิธีการ ตรวจจับใบหน้าด้วย YuNet จัดตำแหน่งจากจุดสังเกตห้าจุด แล้วเข้ารหัสด้วย ArcFace เป็นเวกเตอร์ 512 มิติ รายการเพื่อนบ้านคือเวกเตอร์ที่ใกล้ที่สุดตามค่าความคล้ายเชิงโคไซน์ ภายใต้เกณฑ์ 0.40 สำหรับการถือว่าเป็นคนเดียวกัน การอ้างอิงหนึ่งรายการจะถูกจัดว่า "ไร้ชื่อ" เมื่อมันสาวไปถึงตัวตนที่มีเพียงแฮชภายในเป็นคีย์ โดยไม่มีโปรไฟล์นักแสดงเชื่อมโยงอยู่
วันที่ของข้อมูล 2026-08 ตัวเลขทั้งหมดคำนวณใหม่จากไฟล์ข้อมูลจริงในวันนั้น
อคติที่ทราบอยู่ แหล่งข้อมูลของเรากระจุกตัวสูงมาก ภาพตัวแทน 2,246 จาก 2,333 ภาพ มาจากเว็บไซต์เดียว และจาก 106 เว็บไซต์ที่เราทำดัชนีไว้ มีเพียงราว 13 แห่งที่มีรหัสผลงานญี่ปุ่นอยู่เลย ที่เหลือส่วนใหญ่เป็นเว็บทูบและเว็บรวมข้อมูลระดับนานาชาติ ช่องว่างเรื่องชื่อที่เราวัดได้จึงเป็นคุณสมบัติของนิสัยการทำเมตาดาตาของ แหล่งเหล่านั้น อยู่ส่วนหนึ่ง ไม่ใช่ของทั้งวงการ สิ่งที่ดัชนีนี้วัดคือ การปรากฏตัวบนเว็บรวมข้อมูล ไม่ใช่ปริมาณผลงาน นักแสดงที่มีบันทึกครบถ้วนดีแต่ผลงานไม่ปรากฏในแหล่งของเราจะโผล่ที่นี่ในสภาพไม่มีตัวตน ส่วนไฟล์ที่อัปโหลดขึ้นเว็บรวมข้อมูลโดยให้เครดิตห่วย ๆ ก็ทำให้จำนวนคนไร้ชื่อพองขึ้น
สิ่งที่เราคำนวณไม่ได้ ดัชนีเก็บใบหน้า ไม่ได้เก็บผลงาน ไม่มีข้อมูลวันวางจำหน่าย สตูดิโอ หรือจำนวนเรื่อง จึงไม่มีข้อสรุปใดเกี่ยวกับปริมาณการผลิต ส่วนแบ่งตลาดของสตูดิโอ หรือผลผลิตเทียบปีต่อปี ที่สกัดออกมาจากมันได้
การอ้างอิง
starlikeness (2026). "ดัชนีของเรามีใบหน้าที่ไม่มีชื่ออยู่ 7,004 ใบ"
ดัชนีใบหน้า ข้อมูล ณ 2026-08 (n=2,333 ระเบียนตัวตน; การอ้างอิงเพื่อนบ้าน
13,420 รายการ) https://starlikeness.com/th/articles/faces-without-names
คำถามที่เกี่ยวข้อง
- เรามองเห็นวงการนี้ได้มากแค่ไหนกันแน่
- ข้อมูลของเรามาจากไหน และอะไรที่ยังขาด
- คะแนนความคล้าย 0.40 หมายความว่าอะไร
- การค้นหาด้วยใบหน้าทำงานอย่างไร ทีละขั้น
ถ้าอยากเห็นตัวตนไร้ชื่อด้วยตาตัวเอง ลองค้นหาด้วยใบหน้าแล้วสังเกตผลลัพธ์ที่คะแนนสูงแต่ไม่มีโปรไฟล์อยู่ข้างหลัง การตรวจจับเกิดขึ้นในเบราว์เซอร์ของคุณ และส่งออกไปจับคู่เฉพาะภาพใบหน้าส่วนที่ครอบไว้เท่านั้น