ข้อมูลของเรามาจากสองสายที่มาบรรจบกันตรงกลาง เวกเตอร์ใบหน้า คำนวณจากภาพปกและภาพนิ่งจากวิดีโอที่เผยแพร่อยู่บนเว็บสาธารณะ 106 แห่ง ส่วนเมตาดาตาของนักแสดง — ชื่อ คำแปล ข้อมูลประวัติ — ดึงมาจากหน้าโปรไฟล์สาธารณะ ทุกอย่างที่เราเผยแพร่ล้วนมาจากสายใดสายหนึ่งหรือทั้งสองสาย และตรงไหนที่สองสายขัดกันหรือเงียบไป เราก็มีช่องว่างแทนที่จะมีคำตอบ

สิ่งที่สำคัญที่สุดที่ควรรู้เกี่ยวกับแหล่งข้อมูลคือมันแคบแค่ไหน ระเบียนตัวตน 2,246 จาก 2,333 รายการของเราใช้ภาพตัวแทนจากเว็บเดียว และทั้งดัชนีมีโฮสต์ที่ต่างกันแค่สี่แห่งที่ป้อนภาพตัวแทนให้เลย

ข้อมูลสองสายนั้นคืออะไรกันแน่?

สายหนึ่งเราคำนวณเอง อีกสายหนึ่งรับมรดกมาจากผู้เผยแพร่ ทั้งสองสายพังคนละแบบโดยสิ้นเชิง

เวกเตอร์ใบหน้า เมตาดาตาของนักแสดง
ที่มา ภาพที่เผยแพร่บนเว็บ 106 แห่งในดัชนี หน้าโปรไฟล์สาธารณะ
ผลิตโดย ไปป์ไลน์ของเราเอง (YuNet, ArcFace) บรรณาธิการจากภายนอก
ความครบถ้วน เกือบสมบูรณ์สำหรับภาพที่อยู่ในดัชนี 23%–89% แล้วแต่ช่องข้อมูล
รูปแบบความล้มเหลว ตรวจจับไม่เจอ มุมแย่ มีสิ่งบัง ใบหน้าเล็ก ช่องเว้นว่าง ข้อความตัวยึดที่ไม่มีความหมาย ค่าที่ขัดแย้งกัน
เราปรับปรุงได้ไหม ได้ — ทำดัชนีแหล่งเพิ่ม ได้ก็ต่อเมื่อมีแหล่งไหนเผยแพร่มันออกมา

ความไม่สมมาตรนี้สำคัญ เวลาข้อมูลใบหน้าขาดหาย เป็นเพราะเราไม่ได้ทำดัชนีภาพนั้น แต่เวลาเมตาดาตาขาดหาย คือไม่มีใครจดมันไว้ตั้งแต่แรก และไม่มีวิศวกรรมปริมาณไหนกู้มันกลับมาได้

แหล่งไหนครองสัดส่วน และครองหนักแค่ไหน?

เว็บแห่งเดียวครองแทบทั้งหมด และเรายอมเผยแพร่ตัวเลขนั้นออกมา ดีกว่าปล่อยให้คำว่า "106 เว็บ" ทำให้เข้าใจว่าเรากว้างกว่าที่เป็นจริง

โฮสต์ของภาพตัวแทน ระเบียนตัวตน สัดส่วน
แหล่งหลัก (jable) 2,246 96.3%
โฮสต์อันดับสอง 67 2.9%
โฮสต์อันดับสาม 14 0.6%
โฮสต์อันดับสี่ 6 0.3%

ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08, n=2,333 ระเบียนตัวตน

ตัวเลข 106 อธิบายจำนวนเว็บที่ป้อนข้อมูลให้ดัชนีใบหน้า ซึ่งมี 241,792 เวกเตอร์ ส่วนโฮสต์สี่แห่งข้างบนอธิบายว่าภาพตัวแทนของแต่ละตัวตนมาจากไหน ทั้งสองอย่างจริงทั้งคู่ แต่มีแค่อย่างที่สองที่บอกคุณว่าชั้นข้อมูลตัวตนกระจุกตัวขนาดไหน

ยังมีการกระจุกตัวชั้นที่สองซ้อนอยู่บนชั้นแรกอีก จากเว็บ 106 แห่งในดัชนี มีเพียงราว 13 แห่งที่มีรหัสเนื้อหาแบบญี่ปุ่น ที่เหลือส่วนใหญ่เป็นแพลตฟอร์มทิวบ์และเว็บรวมข้อมูลระดับสากล มุมมองของเราต่อหนังผู้ใหญ่ญี่ปุ่นจึงถูกส่งผ่านการเผยแพร่ซ้ำในระดับสากลแทบทั้งหมด

อะไรที่ขาดไปบ้าง แยกเป็นรายช่องข้อมูล?

ขาดไประหว่าง 11% ถึง 77% ของระเบียน แล้วแต่ช่องข้อมูล ต่อไปนี้คือบัญชีฉบับเต็ม ไม่ใช่เฉพาะส่วนที่ดูดี

ช่องข้อมูล มี ขาด ความครอบคลุมของ n=2,333
รายชื่อนักแสดงที่คล้ายกัน 2,070 263 89%
ขนาดคัพ 1,375 958 59%
วันเดบิวต์ 1,371 962 59%
ส่วนสูง 1,340 993 57%
สัดส่วน 1,316 1,017 56%
วันเกิด 1,301 1,032 56%
สถานที่เกิด 716 1,617 31%
กรุ๊ปเลือด 547 1,786 23%

ที่มา: ดัชนีของเรา ข้อมูล ณ 2026-08, n=2,333 ระเบียนตัวตน

มีข้อสังเกตสามข้อที่เราถือว่าเป็นส่วนหนึ่งของข้อมูล ไม่ใช่คำแก้ตัวต่อท้าย

  • สิ่งที่ขาดหายไม่ได้สุ่มมา ระเบียนที่มีเมตาดาตาครบคือนักแสดงที่ถูกบันทึกไว้ดีที่สุด ซึ่งโดยทั่วไปหมายถึงคนที่ดังที่สุด สถิติใดก็ตามที่คำนวณจากค่าที่มีอยู่จึงเป็นการอธิบายนักแสดงที่ดังและถูกเผยแพร่ในระดับสากล
  • ระเบียน 626 รายการมีแค่ชื่อและไม่มีอย่างอื่นเลย ไม่มีข้อมูลประวัติสักช่อง ระเบียนเหล่านี้ถูกนับอยู่ในตัวหารข้างบนด้วย ซึ่งเป็นเหตุผลที่ทุกเปอร์เซ็นต์ต่ำกว่าที่จะเป็นถ้าเราเงียบ ๆ ตัดมันทิ้ง
  • ตัวเลขบางชุดที่เคยอยู่บนเว็บนี้สูงเกินจริง ข้อความตัวยึดในข้อมูลต้นทางถูกนับเป็นค่าจริง ซึ่งทำให้ตัวเลขความครอบคลุมหลายตัวพองขึ้น และที่แย่กว่านั้นคือมันถูกส่งออกไปอยู่ในข้อมูลโครงสร้างบนหน้านักแสดงด้วย ค่าเหล่านั้นถูกลบออกไปแล้ว ตารางข้างบนคือบัญชีที่แก้ไขแล้ว และไม่ควรอ้างอิงตัวเลขชุดก่อนหน้า

อะไรที่ข้อมูลชุดนี้ไม่มีวันบอกคุณได้?

มันไม่มีวันบอกอะไรคุณได้เลยเกี่ยวกับชื่อเรื่อง สตูดิโอ หรือปริมาณผลงานที่ออก เพราะมันไม่มีข้อมูลพวกนั้นอยู่

ดัชนีเก็บใบหน้า ไม่ได้เก็บผลงาน มันไม่มีช่องวันวางจำหน่าย ไม่มีช่องสตูดิโอหรือค่าย และไม่มีระเบียนชื่อเรื่อง นั่นตัดสถิติทั้งตระกูลที่ปลอมง่ายและสนับสนุนไม่ได้ออกไป ทั้งปริมาณการผลิตต่อปี ส่วนแบ่งตลาดของสตูดิโอ เส้นเวลาการรับเอาฟอร์แมตใหม่ และความเปลี่ยนแปลงของแนวหนังรายปี

มันยังกำหนดขอบเขตของถ้อยคำที่เราใช้ด้วย เราไม่เคยเขียนว่าสตูดิโอออกหนัง N เรื่อง เราเขียนว่าเราทำดัชนีไว้ N รายการ — เพราะสิ่งที่เรานับคือการเผยแพร่ซ้ำบนเว็บรวมข้อมูล และช่องว่างระหว่างสองประโยคนั้นคือช่องว่างระหว่างข้อมูลของเรากับตัวอุตสาหกรรมพอดี

ข้อมูลและวิธีการ

แหล่งข้อมูล ภาพปกและภาพนิ่งจากวิดีโอที่เผยแพร่บนเว็บสาธารณะ 106 แห่ง หน้าโปรไฟล์นักแสดงสาธารณะสำหรับเมตาดาตา และตัวระบุของ Wikidata ในกรณีที่จับคู่ได้อย่างมั่นใจ

กลุ่มตัวอย่าง เวกเตอร์ใบหน้า 241,792 ชุด ระเบียนตัวตน 2,333 รายการ (1,707 รายการมีโปรไฟล์ครบ อีก 626 รายการมีแค่ชื่อ) และการอ้างอิงนักแสดงที่คล้ายกัน 13,420 รายการ ซึ่งในจำนวนนี้ 7,004 รายการชี้ไปยังตัวตนที่ไม่มีชื่อ

วิธีการ ตรวจจับใบหน้าด้วย YuNet จัดตำแหน่งจากจุดสังเกตห้าจุด เข้ารหัสด้วย ArcFace เป็นเวกเตอร์ 512 มิติ และค้นคืนด้วย cosine similarity โดยใช้เส้นแบ่งว่าเป็นคนเดียวกันที่ 0.40 ส่วนเมตาดาตาดึงมาจากโปรไฟล์สาธารณะ ตรวจสอบชนิดและรูปแบบ แล้วปล่อยว่างไว้เมื่อตรวจไม่ผ่านแทนที่จะใส่ค่าอื่นแทน รายชื่อนักแสดงที่คล้ายกันคำนวณจากเวกเตอร์ ไม่ได้รับมาจากที่อื่น

วันที่ของข้อมูล 2026-08

สิ่งที่ไม่ได้เก็บ ไฟล์วิดีโอ และไฟล์ต้นฉบับที่ผู้ใช้อัปโหลด — การตรวจจับทำงานในเบราว์เซอร์ของผู้เข้าชม ส่งไปจับคู่เฉพาะส่วนใบหน้าที่ครอบตัดแล้วกับจุดสังเกตห้าจุดของมัน และไม่มีการเก็บผลการค้นหาไว้ ดัชนีสร้างจากสื่อที่เผยแพร่อยู่แล้ว ไม่เคยสร้างจากสิ่งที่คนค้นหา

อคติที่ทราบอยู่

  • การกระจุกตัวของแหล่งข้อมูลอย่างสุดขั้ว 96.3% ของภาพตัวแทนมาจากโฮสต์เดียว และโฮสต์สี่แห่งรวมกันคิดเป็นทั้งหมด
  • การถูกส่งผ่านเว็บรวมข้อมูล มีเพียงราว 13 จาก 106 เว็บในดัชนีที่มีรหัสเนื้อหาแบบญี่ปุ่น สิ่งที่เราเห็นจึงเป็นสิ่งที่หมุนเวียนอยู่ในระดับสากล
  • ความเอียงของการบันทึกข้อมูล เมตาดาตาที่มีอยู่ให้น้ำหนักกับนักแสดงที่ดังมากเกินสัดส่วน
  • ผลที่ตามมา ตัวเลขเหล่านี้วัดการปรากฏตัวบนเว็บที่เราทำดัชนีไว้ ไม่ได้วัดปริมาณผลงานที่ออกหรือองค์ประกอบของอุตสาหกรรม ให้อ่านทุกตัวเลขในนี้เป็นคำกล่าวเกี่ยวกับแหล่งข้อมูลของเราก่อน แล้วค่อยเป็นคำกล่าวเกี่ยวกับอุตสาหกรรมโดยการอนุมานเท่านั้น

การอ้างอิง

starlikeness (2026). "ข้อมูลของเรามาจากไหน และอะไรที่ยังขาด"
ดัชนีใบหน้า ข้อมูล ณ 2026-08 (n=241,792 ใบหน้า; 2,333 ระเบียนตัวตน;
106 เว็บ; โฮสต์ภาพตัวแทน 4 แห่ง).
https://starlikeness.com/th/articles/where-our-data-comes-from

คำถามที่เกี่ยวข้อง


ทุกอย่างข้างบนอธิบายตัวดัชนี ไม่ได้อธิบายตัวคุณ การตรวจจับใบหน้าทำงานในเบราว์เซอร์ของคุณ ส่งไปจับคู่เฉพาะส่วนใบหน้าที่ครอบตัดแล้ว และไม่มีอะไรเกี่ยวกับการค้นหาของคุณถูกเขียนกลับเข้าไปในข้อมูลชุดนี้