เฟรมที่ใช้ได้ต้องการอย่างเดียวเท่านั้น คือใบหน้าที่มองเห็นดวงตา จมูก และมุมปากครบทุกจุด และคมพอที่จะระบุตำแหน่งจุดเหล่านั้นได้แม่นยำ ส่วนสิ่งที่คนมักกังวลกัน ไม่ว่าจะเป็นแสง ฉากหลัง หรือความละเอียดของภาพโดยรวม สำคัญน้อยกว่านั้นมาก
เหตุผลเป็นเรื่องกลไกล้วน ๆ ระบบค้นหาด้วยใบหน้าจะตรวจจับจุดสังเกต 5 จุด ใช้จุดเหล่านั้นบิดใบหน้าให้เข้าท่ามาตรฐาน แล้วครอบตัดชิด ๆ ทิ้งส่วนที่เหลือไปทั้งหมด ถ้าจุดสังเกตมองเห็นและคมชัด เฟรมนั้นก็ใช้ได้ ถ้าไม่ คุณภาพของภาพสูงแค่ไหนก็กู้ไม่ขึ้น
อะไรทำให้เฟรมหนึ่งดีหรือแย่กันแน่?
ให้ตัดสินที่ใบหน้า ไม่ใช่ที่ภาพ
| ปัจจัย | ดี | ก้ำกึ่ง | ใช้ไม่ได้ |
|---|---|---|---|
| มุมของศีรษะ | หันเข้ากล้องจนถึงราว 30° | หันไป 30–45° | ด้านข้างเต็ม ๆ, ท้ายทอย |
| การบดบัง | เห็นใบหน้าครบทั้งหมด | ผมพาดปิดตาข้างหนึ่ง | มือ วัตถุ หรือเงาเข้มทับตาหรือปาก |
| ความคมชัด | อยู่นิ่งหรือเคลื่อนไหวช้า | เบลอเล็กน้อย | ภาพเบลอจนรายละเอียดใบหน้าเละ |
| ขนาดใบหน้าในเฟรม | ใบหน้ากินพื้นที่ภาพพอสมควร | ภาพระยะกลาง | ภาพมุมกว้าง ใบหน้ากว้างไม่กี่สิบพิกเซล |
| แสงที่ตกบนใบหน้า | สม่ำเสมอ จะสว่างหรือมืดก็ได้ | ด้านหนึ่งอยู่ในเงา | ภาพเงาดำ หรือสว่างจ้าจนรายละเอียดหาย |
| การบีบอัด | จับภาพตรงจากโปรแกรมเล่น | JPEG ที่บันทึกซ้ำ | ภาพหน้าจอของภาพหน้าจอ ร่องรอยบีบอัดหนัก |
| ฉากหลัง | ไม่เกี่ยว | ไม่เกี่ยว | ไม่เกี่ยว |
แถวสุดท้ายไม่ใช่มุก มันคือบรรทัดที่มีประโยชน์ที่สุดในตาราง คนจำนวนมากทิ้งเฟรมดี ๆ เพราะห้องมืดหรือรก ทั้งที่ขั้นตอนจัดตำแหน่งตัดห้องทิ้งไปทั้งห้องอยู่แล้ว ให้ตัดสินที่ใบหน้า
ขั้นตอนการจับภาพมีอะไรบ้าง?
- เลื่อนหาจังหวะที่นักแสดงหันหน้าเข้ากล้อง ฉากพูดคุย ฉากเปิดเรื่อง และช็อตปฏิกิริยามักเป็นแหล่งที่ได้ผลดีที่สุด เลื่อนไปข้างหน้าอีก 5 วินาทีไม่เสียอะไร แต่ฝืนใช้เฟรมแย่ ๆ เสียเยอะ
- กดหยุดให้สนิท เฟรมที่หยุดนิ่งจะคม ส่วนเฟรมที่จับระหว่างวิดีโอยังเล่นอยู่ โดยเฉพาะบนสตรีมที่กระตุก อาจได้เฟรมที่ถอดรหัสมาไม่ครบ
- ใช้ฟังก์ชันจับภาพหน้าจอของอุปกรณ์ ไม่ใช่เอากล้องมือถือไปถ่ายจอ บน macOS ใช้เครื่องมือจับภาพที่ติดมากับเครื่อง บน Windows ใช้ Snipping Tool หรือปุ่ม Print Screen ส่วนบนมือถือใช้การกดปุ่มพร้อมกัน
- จับภาพที่ความละเอียดจริง ถ้าโปรแกรมเล่นอยู่ในหน้าต่างเล็ก ให้ขยายเต็มหน้าต่างหรือเต็มจอก่อน รายละเอียดที่ไม่เคยถูกจับไว้ กู้คืนไม่ได้
- อย่าครอบตัดชิดใบหน้าไว้ล่วงหน้า ปล่อยเฟรมไว้อย่างที่จับมา หรือถ้าจะครอบก็เผื่อขอบไว้เยอะ ๆ ตัวจัดตำแหน่งต้องการพื้นที่รอบจุดสังเกต
- ถ้าเลือกได้ ให้บันทึกเป็น PNG PNG ไม่สูญเสียข้อมูล ส่วนการบันทึกซ้ำเป็น JPEG คุณภาพต่ำจะเพิ่มร่องรอยบีบอัดลงตรงจุดที่รายละเอียดละเอียดอ่อนของใบหน้าอยู่พอดี
- มองหาใบหน้าอื่นที่น่าลองด้วย ถ้าในฉากมีคนมากกว่าหนึ่งคน คุณก็มีโอกาสระบุตัวมากกว่าหนึ่งครั้ง
ทำไมภาพมุมด้านข้างถึงใช้ไม่ได้ ทั้งที่คนดูยังจำได้สบาย ๆ?
เพราะศีรษะที่หันไปบังจุดสังเกตที่ตัวจัดตำแหน่งต้องใช้ และตัวเข้ารหัสก็ถูกฝึกมาด้วยใบหน้าที่ไม่ได้หันไปไกลขนาดนั้นเป็นส่วนใหญ่
ในมุมด้านข้างจัด ๆ ตาข้างหนึ่งหายไปเลย และมุมปากข้างหนึ่งก็มักถูกบังไปด้วย ขั้นตอนจัดตำแหน่งจึงต้องประมาณตำแหน่งที่มันมองไม่เห็น การบิดภาพก็เลยผิด เวกเตอร์ที่ได้ออกมาคือคำบรรยายใบหน้าที่มั่นใจเต็มที่ ทั้งที่ใบหน้านั้นแทบไม่มีอยู่จริง ระบบยังคืนผลลัพธ์ให้อยู่ดี เพียงแต่เป็นผลลัพธ์ที่ผิด พร้อมคะแนนที่ดูแล้วรับได้
กฎที่ใช้ได้จริงคือ ถ้าคุณเห็นตาทั้งสองข้างชัด ก็เดินหน้าต่อ ถ้าเห็นแค่ข้างเดียว ให้ไปหาเฟรมอื่น
ถ้ามีหลายเฟรมให้เลือก ควรเลือกอันไหน?
เมื่อมีตัวเลือก ให้จัดลำดับตามว่าสัญญาณอัตลักษณ์เหลือรอดผ่านกระบวนการไปได้มากแค่ไหน
| ลำดับ | ประเภทของเฟรม | เหตุผล |
|---|---|---|
| 1 | โคลสอัป หันเข้ากล้อง หยุดนิ่ง แสงดี | จุดสังเกตแม่นยำที่สุด |
| 2 | ภาพระยะกลาง หันเข้ากล้อง คมชัด | พิกเซลน้อยลง แต่รูปทรงยังครบ |
| 3 | โคลสอัปในมุมเฉียงพอประมาณ | มุมทำให้ความแม่นยำลดลง แต่ยังพอกู้ได้ |
| 4 | ภาพปกหรือภาพนิ่งโปรโมต ถ้าหาได้ | มักเป็นวัสดุชุดเดียวกับที่ใช้สร้างดัชนีขึ้นมา |
| 5 | ภาพมุมกว้างหรือมุมเฉียงจัด | ทางเลือกสุดท้าย |
แถวที่ 4 น่ารู้ไว้ รายการในดัชนีสร้างขึ้นจากภาพปกและภาพนิ่ง ของเรามี ใบหน้า 241,792 ใบ ที่ดึงมาจากวัสดุแบบนั้นจาก 106 เว็บไซต์ (ดัชนีของเรา ข้อมูล ณ 2026-08) ถ้าคุณหาภาพปกมาได้แทนที่จะเป็นเฟรมจากวิดีโอ ก็เท่ากับคุณค้นด้วยวัสดุที่ใกล้เคียงกับการกระจายตัวของดัชนีเองมากกว่า และคะแนนก็มักสะท้อนเรื่องนั้น
จะรู้ได้อย่างไรว่าเฟรมนั้นดีพอ?
ให้อ่านที่คะแนน ไม่ใช่ที่ลำดับ ค่าความคล้าย cosine อยู่ในช่วง 0 ถึง 1 และเกณฑ์ที่เราปรับเทียบไว้สำหรับภาพนิ่งจากวิดีโอคือ 0.40
ถ้าผลลัพธ์ที่ดีที่สุดของคุณต่ำกว่าเกณฑ์อยู่มาก ให้สงสัยเฟรมเป็นอันดับแรก ก่อนจะไปสงสัยดัชนี การค้นด้วยเวกเตอร์จะคืนผู้สมัครที่ใกล้ที่สุดให้เสมอ ไม่ว่าคนที่ถูกต้องจะอยู่ในดัชนีหรือไม่ก็ตาม รายการที่มีแต่คะแนนต่ำจึงกำกวมระหว่าง "เฟรมไม่ดี" กับ "ไม่ได้อยู่ในดัชนี" การลองเฟรมที่สองของคนเดียวกันแก้ความกำกวมนั้นได้โดยไม่มีต้นทุน นั่นคือเหตุผลที่มันเป็นก้าวถัดไปเสมอ
ขอบเขตที่ควรพูดให้ชัด: ต่อให้เฟรมสมบูรณ์แบบ ก็หาคนที่เราไม่เคยจัดทำดัชนีไว้ไม่เจอ และแหล่งข้อมูลของเราก็กระจุกตัว — นักแสดงที่มีชื่อ 2,246 คนจากทั้งหมด 2,333 คน มีภาพตัวแทนมาจากเว็บไซต์เดียว ภาพหน้าจอที่ดีช่วยเพิ่มโอกาสให้คุณ แต่ไม่ได้สร้างความครอบคลุมขึ้นมาใหม่
คำถามที่เกี่ยวข้อง
- วิธีหาวิดีโอจากภาพหน้าจอเพียงภาพเดียว
- ระบบค้นหาด้วยใบหน้าทำงานอย่างไร ทีละขั้นตอน
- ทำไมถึงหาเรื่องที่ต้องการไม่เจอ?
- ความผิดพลาดที่คนมักทำเวลาตามหาต้นทางของคลิป
- อัปโหลดรูปเข้าเครื่องมือค้นหาปลอดภัยไหม?
เมื่อได้เฟรมที่เห็นตาทั้งสองข้างและไม่มีภาพเบลอจากการเคลื่อนไหวแล้ว อัปโหลดที่นี่ได้เลย การตรวจจับทำงานในเบราว์เซอร์ของคุณ คุณจึงรู้ทันทีว่าเจอใบหน้าหรือไม่ — และถ้าไม่เจอ ก็ไม่มีอะไรถูกส่งออกไปเลย