Trong dữ liệu diễn viên tương tự của chúng tôi có 7,004 tham chiếu trỏ tới những danh tính không gắn tên nào. Đó là 52% trong tổng số 13,420 tham chiếu của các danh sách ấy — hơn một nửa số con trỏ kiểu "ai trông giống người này" mà chúng tôi có đều dẫn tới một người mà hồ sơ công khai chưa bao giờ gọi tên (chỉ mục của chúng tôi, ảnh chụp 2026-08).

Đây là con số trung thực nhất chúng tôi có thể công bố về chính dữ liệu của mình, và cũng là con số hữu ích nhất, vì nó lượng hóa được một thứ mà công cụ tìm theo khuôn mặt nào cũng có nhưng không công cụ nào cho bạn thấy: khoảng cách giữa những khuôn mặt tồn tạinhững khuôn mặt có ai đó chịu khó nhận diện.

Con số 7,004 chính xác là đếm cái gì?

7,004 đếm tham chiếu, không phải người. Nói cho chính xác chuyện đó chính là mục đích của bài này.

Mỗi bản ghi danh tính trong chỉ mục của chúng tôi có kèm một danh sách ngắn các hàng xóm gần nhất trong không gian vector — những khuôn mặt mà mô hình cho là giống nhất. Một số mục trong các danh sách đó quy về một trang hồ sơ diễn viên có tên. Số còn lại quy về một danh tính chỉ tồn tại dưới dạng một khóa nội bộ, một ảnh đại diện và một vector.

Đại lượng Giá trị Nó là gì
Tổng số tham chiếu diễn viên tương tự 13,420 Mọi mục trong toàn bộ các danh sách hàng xóm
Tham chiếu tới một hồ sơ có tên 6,416 48% tổng số
Tham chiếu tới một danh tính không tên 7,004 52% tổng số
Số danh tính không tên khác nhau được trỏ tới 589 Những người đứng sau 7,004 con trỏ kia
Diễn viên có ít nhất một hàng xóm không tên 1,899 Trên 2,070 bản ghi có danh sách hàng xóm
Bản ghi danh tính trong chỉ mục 2,333 Trong đó 1,707 có hồ sơ tên tra được

Nguồn: chỉ mục của chúng tôi, ảnh chụp 2026-08, n=2,333 bản ghi danh tính.

Vậy là: 7,004 con trỏ, 589 người. Trung bình mỗi danh tính không tên là hàng xóm gần của ai đó chừng mười hai lần. Nếu chỉ đọc con số ở tiêu đề, bạn sẽ thổi phồng vấn đề lên khoảng mười hai lần — và đó là lý do chúng tôi đặt bảng phân tách ngay bên cạnh nó.

Vì sao có những khuôn mặt vào chỉ mục mà không có tên?

Vì khuôn mặt và cái tên đi vào bằng hai đường ống khác nhau, và chỉ một trong hai là đáng tin.

Một khuôn mặt vào chỉ mục mỗi khi bộ nhận diện tìm thấy nó trong một tấm ảnh đã lập chỉ mục. Việc đó mang tính máy móc và gần như đầy đủ. Còn một cái tên chỉ vào được khi có trang công khai nào đó nêu nó ra dưới dạng chúng tôi phân tích và liên kết được. Việc đó mang tính biên tập, mỗi trang một kiểu, và rất thường là không có gì cả.

Những nguyên nhân thường gặp, xếp đại khái theo mức độ hay gặp:

  • Trang nguồn chẳng ghi công diễn viên nào — rất phổ biến ở các trang tổng hợp, vốn đăng lại nội dung sau khi đã lột sạch metadata.
  • Trang chỉ ghi tên bằng tiếng Nhật, ở dạng chưa bao giờ được ánh xạ sang một hồ sơ chuẩn. Trong 2,333 bản ghi danh tính của chúng tôi, 626 bản ghi chỉ tồn tại dưới dạng một chuỗi tên thô, không có hồ sơ liên kết và không có trường tiểu sử nào.
  • Diễn viên từng hoạt động dưới nhiều tên và không nguồn nào nối chúng lại.
  • Khuôn mặt thuộc về một người chỉ tình cờ có mặt trong sản phẩm và ngay từ đầu đã không phải diễn viên được ghi công.

Điều cuối cùng đáng nói thẳng: không phải khuôn mặt nào trong một chỉ mục phim người lớn cũng là diễn viên, và một chỉ mục mặc định điều ngược lại sẽ sai theo cái kiểu gây hậu quả thật.

Một hàng xóm không tên nói lên điều gì trong kết quả tìm kiếm?

Nó nói với bạn rằng sự giống nhau là có thật còn phần nhận diện thì đang thiếu — khác với một lần tìm kiếm thất bại, và cũng phổ biến hơn nhiều so với người dùng tưởng.

1,899 trong số 2,070 bản ghi có danh sách hàng xóm (92%) có ít nhất một danh tính không tên nằm trong nhóm hàng xóm gần nhất. Nếu bạn tìm theo khuôn mặt và nhận về một kết quả có điểm vượt ngưỡng nhưng không kèm tên, bạn không gặp lỗi phần mềm. Bạn đang chạm đúng vào hiện trạng của hồ sơ công khai.

Đây cũng là lý do chúng tôi không lọc các danh tính không tên ra khỏi kết quả. Chặn chúng lại sẽ cho ra một danh sách trông gọn gàng hơn nhưng lặng lẽ trình bày sai dữ liệu: nó biến "người này tồn tại nhưng chưa từng được ghi công" thành "ở đây chẳng có ai". Câu đầu là đúng, câu sau thì không.

Điều này ảnh hưởng thế nào tới các con số độ phủ?

Nó kéo chúng xuống, và chúng tôi công bố con số thấp hơn chứ không phải con số đẹp mặt.

Mọi tỷ lệ độ phủ chúng tôi công bố đều lấy toàn bộ 2,333 bản ghi danh tính làm mẫu số — kể cả 626 bản ghi chỉ có một chuỗi tên và không có gì khác.

Trường Số bản ghi có giá trị Độ phủ trên n=2,333
Danh sách diễn viên tương tự 2,070 89%
Cỡ cúp áo 1,375 59%
Ngày ra mắt 1,371 59%
Chiều cao 1,340 57%
Bộ số đo 1,316 56%
Ngày sinh 1,301 56%
Nơi sinh 716 31%
Nhóm máu 547 23%

Nguồn: chỉ mục của chúng tôi, ảnh chụp 2026-08, n=2,333.

Chúng tôi hoàn toàn có thể nâng từng con số này lên bằng cách lặng lẽ đổi mẫu số thành 1,707 bản ghi có hồ sơ thật. Nhóm máu sẽ nhảy từ 23% lên 32%, nơi sinh từ 31% lên 42%. Chúng tôi không làm thế, vì 626 bản ghi kia nằm trong chỉ mục và vẫn được trả về khi tìm kiếm, nên loại chúng khỏi phép tính là mô tả một cơ sở dữ liệu mà chúng tôi không hề vận hành.

Dữ liệu và phương pháp

Nguồn. Chỉ mục khuôn mặt starlikeness: các vector khuôn mặt và bản ghi danh tính rút ra từ ảnh bìa và ảnh chụp màn hình trên 106 trang.

Mẫu. 241,792 vector khuôn mặt; 2,333 bản ghi danh tính; 13,420 tham chiếu diễn viên tương tự trải trên 2,070 danh sách hàng xóm.

Phương pháp. Khuôn mặt được phát hiện bằng YuNet, căn chỉnh theo năm điểm mốc, mã hóa bằng ArcFace thành vector 512 chiều. Danh sách hàng xóm là những vector gần nhất theo độ tương đồng cosine, với ngưỡng cùng một người là 0.40. Một tham chiếu được xếp là "không tên" khi nó quy về một danh tính chỉ được đánh khóa bằng một mã băm nội bộ, không có hồ sơ diễn viên liên kết.

Ngày chụp dữ liệu. 2026-08. Toàn bộ số liệu được tính lại từ tệp dữ liệu đang chạy vào ngày đó.

Thiên lệch đã biết. Nguồn của chúng tôi tập trung rất cao. 2,246 trong số 2,333 ảnh đại diện đến từ một trang duy nhất, và trong 106 trang chúng tôi lập chỉ mục, chỉ khoảng 13 trang có mã nội dung Nhật Bản — số còn lại phần lớn là các trang tube và trang tổng hợp quốc tế. Vì vậy khoảng trống về tên mà chúng tôi đo được một phần là đặc tính trong thói quen ghi metadata của chính những nguồn ấy, chứ không phải của cả ngành. Thứ chỉ mục này đo là mức độ xuất hiện trên các trang tổng hợp, không phải sản lượng phát hành. Một diễn viên được ghi chép đầy đủ nhưng tác phẩm không có trong nguồn của chúng tôi thì ở đây sẽ hiện ra như vắng mặt, còn một bản đăng lại ghi công cẩu thả trên trang tổng hợp lại làm số lượng không tên phồng lên.

Những gì chúng tôi không tính được. Chỉ mục lưu khuôn mặt, không lưu tựa phim. Không có trường ngày phát hành, hãng phim hay số lượng tựa phim, nên không thể rút ra từ đó bất kỳ phát biểu nào về sản lượng sản xuất, thị phần của hãng phim, hay sản lượng năm sau so với năm trước.

Trích dẫn.

starlikeness (2026). "Our Index Contains 7,004 Faces With No Name."
Chỉ mục khuôn mặt, ảnh chụp 2026-08 (n=2,333 bản ghi danh tính; 13,420 tham
chiếu hàng xóm). https://starlikeness.com/vi/articles/faces-without-names

Câu hỏi liên quan


Nếu bạn muốn tận mắt thấy một danh tính không tên, hãy chạy một lần tìm theo khuôn mặt và để ý kết quả có điểm cao mà không có hồ sơ nào phía sau. Việc nhận diện diễn ra ngay trong trình duyệt của bạn; chỉ vùng khuôn mặt đã cắt được gửi đi để đối khớp.