Dữ liệu của chúng tôi đến từ hai dòng gặp nhau ở giữa. Vector khuôn mặt được tính từ ảnh bìa và ảnh tĩnh video đăng trên 106 trang công khai. Siêu dữ liệu diễn viên — tên, các bản dịch tên, các trường tiểu sử — được bóc tách từ những trang hồ sơ công khai. Mọi thứ chúng tôi công bố đều rút ra từ một hoặc cả hai dòng đó, và ở chỗ chúng mâu thuẫn hoặc lặng thinh, thứ chúng tôi có là một khoảng trống chứ không phải một câu trả lời.
Điều quan trọng nhất cần biết về các nguồn là chúng hẹp đến mức nào. 2,246 trong số 2,333 bản ghi danh tính của chúng tôi lấy ảnh đại diện từ một trang duy nhất, và trên toàn bộ chỉ mục, chỉ có bốn máy chủ khác nhau là có cung cấp ảnh đại diện.
Hai dòng dữ liệu ấy chính xác là gì?
Một dòng do chúng tôi tự tính; dòng kia thừa hưởng từ các bên đã đăng tải. Chúng hỏng theo những cách hoàn toàn khác nhau.
| Vector khuôn mặt | Siêu dữ liệu diễn viên | |
|---|---|---|
| Nguồn gốc | Ảnh đăng trên 106 trang đã lập chỉ mục | Các trang hồ sơ công khai |
| Do ai tạo ra | Quy trình của chính chúng tôi (YuNet, ArcFace) | Biên tập viên bên thứ ba |
| Mức đầy đủ | Gần như trọn vẹn với những ảnh đã lập chỉ mục | 23%–89% tùy trường |
| Kiểu hỏng | Bước phát hiện bỏ sót; góc xấu, bị che, mặt quá nhỏ | Trường bỏ trống, chuỗi giữ chỗ, giá trị mâu thuẫn |
| Cải thiện được không? | Được — lập chỉ mục thêm nguồn | Chỉ khi có nguồn nào đó công bố nó |
Sự bất đối xứng này quan trọng. Khi dữ liệu khuôn mặt thiếu, đó là vì chúng tôi chưa lập chỉ mục tấm ảnh. Khi siêu dữ liệu thiếu, đó là vì ngay từ đầu chẳng ai ghi lại nó, và không lượng kỹ thuật nào lấy lại được.
Nguồn nào áp đảo, và áp đảo tới mức nào?
Một trang áp đảo gần như tuyệt đối, và chúng tôi thà công bố điều đó còn hơn để con số "106 trang" ngụ ý một bề rộng mà chúng tôi không có.
| Máy chủ chứa ảnh đại diện | Bản ghi danh tính | Tỷ lệ |
|---|---|---|
| Nguồn chính (jable) | 2,246 | 96.3% |
| Máy chủ thứ hai | 67 | 2.9% |
| Máy chủ thứ ba | 14 | 0.6% |
| Máy chủ thứ tư | 6 | 0.3% |
Nguồn: chỉ mục của chúng tôi, bản chụp 2026-08, n=2,333 bản ghi danh tính.
Con số 106 mô tả những trang đóng góp vào chỉ mục khuôn mặt — 241,792 vector. Bốn máy chủ ở trên mô tả nơi ảnh đại diện của từng danh tính đến từ đó. Cả hai đều đúng; chỉ con số thứ hai mới cho bạn biết lớp danh tính tập trung đến mức nào.
Trên nền tập trung đó còn có một tầng tập trung thứ hai. Trong 106 trang đã lập chỉ mục, chỉ khoảng 13 trang mang ID nội dung kiểu Nhật. Phần còn lại phần lớn là các nền tảng tube và trang tổng hợp quốc tế. Vì vậy cái nhìn của chúng tôi về phim người lớn Nhật Bản gần như hoàn toàn đi qua trung gian là việc đăng lại ở tầm quốc tế.
Thiếu những gì, xét theo từng trường?
Từ 11% đến 77% số bản ghi, tùy theo trường. Dưới đây là bảng tính đầy đủ chứ không phải cái tập con nghe cho đẹp.
| Trường | Có | Thiếu | Độ bao phủ trên n=2,333 |
|---|---|---|---|
| Danh sách diễn viên tương tự | 2,070 | 263 | 89% |
| Cỡ cúp | 1,375 | 958 | 59% |
| Ngày ra mắt | 1,371 | 962 | 59% |
| Chiều cao | 1,340 | 993 | 57% |
| Số đo ba vòng | 1,316 | 1,017 | 56% |
| Ngày sinh | 1,301 | 1,032 | 56% |
| Nơi sinh | 716 | 1,617 | 31% |
| Nhóm máu | 547 | 1,786 | 23% |
Nguồn: chỉ mục của chúng tôi, bản chụp 2026-08, n=2,333 bản ghi danh tính.
Ba ghi chú mà chúng tôi coi là một phần của dữ liệu, không phải lời rào đón quanh nó:
- Phần thiếu không phân bố ngẫu nhiên. Những bản ghi có đủ siêu dữ liệu thuộc về các diễn viên được ghi chép kỹ nhất, mà điều đó thường có nghĩa là nổi tiếng nhất. Mọi thống kê tính trên các giá trị hiện có đều mô tả những diễn viên nổi tiếng, được lưu truyền ở tầm quốc tế.
- 626 bản ghi chỉ có một cái tên và không gì khác — không một trường tiểu sử nào. Chúng vẫn được tính vào mẫu số ở trên, và đó là lý do mọi tỷ lệ phần trăm đều thấp hơn so với nếu chúng tôi lặng lẽ loại chúng ra.
- Một số con số công bố trước đây trên trang này là quá cao. Các chuỗi giữ chỗ trong dữ liệu nguồn đã bị đếm như giá trị thật, khiến vài con số bao phủ bị thổi phồng và, tệ hơn, đã bị đẩy vào dữ liệu có cấu trúc trên các trang diễn viên. Những giá trị đó đã bị gỡ bỏ. Bảng ở trên là bản tính đã sửa và các con số trước đó không nên được trích dẫn.
Dữ liệu này không bao giờ cho bạn biết điều gì?
Nó không bao giờ cho bạn biết bất cứ điều gì về tác phẩm, hãng phim hay sản lượng phát hành, bởi vì nó không chứa những thứ đó.
Chỉ mục lưu khuôn mặt, không lưu tác phẩm. Không có trường ngày phát hành, không có trường hãng phim hay nhãn, không có bản ghi tên tác phẩm. Điều đó loại trừ cả một họ thống kê vốn rất dễ bịa và không thể chứng minh: sản lượng sản xuất hằng năm, thị phần của các hãng phim, mốc thời gian áp dụng từng định dạng, sự dịch chuyển thể loại theo năm.
Nó cũng đặt giới hạn cho cách chúng tôi dùng chữ. Chúng tôi không bao giờ viết rằng một hãng phim đã phát hành N tác phẩm. Chúng tôi viết rằng chúng tôi đã lập chỉ mục N — vì thứ chúng tôi đếm là việc các trang tổng hợp đăng lại, và khoảng cách giữa hai câu ấy chính là khoảng cách giữa dữ liệu của chúng tôi và ngành này.
Dữ liệu và phương pháp
Nguồn. Ảnh bìa và ảnh tĩnh video đăng trên 106 trang công khai; các trang hồ sơ diễn viên công khai để lấy siêu dữ liệu; định danh Wikidata ở những chỗ có phép ánh xạ đủ chắc chắn.
Mẫu. 241,792 vector khuôn mặt; 2,333 bản ghi danh tính (1,707 bản có hồ sơ đầy đủ, 626 bản chỉ có chuỗi tên); 13,420 tham chiếu diễn viên tương tự, trong đó 7,004 trỏ tới những danh tính không tên.
Phương pháp. Khuôn mặt được phát hiện bằng YuNet, căn chỉnh từ năm điểm mốc, mã hóa bằng ArcFace thành vector 512 chiều, truy hồi bằng độ tương đồng cosine với ngưỡng cùng người là 0.40. Siêu dữ liệu được bóc tách từ hồ sơ công khai, kiểm tra kiểu và định dạng, và để trống khi không qua được khâu kiểm tra thay vì thay bằng giá trị khác. Danh sách diễn viên tương tự được tính từ vector, không phải thừa hưởng từ nguồn.
Ngày chụp dữ liệu. 2026-08.
Những gì không được lưu. Tệp video. Bản tải lên gốc của người dùng — bước phát hiện chạy trong trình duyệt của khách, chỉ vùng khuôn mặt đã cắt cùng năm điểm mốc của nó được truyền đi để so khớp, và kết quả truy vấn không được giữ lại. Chỉ mục được dựng từ tài liệu đã công bố, không bao giờ từ những gì người ta tìm kiếm.
Thiên lệch đã biết.
- Nguồn tập trung ở mức cực đoan. 96.3% ảnh đại diện đến từ một máy chủ; bốn máy chủ gộp lại là toàn bộ.
- Trung gian là các trang tổng hợp. Chỉ khoảng 13 trong 106 trang đã lập chỉ mục mang ID nội dung kiểu Nhật, nên thứ chúng tôi nhìn thấy là thứ lưu hành ở tầm quốc tế.
- Lệch theo mức độ được ghi chép. Siêu dữ liệu hiện có thiên về các diễn viên nổi tiếng.
- Hệ quả. Những con số này đo mức độ xuất hiện trên các trang chúng tôi lập chỉ mục, không đo sản lượng phát hành hay cơ cấu của ngành. Hãy coi mọi con số ở đây trước hết là một phát biểu về nguồn của chúng tôi, và chỉ là phát biểu về ngành thông qua suy luận.
Trích dẫn.
starlikeness (2026). "Where Our Data Comes From, and What's Missing."
Chỉ mục khuôn mặt, ảnh chụp 2026-08 (n=241,792 khuôn mặt; 2,333 bản ghi danh
tính; 106 trang; 4 máy chủ chứa ảnh đại diện).
https://starlikeness.com/vi/articles/where-our-data-comes-from
Câu hỏi liên quan
- Chúng ta thực sự nhìn thấy được bao nhiêu phần của ngành này?
- Chỉ mục của chúng tôi có 589 người không tên
- Điểm tương đồng 0.40 nghĩa là gì?
- Tìm kiếm bằng khuôn mặt hoạt động ra sao, từng bước một
- Vì sao tìm kiếm ảnh ngược của Google không dùng được với phim người lớn
Mọi thứ ở trên mô tả chỉ mục, không mô tả bạn: việc phát hiện khuôn mặt chạy trong trình duyệt của bạn, chỉ vùng khuôn mặt đã cắt được gửi đi để so khớp, và không có gì về lượt tìm của bạn được ghi ngược trở lại vào dữ liệu này.