Điểm tương đồng là độ tương đồng cosine giữa hai vector khuôn mặt — hai dãy gồm 512 số — và nó chạy từ 0 đến 1. Trên chỉ mục của chúng tôi, 0.40 là điểm mà từ đó trở lên một cặp được coi là nhiều khả năng cùng một người. Nó không phải phần trăm, không phải độ tự tin, cũng không phải xác suất. Nó là một góc.

Con số này quan trọng vì một điều mà phần lớn công cụ tìm kiếm bằng khuôn mặt không nói với bạn: tìm kiếm vector dày đặc không bao giờ trả về rỗng. Bạn hỏi mười kết quả thì nó đưa mười, bất kể người bạn đang tìm có tồn tại trong chỉ mục hay không. Điểm số là thứ duy nhất phân biệt một câu trả lời với người lạ gần nhất hiện có.

Điểm số thực ra đang đo cái gì?

Độ tương đồng cosine đo góc giữa hai vector, bỏ qua độ dài của chúng. Hai khuôn mặt được mã hóa thành vector 512 chiều là "tương đồng" khi vector của chúng chỉ về gần như cùng một hướng.

Bộ mã hóa — với chúng tôi là ArcFace — được huấn luyện sao cho ảnh của cùng một danh tính sinh ra các vector chỉ cùng hướng, còn ảnh của những danh tính khác nhau sinh ra các vector chỉ ra xa nhau. Tư thế, ánh sáng, phông nền và kiểu tóc phần lớn đã bị vứt bỏ trong bước phát hiện và căn chỉnh, trước cả khi bộ mã hóa nhìn thấy khuôn mặt.

Đó là lý do điểm số không hành xử như một ấn tượng thị giác. Hai tấm ảnh trông giống nhau với bạn có thể cho điểm thấp; hai tấm ảnh trông chẳng giống nhau chút nào — khác ánh sáng, khác cả thập niên, khác kiểu tóc — lại có thể cho điểm cao.

Nên đọc từng dải điểm như thế nào?

Hãy coi điểm số là một dải, không phải một phán quyết. Đây là những dải làm việc mà chúng tôi dùng trên dữ liệu của chính mình.

Điểm Cách hiểu Làm gì với nó
0.70 trở lên Rất nhiều khả năng cùng một danh tính Coi là khớp; vẫn nên kiểm tra trang nguồn
0.55 – 0.70 Nhiều khả năng cùng một danh tính Khớp, nhưng hãy đối chiếu với một tấm ảnh thứ hai
0.40 – 0.55 Trên ngưỡng, nhưng yếu Có thể tin được; một góc chụp xấu hoặc một người giống đều cho ra thế này
0.25 – 0.40 Dưới ngưỡng Sự giống nhau, không phải danh tính
Dưới 0.25 Vector gần nhất hiện có Chẳng nói lên gì ngoài việc chỉ mục buộc phải trả về thứ gì đó

Những hàng dưới 0.40 là chỗ người ta hay đọc sai. Một kết quả 0.31 không phải là "31% khả năng". Nó là hệ thống đang nói với bạn rằng nó không có người bạn cần và đang cho bạn xem thứ nó có.

Nguồn: chỉ mục của chúng tôi, bản chụp 2026-08. Các dải điểm là kinh nghiệm thực dụng để đọc kết quả của chính chúng tôi, không phải một chuẩn đối sánh đã công bố.

Vì sao lại cần có ngưỡng?

Vì ngưỡng biến một khoảng cách liên tục thành một quyết định có/không, và mọi phép biến đổi kiểu đó đều đánh đổi loại sai lầm này lấy loại sai lầm kia.

Hạ ngưỡng xuống thì bạn vớt lại được nhiều kết quả khớp thật hơn, kể cả những cái chụp ở góc khó hoặc nén tệ — nhưng đồng thời cũng cho lọt vào nhiều khuôn mặt chẳng liên quan. Nâng ngưỡng lên thì những kết quả bạn giữ lại sạch hơn, nhưng những kết quả khớp thật lấy từ ảnh nghiêng hoặc luồng phát bitrate thấp thì rơi hẳn ra khỏi danh sách.

Không có mức đặt nào loại bỏ được cả hai sai lầm. 0.40 nằm ở chỗ của nó vì truy vấn điển hình của chúng tôi là một khung hình video: đã nén, nhòe do chuyển động, hiếm khi chính diện, thường nhỏ. Một ngưỡng hiệu chỉnh trên ảnh chân dung studio sạch sẽ sẽ cao hơn và sẽ loại bỏ phần lớn truy vấn thật.

Vì sao cùng một người lại cho điểm khác nhau ở các tấm ảnh khác nhau?

Vì bộ mã hóa loại bỏ tư thế và ánh sáng một cách không hoàn hảo, và mọi bước suy giảm chất lượng giữa máy quay và ảnh chụp màn hình của bạn đều làm vector dịch đi.

Điều kiện Ảnh hưởng lên điểm
Chính diện, nét, đủ sáng Điểm cao nhất; trường hợp lý tưởng của bộ mã hóa
Đầu quay quá khoảng ba phần tư Tụt mạnh; một phần khuôn mặt đơn giản là không có ở đó
Video nén nặng, bitrate thấp Tụt; các khối nhiễu phá hỏng chi tiết nhỏ trên mặt
Khuôn mặt nhỏ trong khung hình Tụt, và bước phát hiện có thể hỏng trước cả khi mã hóa diễn ra
Bị che — bàn tay, tóc, vật cản ngang mặt Điểm mốc dịch đi, bước căn chỉnh nắn sai, vector sai theo
Hai tấm ảnh cách nhau nhiều năm Tụt vừa phải; tín hiệu danh tính vẫn còn nhưng yếu đi
Can thiệp thẩm mỹ, thay đổi cân nặng đáng kể Kết quả khớp thật có thể rơi xuống dưới ngưỡng
Trang điểm, kiểu tóc, màu tóc Ảnh hưởng ít; bước căn chỉnh cắt bỏ gần hết phần đó

Hàng cuối làm người ta bất ngờ, còn hàng ngay trên nó làm người ta thất vọng. Tóc thì gần như miễn phí; một khuôn mặt đã đổi thì không.

Vì sao nên nghi ngờ một công cụ giấu điểm số?

Vì giấu điểm số là giấu đi sự khác biệt giữa một kết quả khớp và một phỏng đoán, mà khác biệt đó chính là toàn bộ kết quả.

Một danh sách xếp hạng không có điểm trông y hệt nhau dù kết quả đầu bảng ở 0.85 hay ở 0.19. Cả hai đều hiện ra thành "đây là kết quả gần nhất của bạn". Chỉ một trong hai là có ý nghĩa. Một công cụ đưa ra mười khuôn mặt mà không có con số nào đã lấy đúng trường thông tin giàu ý nghĩa nhất rồi vứt đi — và nó làm vậy đúng trong tình huống mà hệ thống chắc chắn sẽ sinh ra kết quả bất kể sự thật là gì.

Một kết quả tìm kiếm bằng khuôn mặt trung thực gồm ba thứ: điểm số, ngưỡng mà nó đang được đem ra xét, và một đường dẫn tới ảnh nguồn để bạn tự mắt kiểm tra. Thiếu bất kỳ thứ nào trong ba thứ đó thì bạn không kiểm toán được câu trả lời.

Dữ liệu và phương pháp

Nguồn. Vector khuôn mặt được tính từ ảnh bìa và ảnh tĩnh do starlikeness lập chỉ mục trên 106 trang.

Mẫu. 241,792 vector khuôn mặt trong chỉ mục; 2,333 bản ghi danh tính có gắn tên (chỉ mục của chúng tôi, bản chụp 2026-08).

Phương pháp. Phát hiện bằng YuNet, cho ra một khung bao và năm điểm mốc. Căn chỉnh về tư thế chuẩn từ các điểm mốc đó. Mã hóa bằng ArcFace thành vector 512 chiều. Truy hồi bằng độ tương đồng cosine trên toàn bộ chỉ mục. Ngưỡng 0.40 được hiệu chỉnh cho truy vấn dạng khung hình video đối chiếu với chỉ mục này.

Ngày chụp dữ liệu. 2026-08.

Thiên lệch đã biết. Độ bao phủ tập trung rất nặng. 2,246 trong số 2,333 danh tính có tên lấy ảnh đại diện từ một trang duy nhất, và chỉ một thiểu số nhỏ trong 106 trang đã lập chỉ mục là có mang ID nội dung kiểu Nhật. Vì vậy thứ chúng tôi đo được là mức độ xuất hiện trên các trang tổng hợp, không phải sản lượng phát hành. Một diễn viên mà tác phẩm chỉ xuất hiện trên những trang chúng tôi chưa lập chỉ mục thì sẽ không được tìm ra, và chẳng điểm số nào nói cho bạn biết điều đó — lượt tìm vẫn sẽ trả về mười người lạ gần nhất của nó.

Giới hạn của ngưỡng. 0.40 áp dụng cho bộ mã hóa này và chỉ mục này. Nó không chuyển sang được cho một công cụ khác, một mô hình khác, hay một loại ảnh truy vấn khác. Mọi khẳng định rằng một điểm số "có nghĩa là" một xác suất danh tính cố định đều là nói quá: cùng một con số mang trọng lượng khác nhau tùy vào chất lượng của truy vấn.

Trích dẫn.

starlikeness (2026). "What Does a Similarity Score of 0.40 Mean?"
Chỉ mục khuôn mặt, ảnh chụp 2026-08 (n=241,792 khuôn mặt; 2,333 danh tính có
tên). https://starlikeness.com/vi/articles/what-similarity-score-means

Câu hỏi liên quan


Bạn có thể tận mắt xem ngưỡng làm việc: tải lên một khung hình và đọc điểm số bên cạnh từng khuôn mặt. Bước phát hiện chạy ngay trong trình duyệt của bạn, chỉ vùng khuôn mặt đã cắt được gửi đi để so khớp, và ảnh gốc không bao giờ rời khỏi thiết bị của bạn.