以圖搜圖的工具,不是同一個想法的幾種競爭實作。它們分屬兩個家族,回答的是不同的問題,而挑錯家族,不管你在裡面選哪個產品都注定失敗。
第一個家族問的是*「這張圖還出現在哪裡?」* 第二個家族問的是*「這是誰的臉?」* 如果你手上是一張從播放器截下來的圖,只有第二個問題有答案。
這兩個家族實際的差別是什麼?
近似重複比對會為整張圖建一個指紋,然後在網路爬蟲的資料裡找相符的指紋。臉部向量引擎則是先定位出一張臉,把它正規化,編碼成一串數字,再拿那串數字去跟一個臉的索引比對。
| 近似重複比對 | 臉部向量比對 | |
|---|---|---|
| 核心問題 | 這張圖出現在哪裡? | 這是誰的臉? |
| 比對的單位 | 整張圖的指紋 | 對齊後的臉 → 數值向量 |
| 需要那張圖確實存在於網路上 | 需要 | 不需要 |
| 裁切到只剩臉 | 有害 —— 把訊號拿掉了 | 有幫助 —— 那正是它的輸入 |
| 姿勢、光線、年份都不同 | 通常會失敗 | 本來就是設計來撐過這些的 |
| 對你自己截下來的畫面有用 | 沒用 | 有用 |
| 典型的失敗模式 | 回傳不相干的圖庫照片 | 回傳分數很低的真實人物 |
對影片畫面來說,決定一切的是第三列。把播放器暫停下來截圖,你就創造了一張從來沒有以檔案形式存在於網路上的圖。沒有副本可找,所以近似重複比對沒有東西可以下手 —— 這是結構性的限制,不是品質上的差距。
各個主要工具實際上在做什麼?
按行為而不是按品牌分組,選擇就變得很明顯了。
| 工具 | 家族 | 它比對什麼 | 在影片畫面上是怎麼壞掉的 |
|---|---|---|---|
| Google 圖片/Lens | 近似重複 + 視覺相似 | 整張圖對上 Google 的爬蟲資料 | 成人網站在爬蟲資料裡大多缺席,而且被 SafeSearch 壓制 |
| Bing Visual Search | 近似重複 + 區域搜尋 | 整張圖,或你選取的一塊區域 | 對成人片庫來說,同樣是爬蟲覆蓋不足的問題 |
| TinEye | 嚴格的近似重複 | 同一個檔案的原始與編輯過的副本 | 它明講自己是找副本的;一張全新的畫面沒有副本 |
| Yandex Images | 近似重複 + 很強的視覺相似 | 整張圖,相似度排序比較寬鬆 | 常常回傳看起來很像的陌生人,讀起來像命中,其實不是 |
| 一般的網路「人臉搜尋」工具 | 臉部向量 | 從公開網路建索引的臉 | 索引是從公開網路與社群影像建的,不是成人片庫 |
| 以成人素材建索引的人臉搜尋 | 臉部向量 | 從成人封面與劇照建索引的臉 | 侷限於那些來源實際發布過的東西 |
Yandex 值得特別提醒。它的視覺相似度排序寬鬆到會回傳只是長得像的人 —— 同樣的髮型、同樣的姿勢、同樣的色調。使用者把那讀成了辨識結果。它不是;那條流程裡沒有任何一個環節在測量身分。
為什麼索引比引擎更重要?
因為檢索只能回傳被建進索引的東西,而沒有任何演算法能補上不存在的素材。
一個訓練到最先進水準的臉部向量引擎,指向一個由公開網路照片組成的索引,就是找不到一位影像只存在於那個索引從未爬過的片庫裡的成人女優。工程做得多好,對結果毫無影響。
我們的索引就是專門建在這類素材上的:橫跨 106 個站台、來自成人封面與劇照的 241,792 張臉,其中 2,333 張連到了具名女優(我們的索引,2026-08 快照)。這正是它能回答一個 Google 回答不了的問題的全部原因。
值得講清楚的邊界: 我們的覆蓋是偏斜的。那 2,333 位具名女優裡有 2,246 位,代表圖來自同一個來源。我們涵蓋的片庫之外的東西,對我們就是不可見的,而我們仍然會給你一份差一點點的排序清單 —— 這正是為什麼每一筆結果都附著分數,其中 0.40 是針對影片截圖校準過的門檻。
這些工具在「你交出了什麼」上有什麼差別?
比較通常止於結果品質,但這些工具在隱私架構上的差異,其實比演算法上的差異更大。
| 行為 | 典型的整檔上傳工具 | 瀏覽器端偵測 |
|---|---|---|
| 傳送原始圖片 | 會 | 不會 |
| 傳送中繼資料(GPS、裝置、時間戳) | 會,除非先被剝掉 | 從不傳送 |
| 傳送臉部以外的內容 | 會 | 不會 |
| 送到伺服器的東西 | 完整檔案 | 臉部裁切區塊 + 5 個特徵點座標 |
| 使用者能不能自行驗證 | 只能靠政策上的宣稱 | 可以 —— 檢查那個網路請求就知道 |
兩個家族裡的多數工具都是整檔上傳,因為那樣比較好做。把偵測放在客戶端執行,代表伺服器根本收不到原始檔案。
各大服務對於它們收到的上傳內容怎麼講,差異比你想像的還大,而有用的區分是「有明確政策」與「沉默」之間的差別。
| 服務 | 關於保留上傳內容 | 關於用於訓練 |
|---|---|---|
| 只有在視覺搜尋紀錄開啟時才會儲存,而它預設是關的 | 如果開啟,圖片可能被用來訓練它的視覺搜尋模型;訓練用的副本最長保留四年,與帳號脫鉤 | |
| Bing Visual Search | 沒有公布保留期限 | 說照片可能被用來改善它的影像處理;沒有用到「訓練」這個詞 |
| Yandex Images | 沒有針對圖片的說明 | 沒有針對圖片的說明 |
| TinEye | 表示上傳的圖片在結果顯示後即刪除,且絕不加入它的索引 | 兩邊都沒有說明 |
把空白的格子讀成未知,不是讀成保證。還有兩個陷阱:大家拿來引用微軟的那句大方的「我們不會用你的圖片訓練」,屬於它的影像生成產品,不是視覺搜尋;而上面 Google 的預設值,是針對它的 App 與 Lens 介面所記載的,沒有任何對應的說明涵蓋未登入狀態下的桌機上傳。
來源:各服務自己公布的說明或政策頁面;2026-08-03 查核。
到底該用哪一個,什麼時候用?
- 你手上有一張已發布的圖片 —— 封面、宣傳劇照,或任何以檔案形式存在於網路上的東西:近似重複比對是正確的第一步。它能找出它原本來自哪一個頁面。
- 你手上是自己截下來的一格畫面:直接去用臉部向量搜尋。近似重複比對不會有用,重試也不會改變這件事。
- 你手上有一張臉,但懷疑那個人不是成人女優:任何以成人素材建索引的引擎都幫不上忙,而把它用在一個私人個體身上,是誤用這個工具,不是什麼聰明的變通做法。
- 你手上有番號或片名文字:完全跳過以圖搜圖。文字查詢比任何視覺方法都更快也更可靠。
在把時間投進任何工具之前,有一個很有用的單一測試:把你的圖裁到只剩臉,再跑一次。如果結果變得更差,那個工具做的就是近似重複比對,它辨識不了任何人。
相關問題
這個比較用實測來定案最容易:拿同一格畫面,分別丟進一個近似重複的工具,以及這裡的人臉搜尋。偵測在你的瀏覽器裡執行 —— 原始檔案從不離開你的裝置,而每一筆結果都會顯示它的分數。