對多數觀眾真正想要的東西 —— 跟上情境、角色關係,以及一段對話的大致走向 —— 自動翻譯字幕已經夠好了。但只要事情取決於某一句話的精確措辭,它就不夠好。

這種一刀兩斷不是在打太極。它是這條管線怎麼搭起來的直接後果:兩個自動化階段串在一起,第一階段的錯誤成為第二階段的輸入,而第二階段沒有任何辦法知道自己正在翻譯的東西根本沒人說過。

字幕自動生成的時候,實際上發生了什麼事?

兩套各自獨立的系統依序執行,而且它們不會互相回話。

第一階段是自動語音辨識(ASR)。 它把音軌轉成帶時間碼的日文文字。對這類素材而言,這是困難的一段,也是大部分損害發生的地方。

第二階段是機器翻譯(MT)。 它拿那份日文文字,產出英文。現代的機器翻譯在這件事上是真的很強 —— 前提是輸入乾淨而且正確。

問題出在兩者的交界。第二階段收到的是文字,不是音訊。它聽不出來第一階段是用猜的。一個聽錯的詞,看起來和一個聽對的詞一模一樣,而機器翻譯就做它被設計來做的事:產出流暢、合文法的輸出。結果就是一句讀起來完美無瑕、但意思是從來沒人說過的話。

為什麼這類素材比這些系統調校時用的音訊更難?

因為語音辨識的訓練與評測,大部分建立在廣播、講座與會議音訊上,而成人影片幾乎違反了那些素材所隱含的每一項假設。

  • 講話會重疊。 ASR 是圍繞著輪流發言建的。同時說話的結果,不是塌成其中一人的台詞,就是產出兩人混在一起的東西。
  • 有很大一部分音訊是非語言的。 呼吸與各種發聲佔據了系統預期會出現詞語的聲學空間,而一個偏向「找到語音」的系統,就一定會找到語音。
  • 錄音條件差異極大。 手持與單麥克風的設定,語音雜訊比遠低於廣播的基準。
  • 上下文視窗很稀疏。 機器翻譯靠周圍的句子來消解歧義。這裡的對白經常是短促、孤立的驚呼,周圍幾乎沒有可以拿來對照的文字。
  • 日文會省略主語。 一個合文法的日文句子經常省略誰在說、對誰說,以及指涉的對象是單數還是複數。英文需要一個代名詞,所以翻譯器必須自己編一個 —— 而它會挑一個聽起來合理的預設值,然後充滿自信地講出來。
  • 敬語與語體在英文裡沒有對應的位置。 由說話等級承載的關係資訊,是最先被弄丟的東西之一。

這些沒有一個是靠更好的翻譯模型能解決的,因為它們沒有一個是翻譯問題。

該預期會遇到哪些錯誤,各自有多嚴重?

錯誤可以依「由哪個階段產生」乾淨地分類,而那也決定了它們有多容易被救回來。

錯誤類型 來自哪一段 在畫面上長什麼樣 對理解的影響
在非語音音訊上憑空生出台詞 ASR 沒人在講話的地方冒出字幕 低 —— 很明顯,容易忽略
聽錯的詞被流暢地寫出來 ASR 一句合文法、卻和場景兜不起來的話 高 —— 看不出來,而且看起來很合理
人名被變成普通詞彙 ASR 人名被換成發音相近的名詞 中 —— 會混淆,但察覺得到
代名詞的性別或單複數搞錯 MT 同一個人一下 he 一下 she 中 —— 突兀,但通常推得出來
敬語與語體被壓平 MT 所有人都用同一種中性語氣說話 中 —— 關係層次的細節完全消失
慣用語被照字面翻 MT 逐字對譯出一句毫無意義的話 低 —— 一看就知道是胡說
文字遊戲與雙關 MT 不是照字面翻,就是被換成毫不相干的東西 高 —— 那個梗直接不見了
重疊的對話被縮成一句 ASR 只有音量較大的那個人出現 中 —— 你會漏掉那一來一往

那兩列高影響的錯誤有一個共同性質:你光看字幕察覺不出來。 其他每一種都會自己現形。一個聽錯的詞被寫成流暢的英文不會,而這正是它最要命的原因。

什麼時候可以信、什麼時候不該信?

在連貫性與情境上可以信;在任何意義具有承重作用的地方,都要存疑。

可以合理仰賴的:

  • 掌握誰在場、正在發生什麼、場景怎麼推進
  • 大方向的情緒基調 —— 同意、拒絕、猶豫
  • 重複出現、公式化的對答,那些靠情境就能懂、字幕只是多餘
  • 判斷某個場景是不是你在找的那個

值得存疑的:

  • 任何看起來揭露了劇情轉折、人物關係或前提的句子
  • 人名、地名、品牌與廠牌相關的指涉
  • 任何被當成玩笑或雙關呈現的東西
  • 對白重疊或背景噪音很重時的句子
  • 禮貌程度與語體的線索,尤其在人物之間的關係很重要時
  • 數字與時間,ASR 很容易辨識錯

一條實用規則:如果單獨一句字幕改變了你對整場戲的理解,就把它當成尚未查證。 真正的劇情資訊通常會被重述,或以視覺方式呈現。一個只出現過一次、只在一句話裡、之後再也沒出現的「揭露」,比較可能是管線產生的雜訊,而不是劇本裡的重點。

怎麼快速判斷一條字幕軌的水準?

用這五個檢查看完前幾分鐘,等級就很明顯了。

檢查項目 品質差的字幕軌會怎樣
靜音或非語言音訊時會冒出字幕嗎? 會,而且很頻繁
同一個人的名字每次拼法都一樣嗎? 不一樣 —— 會飄移,或變成普通名詞
同一個人的代名詞前後一致嗎? 不一致 —— 一句一句在換
每句字幕是不是都一樣短、長度都差不多? 是 —— 自動切分的結果
慣用語讀起來是不是照字面的胡言亂語? 是 —— 完全沒有做慣用語改寫

其中兩項以上成立,就代表你正在看一條自動化管線的產出,而且品質不會在後面變好。這值得一開始就知道,因為它告訴你接下來一兩個小時裡,任何單獨一句話該給多少份量。

相關問題


到底有哪些平台會提供附字幕的作品,差異非常大 —— 可以看看我們索引到的站台列表