對多數觀眾真正想要的東西 —— 跟上情境、角色關係,以及一段對話的大致走向 —— 自動翻譯字幕已經夠好了。但只要事情取決於某一句話的精確措辭,它就不夠好。
這種一刀兩斷不是在打太極。它是這條管線怎麼搭起來的直接後果:兩個自動化階段串在一起,第一階段的錯誤成為第二階段的輸入,而第二階段沒有任何辦法知道自己正在翻譯的東西根本沒人說過。
字幕自動生成的時候,實際上發生了什麼事?
兩套各自獨立的系統依序執行,而且它們不會互相回話。
第一階段是自動語音辨識(ASR)。 它把音軌轉成帶時間碼的日文文字。對這類素材而言,這是困難的一段,也是大部分損害發生的地方。
第二階段是機器翻譯(MT)。 它拿那份日文文字,產出英文。現代的機器翻譯在這件事上是真的很強 —— 前提是輸入乾淨而且正確。
問題出在兩者的交界。第二階段收到的是文字,不是音訊。它聽不出來第一階段是用猜的。一個聽錯的詞,看起來和一個聽對的詞一模一樣,而機器翻譯就做它被設計來做的事:產出流暢、合文法的輸出。結果就是一句讀起來完美無瑕、但意思是從來沒人說過的話。
為什麼這類素材比這些系統調校時用的音訊更難?
因為語音辨識的訓練與評測,大部分建立在廣播、講座與會議音訊上,而成人影片幾乎違反了那些素材所隱含的每一項假設。
- 講話會重疊。 ASR 是圍繞著輪流發言建的。同時說話的結果,不是塌成其中一人的台詞,就是產出兩人混在一起的東西。
- 有很大一部分音訊是非語言的。 呼吸與各種發聲佔據了系統預期會出現詞語的聲學空間,而一個偏向「找到語音」的系統,就一定會找到語音。
- 錄音條件差異極大。 手持與單麥克風的設定,語音雜訊比遠低於廣播的基準。
- 上下文視窗很稀疏。 機器翻譯靠周圍的句子來消解歧義。這裡的對白經常是短促、孤立的驚呼,周圍幾乎沒有可以拿來對照的文字。
- 日文會省略主語。 一個合文法的日文句子經常省略誰在說、對誰說,以及指涉的對象是單數還是複數。英文需要一個代名詞,所以翻譯器必須自己編一個 —— 而它會挑一個聽起來合理的預設值,然後充滿自信地講出來。
- 敬語與語體在英文裡沒有對應的位置。 由說話等級承載的關係資訊,是最先被弄丟的東西之一。
這些沒有一個是靠更好的翻譯模型能解決的,因為它們沒有一個是翻譯問題。
該預期會遇到哪些錯誤,各自有多嚴重?
錯誤可以依「由哪個階段產生」乾淨地分類,而那也決定了它們有多容易被救回來。
| 錯誤類型 | 來自哪一段 | 在畫面上長什麼樣 | 對理解的影響 |
|---|---|---|---|
| 在非語音音訊上憑空生出台詞 | ASR | 沒人在講話的地方冒出字幕 | 低 —— 很明顯,容易忽略 |
| 聽錯的詞被流暢地寫出來 | ASR | 一句合文法、卻和場景兜不起來的話 | 高 —— 看不出來,而且看起來很合理 |
| 人名被變成普通詞彙 | ASR | 人名被換成發音相近的名詞 | 中 —— 會混淆,但察覺得到 |
| 代名詞的性別或單複數搞錯 | MT | 同一個人一下 he 一下 she | 中 —— 突兀,但通常推得出來 |
| 敬語與語體被壓平 | MT | 所有人都用同一種中性語氣說話 | 中 —— 關係層次的細節完全消失 |
| 慣用語被照字面翻 | MT | 逐字對譯出一句毫無意義的話 | 低 —— 一看就知道是胡說 |
| 文字遊戲與雙關 | MT | 不是照字面翻,就是被換成毫不相干的東西 | 高 —— 那個梗直接不見了 |
| 重疊的對話被縮成一句 | ASR | 只有音量較大的那個人出現 | 中 —— 你會漏掉那一來一往 |
那兩列高影響的錯誤有一個共同性質:你光看字幕察覺不出來。 其他每一種都會自己現形。一個聽錯的詞被寫成流暢的英文不會,而這正是它最要命的原因。
什麼時候可以信、什麼時候不該信?
在連貫性與情境上可以信;在任何意義具有承重作用的地方,都要存疑。
可以合理仰賴的:
- 掌握誰在場、正在發生什麼、場景怎麼推進
- 大方向的情緒基調 —— 同意、拒絕、猶豫
- 重複出現、公式化的對答,那些靠情境就能懂、字幕只是多餘
- 判斷某個場景是不是你在找的那個
值得存疑的:
- 任何看起來揭露了劇情轉折、人物關係或前提的句子
- 人名、地名、品牌與廠牌相關的指涉
- 任何被當成玩笑或雙關呈現的東西
- 對白重疊或背景噪音很重時的句子
- 禮貌程度與語體的線索,尤其在人物之間的關係很重要時
- 數字與時間,ASR 很容易辨識錯
一條實用規則:如果單獨一句字幕改變了你對整場戲的理解,就把它當成尚未查證。 真正的劇情資訊通常會被重述,或以視覺方式呈現。一個只出現過一次、只在一句話裡、之後再也沒出現的「揭露」,比較可能是管線產生的雜訊,而不是劇本裡的重點。
怎麼快速判斷一條字幕軌的水準?
用這五個檢查看完前幾分鐘,等級就很明顯了。
| 檢查項目 | 品質差的字幕軌會怎樣 |
|---|---|
| 靜音或非語言音訊時會冒出字幕嗎? | 會,而且很頻繁 |
| 同一個人的名字每次拼法都一樣嗎? | 不一樣 —— 會飄移,或變成普通名詞 |
| 同一個人的代名詞前後一致嗎? | 不一致 —— 一句一句在換 |
| 每句字幕是不是都一樣短、長度都差不多? | 是 —— 自動切分的結果 |
| 慣用語讀起來是不是照字面的胡言亂語? | 是 —— 完全沒有做慣用語改寫 |
其中兩項以上成立,就代表你正在看一條自動化管線的產出,而且品質不會在後面變好。這值得一開始就知道,因為它告訴你接下來一兩個小時裡,任何單獨一句話該給多少份量。
相關問題
到底有哪些平台會提供附字幕的作品,差異非常大 —— 可以看看我們索引到的站台列表。