Автоматически переведённых субтитров хватает ровно на то, чего большинство зрителей от них и хочет: следить за ситуацией, за ролями и за общим направлением разговора. Их не хватает на всё, что держится на точной формулировке одной реплики.
Это разделение — не попытка увильнуть. Оно прямо следует из устройства конвейера: две автоматические стадии подряд, где ошибки первой становятся входом для второй, а вторая никак не может узнать, что переводит нечто, чего никто не произносил.
Что вообще происходит, когда субтитры генерируются автоматически?
Последовательно работают две отдельные системы, и обратной связи между ними нет.
Первая стадия — автоматическое распознавание речи (ASR). Она превращает звуковую дорожку в японский текст с таймингами. Для этого материала стадия тяжёлая, и именно здесь наносится большая часть ущерба.
Вторая стадия — машинный перевод (MT). Он берёт этот японский текст и выдаёт английский. Современный машинный перевод в этом действительно силён — на чистом и правильном входе.
Проблема в стыке между ними. Вторая стадия получает текст, а не звук. Она не слышит, что первая догадывалась. Неверно расслышанное слово приходит выглядящим ровно как расслышанное верно, и MT делает то, для чего сделан: выдаёт беглый грамматичный текст. На выходе — фраза, которая читается безупречно и значит то, чего никто не говорил.
Почему этот материал труднее, чем звук, под который эти системы настраивали?
Потому что распознавание речи учат и меряют в основном на эфирном, лекционном и совещательном звуке, а видео для взрослых нарушает почти каждое допущение, зашитое в тот материал.
- Говорящие перебивают друг друга. ASR построено вокруг поочерёдной речи. Одновременная речь либо схлопывается в реплику одного, либо даёт смесь обоих.
- Значительная часть звука невербальна. Дыхание и вокализации занимают акустическое пространство, где система ждёт слов, а система, склонная находить речь, речь и найдёт.
- Условия записи разбросаны чудовищно. Съёмка с рук и запись на один микрофон дают соотношение речи к шуму сильно ниже эфирного базового уровня.
- Контекстные окна скудные. MT снимает неоднозначность по соседним предложениям. Диалог здесь — часто короткие изолированные возгласы, вокруг которых текста почти нет.
- Японский опускает подлежащее. Грамматичная японская фраза сплошь и рядом не сообщает, кто говорит, к кому обращаются и один ли это человек. Английскому нужно местоимение, так что переводчик обязан его выдумать — и он выберет правдоподобный вариант по умолчанию и заявит его с полной уверенностью.
- Для вежливых форм и регистра в английском нет слота. Информация об отношениях, которую несёт уровень речи, теряется одной из первых.
Ни одна из этих проблем не решается более хорошей моделью перевода, потому что ни одна из них не является проблемой перевода.
Каких ошибок ждать и насколько каждая опасна?
Ошибки чётко сортируются по стадии, которая их породила, и от этого зависит, насколько они поправимы.
| Тип ошибки | Возникает на | Как выглядит на экране | Влияние на понимание |
|---|---|---|---|
| Придуманный диалог поверх неречевого звука | ASR | Реплики появляются там, где никто не говорит | Низкое — очевидно, легко игнорировать |
| Неверно расслышанное слово, поданное гладко | ASR | Грамматичная фраза, не подходящая к сцене | Высокое — незаметно и правдоподобно |
| Имена, превращённые в обычные слова | ASR | Имя человека заменено похожим по звучанию существительным | Среднее — сбивает с толку, но обнаружимо |
| Неверный род или число местоимения | MT | «Он» и «она» меняются местами для одного и того же человека | Среднее — режет слух, обычно восстановимо |
| Вежливые формы и регистр сплющены | MT | Все говорят одним и тем же нейтральным тоном | Среднее — нюанс отношений теряется полностью |
| Идиома переведена буквально | MT | Пословная передача, не значащая ничего | Низкое — опознаётся как бессмыслица |
| Игра слов и каламбуры | MT | Либо буквально, либо заменено чем-то посторонним | Высокое — шутки просто нет |
| Перекрывающаяся речь сведена к одной реплике | ASR | Виден только тот, кто громче | Среднее — вы теряете обмен репликами |
У двух строк с высоким влиянием общее свойство: по самим субтитрам вы их не заметите. Всё остальное объявляет о себе само. Неверно расслышанное слово, поданное беглым английским, — нет, и именно поэтому оно весит больше всего.
Когда им можно доверять, а когда не стоит?
Доверяйте им в том, что касается связности и ситуации; не доверяйте там, где смысл несёт нагрузку.
Разумно опираться:
- На понимание того, кто присутствует, что происходит и как разворачивается сцена
- На широкий эмоциональный регистр — согласие, отказ, колебание
- На повторяющиеся формульные обмены репликами, где контекст делает смысл избыточным
- На решение, та ли это сцена, которую вы искали
Стоит не доверять:
- Любой реплике, которая будто бы раскрывает сюжетный поворот, отношения или завязку
- Именам, местам, брендам и упоминаниям лейблов
- Всему, что подано как шутка или каламбур
- Репликам во время перекрывающегося диалога или сильного фонового шума
- Маркерам вежливости и регистра, если отношения между людьми важны
- Числам и времени, которые ASR путает охотно
Практическое правило: если одна строка субтитров меняет ваше понимание всей сцены, считайте её непроверенной. Настоящая сюжетная информация обычно повторяется или показывается визуально. Откровение, появившееся ровно один раз, в одной реплике, и больше не всплывающее, — скорее артефакт конвейера, чем пункт сценария.
Как быстро оценить дорожку?
Посмотрите первые несколько минут с этими пятью проверками, и оценка дорожке будет очевидна.
| Проверка | Что делает слабая дорожка |
|---|---|
| Появляются ли реплики во время тишины или неречевого звука? | Да, часто |
| Имя человека каждый раз пишется одинаково? | Нет — оно плывёт или становится нарицательным |
| Местоимения для одного человека остаются одними и теми же? | Нет — они скачут от реплики к реплике |
| Реплики одинаково короткие и примерно одной длины? | Да — автоматическая сегментация |
| Идиомы читаются как буквальная бессмыслица? | Да — идиоматической перезаписи нет |
Два и больше совпадения означают, что вы смотрите выдачу автоматического конвейера, и дальше по хронометражу качество не вырастет. Знать это заранее полезно: это подсказывает, какой вес придавать любой отдельной реплике на оставшийся час-полтора.
Похожие вопросы
- Откуда берутся субтитры к JAV и почему качество такое разное?
- Какой видеоплеер выбрать?
- В чём на самом деле силён каждый сайт-база данных по JAV?
- Что на самом деле меняется между просмотром на телефоне и на компьютере?
То, на каких площадках вообще есть релизы с субтитрами, сильно различается — посмотрите, что мы проиндексировали, в списке сайтов.