Los subtítulos traducidos automáticamente son lo bastante buenos para lo que de verdad quiere casi todo el mundo: seguir la situación, los papeles y por dónde va una conversación. No lo son para nada que dependa de la formulación exacta de una línea concreta.

Esa división no es una salida por la tangente. Es la consecuencia directa de cómo está construida la cadena: dos fases automáticas en serie, donde los errores de la primera se convierten en la entrada de la segunda, y la segunda no tiene forma de saber que está traduciendo algo que nunca se dijo.

¿Qué está pasando realmente cuando los subtítulos se generan solos?

Dos sistemas independientes se ejecutan en secuencia, y no se responden el uno al otro.

La primera fase es el reconocimiento automático del habla (ASR). Convierte la pista de audio en texto japonés con marcas de tiempo. Esta es la fase difícil con este material, y es donde se produce la mayor parte del daño.

La segunda fase es la traducción automática (MT). Toma ese texto japonés y produce inglés. La MT moderna es genuinamente buena en esto, siempre que la entrada sea limpia y correcta.

El problema está en la unión entre ambas. La segunda fase recibe texto, no audio. No puede oír que la primera se lo inventó. Una palabra mal oída llega con exactamente el mismo aspecto que una bien oída, y la MT hace aquello para lo que está construida: producir una salida fluida y gramatical. El resultado es una frase que se lee perfectamente y significa algo que nunca se dijo.

¿Por qué este material es más difícil que el audio con el que se afinan estos sistemas?

Porque el reconocimiento de voz se entrena y se mide sobre todo con audio de radiodifusión, clases y reuniones, y el video para adultos incumple casi todas las suposiciones que ese material lleva dentro.

  • Los hablantes se solapan. El ASR está construido en torno a los turnos de palabra. El habla simultánea o se colapsa en la línea de un solo hablante o produce una mezcla de los dos.
  • Buena parte del audio no es verbal. La respiración y las vocalizaciones ocupan el espacio acústico donde el sistema espera palabras, y un sistema sesgado hacia encontrar habla encontrará habla.
  • Las condiciones de grabación varían muchísimo. Los montajes con cámara en mano y un solo micrófono dan una relación entre voz y ruido muy por debajo del mínimo de la radiodifusión.
  • Las ventanas de contexto son escasas. La MT resuelve la ambigüedad con las frases de alrededor. Aquí el diálogo son a menudo exclamaciones cortas y aisladas, sin apenas texto alrededor con el que desambiguar.
  • El japonés omite el sujeto. Una frase japonesa gramaticalmente correcta a menudo no dice quién habla, a quién se dirige ni si el referente es singular. El inglés exige un pronombre, así que el traductor tiene que inventárselo, y elegirá un valor por defecto plausible y lo enunciará con total seguridad.
  • Los honoríficos y el registro no tienen hueco en inglés. La información relacional que transporta el nivel de cortesía es de lo primero que se pierde.

Nada de esto lo resuelve un modelo de traducción mejor, porque nada de esto es un problema de traducción.

¿Qué tipos de error deberías esperar, y qué tan graves son?

Los errores se ordenan con nitidez según la fase que los produjo, y eso determina cuánto se pueden recuperar.

Tipo de error Se origina en Cómo se ve en pantalla Impacto en la comprensión
Diálogo inventado sobre audio no verbal ASR Aparecen líneas donde nadie habla Bajo: es evidente y fácil de ignorar
Palabra mal oída convertida en texto fluido ASR Una frase gramatical que no encaja con la escena Alto: invisible y verosímil
Nombres convertidos en palabras corrientes ASR El nombre de la persona sustituido por un sustantivo que suena parecido Medio: confunde, pero se detecta
Género o número equivocado en el pronombre MT "Él" y "ella" se intercambian para la misma persona Medio: chirría, pero suele deducirse
Honoríficos y registro aplanados MT Todo el mundo habla con el mismo tono neutro Medio: el matiz relacional se pierde por completo
Modismo traducido al pie de la letra MT Una versión palabra por palabra que no significa nada Bajo: se reconoce como un sinsentido
Juegos de palabras y chistes MT O literales, o sustituidos por algo sin relación Alto: el chiste simplemente desaparece
Habla superpuesta reducida a una sola línea ASR Solo aparece quien habla más fuerte Medio: pierdes el intercambio

Las dos filas de impacto alto comparten una propiedad: no las puedes detectar solo con el subtítulo delante. Todo lo demás se delata solo. Una palabra mal oída convertida en un inglés fluido no lo hace, y por eso es lo que más importa.

¿Cuándo puedes fiarte de ellos y cuándo no?

Fíate para la continuidad y la situación; desconfía en cualquier punto donde el sentido sea determinante.

Razonable apoyarse en ellos para:

  • Seguir quién está presente, qué ocurre y cómo avanza la escena
  • El registro emocional general: acuerdo, negativa, duda
  • Intercambios repetidos y formularios donde el contexto vuelve redundante el significado
  • Decidir si una escena es la que buscabas

Mejor desconfiar de:

  • Cualquier línea que parezca revelar un giro de la trama, una relación o una premisa
  • Nombres, lugares, marcas y menciones a sellos
  • Cualquier cosa presentada como un chiste o un juego de palabras
  • Las líneas durante diálogos superpuestos o con mucho ruido de fondo
  • Las señales de cortesía y de registro, si la relación entre las personas importa
  • Los números y las horas, que el ASR reconoce mal con facilidad

Una regla práctica: si una sola línea de subtítulo cambia tu comprensión de la escena entera, trátala como no verificada. La información argumental de verdad tiende a repetirse o a mostrarse visualmente. Una revelación que aparece exactamente una vez, en una línea, y no vuelve a salir es más probable que sea un artefacto de la cadena que un punto del guion.

¿Cómo juzgas una pista rápidamente?

Mira los primeros minutos con estas cinco comprobaciones y la nota de la pista será evidente.

Comprobación Qué hace una pista mala
¿Aparecen líneas durante los silencios o el audio no verbal? Sí, con frecuencia
¿El nombre de una persona se escribe igual todas las veces? No: va cambiando o se vuelve un nombre común
¿Los pronombres se mantienen coherentes para una misma persona? No: saltan de una línea a otra
¿Las líneas son todas cortas y de longitud parecida? Sí: segmentación automática
¿Los modismos se leen como un sinsentido literal? Sí: no hay reescritura idiomática

Dos o más de estas señales significan que estás viendo la salida de una cadena automatizada, y la calidad no va a mejorar más adelante. Conviene saberlo desde el principio, porque te dice cuánto peso puedes darle a cada línea durante la hora o las dos horas que quedan.

Preguntas relacionadas


Qué plataformas ofrecen lanzamientos subtitulados varía muchísimo; mira lo que hemos indexado en la lista de sitios.