Los subtítulos traducidos automáticamente son lo bastante buenos para lo que de verdad quiere casi todo el mundo: seguir la situación, los papeles y por dónde va una conversación. No lo son para nada que dependa de la formulación exacta de una línea concreta.
Esa división no es una salida por la tangente. Es la consecuencia directa de cómo está construida la cadena: dos fases automáticas en serie, donde los errores de la primera se convierten en la entrada de la segunda, y la segunda no tiene forma de saber que está traduciendo algo que nunca se dijo.
¿Qué está pasando realmente cuando los subtítulos se generan solos?
Dos sistemas independientes se ejecutan en secuencia, y no se responden el uno al otro.
La primera fase es el reconocimiento automático del habla (ASR). Convierte la pista de audio en texto japonés con marcas de tiempo. Esta es la fase difícil con este material, y es donde se produce la mayor parte del daño.
La segunda fase es la traducción automática (MT). Toma ese texto japonés y produce inglés. La MT moderna es genuinamente buena en esto, siempre que la entrada sea limpia y correcta.
El problema está en la unión entre ambas. La segunda fase recibe texto, no audio. No puede oír que la primera se lo inventó. Una palabra mal oída llega con exactamente el mismo aspecto que una bien oída, y la MT hace aquello para lo que está construida: producir una salida fluida y gramatical. El resultado es una frase que se lee perfectamente y significa algo que nunca se dijo.
¿Por qué este material es más difícil que el audio con el que se afinan estos sistemas?
Porque el reconocimiento de voz se entrena y se mide sobre todo con audio de radiodifusión, clases y reuniones, y el video para adultos incumple casi todas las suposiciones que ese material lleva dentro.
- Los hablantes se solapan. El ASR está construido en torno a los turnos de palabra. El habla simultánea o se colapsa en la línea de un solo hablante o produce una mezcla de los dos.
- Buena parte del audio no es verbal. La respiración y las vocalizaciones ocupan el espacio acústico donde el sistema espera palabras, y un sistema sesgado hacia encontrar habla encontrará habla.
- Las condiciones de grabación varían muchísimo. Los montajes con cámara en mano y un solo micrófono dan una relación entre voz y ruido muy por debajo del mínimo de la radiodifusión.
- Las ventanas de contexto son escasas. La MT resuelve la ambigüedad con las frases de alrededor. Aquí el diálogo son a menudo exclamaciones cortas y aisladas, sin apenas texto alrededor con el que desambiguar.
- El japonés omite el sujeto. Una frase japonesa gramaticalmente correcta a menudo no dice quién habla, a quién se dirige ni si el referente es singular. El inglés exige un pronombre, así que el traductor tiene que inventárselo, y elegirá un valor por defecto plausible y lo enunciará con total seguridad.
- Los honoríficos y el registro no tienen hueco en inglés. La información relacional que transporta el nivel de cortesía es de lo primero que se pierde.
Nada de esto lo resuelve un modelo de traducción mejor, porque nada de esto es un problema de traducción.
¿Qué tipos de error deberías esperar, y qué tan graves son?
Los errores se ordenan con nitidez según la fase que los produjo, y eso determina cuánto se pueden recuperar.
| Tipo de error | Se origina en | Cómo se ve en pantalla | Impacto en la comprensión |
|---|---|---|---|
| Diálogo inventado sobre audio no verbal | ASR | Aparecen líneas donde nadie habla | Bajo: es evidente y fácil de ignorar |
| Palabra mal oída convertida en texto fluido | ASR | Una frase gramatical que no encaja con la escena | Alto: invisible y verosímil |
| Nombres convertidos en palabras corrientes | ASR | El nombre de la persona sustituido por un sustantivo que suena parecido | Medio: confunde, pero se detecta |
| Género o número equivocado en el pronombre | MT | "Él" y "ella" se intercambian para la misma persona | Medio: chirría, pero suele deducirse |
| Honoríficos y registro aplanados | MT | Todo el mundo habla con el mismo tono neutro | Medio: el matiz relacional se pierde por completo |
| Modismo traducido al pie de la letra | MT | Una versión palabra por palabra que no significa nada | Bajo: se reconoce como un sinsentido |
| Juegos de palabras y chistes | MT | O literales, o sustituidos por algo sin relación | Alto: el chiste simplemente desaparece |
| Habla superpuesta reducida a una sola línea | ASR | Solo aparece quien habla más fuerte | Medio: pierdes el intercambio |
Las dos filas de impacto alto comparten una propiedad: no las puedes detectar solo con el subtítulo delante. Todo lo demás se delata solo. Una palabra mal oída convertida en un inglés fluido no lo hace, y por eso es lo que más importa.
¿Cuándo puedes fiarte de ellos y cuándo no?
Fíate para la continuidad y la situación; desconfía en cualquier punto donde el sentido sea determinante.
Razonable apoyarse en ellos para:
- Seguir quién está presente, qué ocurre y cómo avanza la escena
- El registro emocional general: acuerdo, negativa, duda
- Intercambios repetidos y formularios donde el contexto vuelve redundante el significado
- Decidir si una escena es la que buscabas
Mejor desconfiar de:
- Cualquier línea que parezca revelar un giro de la trama, una relación o una premisa
- Nombres, lugares, marcas y menciones a sellos
- Cualquier cosa presentada como un chiste o un juego de palabras
- Las líneas durante diálogos superpuestos o con mucho ruido de fondo
- Las señales de cortesía y de registro, si la relación entre las personas importa
- Los números y las horas, que el ASR reconoce mal con facilidad
Una regla práctica: si una sola línea de subtítulo cambia tu comprensión de la escena entera, trátala como no verificada. La información argumental de verdad tiende a repetirse o a mostrarse visualmente. Una revelación que aparece exactamente una vez, en una línea, y no vuelve a salir es más probable que sea un artefacto de la cadena que un punto del guion.
¿Cómo juzgas una pista rápidamente?
Mira los primeros minutos con estas cinco comprobaciones y la nota de la pista será evidente.
| Comprobación | Qué hace una pista mala |
|---|---|
| ¿Aparecen líneas durante los silencios o el audio no verbal? | Sí, con frecuencia |
| ¿El nombre de una persona se escribe igual todas las veces? | No: va cambiando o se vuelve un nombre común |
| ¿Los pronombres se mantienen coherentes para una misma persona? | No: saltan de una línea a otra |
| ¿Las líneas son todas cortas y de longitud parecida? | Sí: segmentación automática |
| ¿Los modismos se leen como un sinsentido literal? | Sí: no hay reescritura idiomática |
Dos o más de estas señales significan que estás viendo la salida de una cadena automatizada, y la calidad no va a mejorar más adelante. Conviene saberlo desde el principio, porque te dice cuánto peso puedes darle a cada línea durante la hora o las dos horas que quedan.
Preguntas relacionadas
- ¿De dónde salen los subtítulos de JAV y por qué su calidad es tan desigual?
- ¿Qué reproductor de video deberías usar?
- ¿Para qué sirve realmente cada sitio de base de datos de JAV?
- ¿Qué cambia realmente entre ver en móvil y en escritorio?
Qué plataformas ofrecen lanzamientos subtitulados varía muchísimo; mira lo que hemos indexado en la lista de sitios.