Les sous-titres traduits automatiquement sont assez bons pour ce que la plupart des spectateurs veulent vraiment : suivre la situation, les rôles et le fil général d'une conversation. Ils ne sont pas assez bons pour tout ce qui dépend de la formulation précise d'une réplique.
Cette coupure n'est pas une précaution oratoire. C'est la conséquence directe de la manière dont la chaîne est bâtie : deux étapes automatisées en série, où les erreurs de la première deviennent l'entrée de la seconde, et où la seconde n'a aucun moyen de savoir qu'elle traduit quelque chose qui n'a jamais été dit.
Que se passe-t-il réellement quand des sous-titres sont générés automatiquement ?
Deux systèmes distincts s'enchaînent, et ils ne se répondent pas.
La première étape est la reconnaissance automatique de la parole (ASR). Elle convertit la piste audio en texte japonais avec des repères temporels. C'est l'étape difficile pour ce type de matériel, et c'est là que se produit l'essentiel des dégâts.
La deuxième étape est la traduction automatique (MT). Elle prend ce texte japonais et produit de l'anglais. La traduction automatique moderne y est réellement bonne — sur une entrée propre et correcte.
Le problème, c'est l'interface entre les deux. La deuxième étape reçoit du texte, pas de l'audio. Elle ne peut pas entendre que la première a deviné. Un mot mal entendu arrive avec exactement l'apparence d'un mot correctement entendu, et la traduction automatique fait ce pour quoi elle est faite : produire une sortie fluide et grammaticale. Le résultat est une phrase qui se lit parfaitement et qui signifie quelque chose qui n'a jamais été dit.
Pourquoi ce matériel est-il plus difficile que l'audio sur lequel ces systèmes sont réglés ?
Parce que la reconnaissance vocale est entraînée et évaluée pour l'essentiel sur de l'audio de diffusion, de cours et de réunions, et que la vidéo pour adultes viole presque toutes les hypothèses que ce matériel encode.
- Les voix se chevauchent. L'ASR est bâtie autour de l'alternance des tours de parole. La parole simultanée s'effondre soit en une seule réplique, soit en un mélange des deux.
- Une grande partie de l'audio est non verbale. Souffles et vocalises occupent l'espace acoustique où le système attend des mots, et un système biaisé vers la détection de parole trouvera de la parole.
- Les conditions d'enregistrement varient énormément. Les tournages à l'épaule et à micro unique produisent un rapport parole/bruit très inférieur à la référence de diffusion.
- Les fenêtres de contexte sont pauvres. La traduction automatique lève les ambiguïtés grâce aux phrases voisines. Le dialogue est ici souvent fait d'exclamations courtes et isolées, avec presque aucun texte alentour pour trancher.
- Le japonais omet le sujet. Une phrase japonaise grammaticalement correcte omet fréquemment qui parle, à qui l'on s'adresse et si le référent est au singulier. L'anglais exige un pronom, le traducteur doit donc en inventer un — et il choisira une valeur par défaut plausible qu'il affirmera sans la moindre hésitation.
- Les formules de politesse et le registre n'ont pas d'équivalent en anglais. L'information relationnelle portée par le niveau de langue fait partie des toutes premières choses perdues.
Aucun de ces points n'est résolu par un meilleur modèle de traduction, parce qu'aucun n'est un problème de traduction.
À quels types d'erreurs vous attendre, et quelle gravité pour chacune ?
Les erreurs se trient nettement selon l'étape qui les a produites, et cela détermine à quel point elles sont rattrapables.
| Type d'erreur | Vient de | Aspect à l'écran | Effet sur la compréhension |
|---|---|---|---|
| Dialogue inventé sur de l'audio non verbal | ASR | Des répliques apparaissent alors que personne ne parle | Faible — visible, facile à ignorer |
| Mot mal entendu rendu avec fluidité | ASR | Une phrase grammaticale qui ne colle pas à la scène | Fort — invisible, et plausible |
| Noms propres transformés en mots courants | ASR | Le nom d'une personne remplacé par un nom commun à la sonorité proche | Moyen — déroutant mais détectable |
| Mauvais genre ou nombre du pronom | MT | « Il » et « elle » alternent pour la même personne | Moyen — désagréable, en général déductible |
| Politesse et registre aplatis | MT | Tout le monde parle sur le même ton neutre | Moyen — nuance relationnelle entièrement perdue |
| Expression idiomatique traduite au mot à mot | MT | Un rendu mot à mot qui ne veut rien dire | Faible — reconnaissable comme un non-sens |
| Jeux de mots et calembours | MT | Soit littéraux, soit remplacés par autre chose sans rapport | Fort — la blague a simplement disparu |
| Paroles superposées réduites à une seule réplique | ASR | Seule la voix la plus forte apparaît | Moyen — vous perdez l'échange |
Les deux lignes à fort impact ont un point commun : vous ne pouvez pas les détecter à partir du seul sous-titre. Tout le reste se signale de soi-même. Un mot mal entendu rendu en anglais fluide, non — et c'est exactement pour cela qu'il pèse le plus lourd.
Quand pouvez-vous leur faire confiance, et quand non ?
Faites-leur confiance pour la continuité et la situation ; méfiez-vous partout où le sens porte le récit.
Raisonnable de s'y fier :
- Suivre qui est présent, ce qui se passe et comment la scène progresse
- Le registre émotionnel général — accord, refus, hésitation
- Les échanges répétitifs et formulaires, où le contexte rend le sens redondant
- Décider si une scène est bien celle que vous cherchiez
À prendre avec méfiance :
- Toute réplique qui semble révéler un élément d'intrigue, une relation ou une prémisse
- Les noms, les lieux, les marques et les références de label
- Tout ce qui est présenté comme une blague ou un jeu de mots
- Les répliques prononcées pendant un chevauchement de voix ou un fort bruit de fond
- Les marques de politesse et de registre, si la relation entre les personnes compte
- Les nombres et les heures, que l'ASR reconnaît très mal
Une règle pratique : si une seule ligne de sous-titre change votre compréhension de toute la scène, tenez-la pour non vérifiée. Une véritable information d'intrigue tend à être redite ou montrée visuellement. Une révélation qui apparaît une fois exactement, sur une seule ligne, et ne revient jamais, est plus probablement un artefact de la chaîne qu'un point de scénario.
Comment juger rapidement une piste ?
Regardez les premières minutes en faisant ces cinq contrôles, et le niveau de la piste sautera aux yeux.
| Contrôle | Ce que fait une piste faible |
|---|---|
| Des répliques apparaissent-elles pendant les silences ou l'audio non verbal ? | Oui, souvent |
| Le nom d'une personne est-il écrit de la même façon à chaque fois ? | Non — il dérive ou devient un nom commun |
| Les pronoms restent-ils cohérents pour une même personne ? | Non — ils basculent d'une ligne à l'autre |
| Les répliques sont-elles uniformément courtes et de taille voisine ? | Oui — découpage automatique |
| Les expressions idiomatiques se lisent-elles comme des non-sens littéraux ? | Oui — aucune réécriture idiomatique |
Deux de ces signes ou plus, et vous regardez la sortie d'une chaîne automatisée ; la qualité ne s'améliorera pas plus tard dans le film. Cela vaut la peine de le savoir d'entrée, parce que cela vous dit quel poids accorder à chaque réplique pendant l'heure ou les deux heures qui restent.
Questions liées
- D'où viennent les sous-titres JAV, et pourquoi la qualité est-elle si inégale ?
- Quel lecteur vidéo utiliser ?
- À quoi chaque site de base de données JAV est-il vraiment bon ?
- Qu'est-ce qui change vraiment entre le visionnage mobile et sur ordinateur ?
Les plateformes qui proposent des sorties sous-titrées varient beaucoup — voyez ce que nous avons indexé sur la liste des sites.