Comment Traduire une Vidéo (son & sous-titre) avec Claude Code ou Codex

J’utilise principalement l’IA pour mes projets de traduction. On trouve beaucoup de vidéos chinoises sur YouTube, TikTok ou Facebook qui ne proposent pas de sous-titre automatique ni de traduction automatique.

Puisque je veux les comprendre, j’ai créé un projet capable d’automatiser une grande partie du processus : transcrire la vidéo, traduire les sous-titres et, si besoin, aller jusqu’au doublage automatique en français.

À partir de cette même base, il est également possible de créer automatiquement des clippings, c’est-à-dire des extraits courts de la vidéo.

Dans cet article, je prends comme exemple la traduction chinois → français. Mais le principe peut être adapté à pratiquement toutes les langues. Je vous encourage vivement à utiliser Claude Code ou Codex CLI – en ligne de commande.

Pourquoi utiliser la transcription plutôt que l’OCR ?

Les vidéos chinoises ont souvent des sous-titres chinois directement incrustés dans l’image. On pourrait donc utiliser de l’OCR (reconnaissance de texte dans une image) pour récupérer ces sous-titres.

Après plusieurs essais, je me suis cependant rendu compte que cette méthode était assez longue et compliquée. Il est finalement plus simple de partir directement de la parole présente dans la vidéo et de la transformer en texte grâce à un système de transcription automatique, appelé ASR (Automatic Speech Recognition).

Le principe est donc assez simple :

Vidéo → transcription chinoise → correction → traduction française → sous-titres français → éventuellement doublage

Préparer le skill

Pour automatiser ce processus, je recommande de préparer à l’avance quelques fichiers de référence dans le skill. Ils contiennent les règles que les agents doivent respecter. Cela permet de modifier facilement le comportement du système sans devoir réécrire tout le workflow.

references/
├── translation_rules.md   # règles de traduction
├── glossary_zh_fr.md      # noms propres et termes récurrents
├── formatting_rules.md    # règles d’affichage des sous-titres
└── quality_check.md       # contrôles qualité

Ces fichiers peuvent être préparés avec l’aide de l’IA. Je conseille simplement de lui demander de proposer plusieurs variantes ou quelques exemples de traduction, puis de choisir le ton et les règles qui vous conviennent.

Pour éviter de surcharger la session principale avec le texte de toute la vidéo, le workflow peut ensuite utiliser des agents autonomes. Chaque agent ne reçoit que les informations et les fichiers de référence dont il a besoin. Par exemple, un agent peut s’occuper de la transcription, un autre de la traduction et un autre du contrôle qualité. La session principale sert surtout à orchestrer les différentes étapes.

Le processus complet

1. Transformer la parole chinoise en sous-titres

On commence par récupérer la vidéo originale. Pour YouTube, Facebook ou TikTok, on peut utiliser yt-dlp.

On utilise ensuite un système de reconnaissance vocale (ASR) pour transformer la parole chinoise en texte. Le résultat est un fichier de sous-titres .srt contenant le texte chinois et les horaires de début et de fin de chaque segment.

On peut notamment utiliser :

  • faster-whisper (medium)
  • Qwen3-ASR ForcedAligner

Pour le chinois, je préfère Qwen3-ASR. Il permet notamment de fournir du contexte avant la transcription, ce qui peut aider le modèle à choisir le bon caractère lorsque plusieurs mots se prononcent de la même manière.

Si vous prévoyez ensuite de faire du doublage ou des clippings, activez également l’horodatage au niveau des mots. Vous aurez ainsi un alignement beaucoup plus précis entre le texte et la voix.

2. Récupérer les passages qui n’ont pas été transcrits

Une transcription automatique n’est pas toujours parfaite. La présence de musique, par exemple, peut perturber l’ASR. Le système peut parfois considérer un passage comme de la musique ou du chant et ne pas transcrire correctement la parole.

Pour repérer ces problèmes, on peut rechercher dans le fichier SRT les trous anormalement longs entre deux sous-titres.

Pour chaque passage manquant :

  1. on récupère le passage correspondant avec ffmpeg ;
  2. on le réécoute ;
  3. on relance une transcription uniquement sur ce passage.

Cela permet de compléter la transcription sans devoir retraiter toute la vidéo.

3. Corriger la transcription chinoise

L’ASR peut faire des erreurs, notamment avec les homophones : le modèle reconnaît correctement le son, mais choisit le mauvais caractère ou le mauvais mot chinois.

On relit donc les passages suspects et on corrige la transcription avant de commencer la traduction.

Une mauvaise transcription entraîne généralement une mauvaise traduction. Cette étape mérite donc une attention particulière.

4. Traduire le chinois en français

Une fois la transcription chinoise corrigée, elle est découpée en segments. Les segments sont ensuite traités par un agent autonome spécialisé dans la traduction.

L’agent consulte notamment les fichiers de référence du skill pour respecter les règles définies à l’avance :

  • niveau de langue et registre ;
  • français naturel plutôt que traduction mot à mot ;
  • traduction des noms propres ;
  • termes récurrents du glossaire ;
  • règles spécifiques aux dialogues.

Les traductions sont ensuite assemblées tout en conservant les horodatages du fichier chinois. Pour les longues vidéos, il est préférable de travailler un segment à la fois. Les agents autonomes peuvent ainsi traiter le texte sans saturer le contexte de la session principale.

5. Vérifier et nettoyer la traduction

Une fois la traduction terminée, on effectue plusieurs contrôles automatiques :

  • aucun caractère chinois ne doit rester dans le fichier français ;
  • le format SRT doit être valide ;
  • les horaires doivent être cohérents ;
  • le registre doit rester homogène ;
  • la traduction doit rester cohérente du début à la fin.

Un autre agent peut ensuite effectuer une relecture critique chinois ↔ français. Son rôle est de rechercher les contresens, les omissions et les traductions qui changent le sens original. Cette vérification est particulièrement utile lorsque la traduction a été réalisée segment par segment : elle permet de s’assurer que l’ensemble reste cohérent.

Enfin, on prépare les sous-titres pour leur affichage à l’écran :

  1. on découpe le texte à des endroits naturels ;
  2. on répartit le texte sur une ou deux lignes ;
  3. on vérifie la longueur et la lisibilité ;
  4. on s’assure qu’aucun mot n’a été perdu.

Le fichier chinois original est conservé comme référence afin de pouvoir comparer les deux versions.

6. Le résultat final

Le résultat principal est un fichier :

video.fr.srt

Il contient les sous-titres français avec leurs horaires.

À partir de ce fichier, on peut ensuite :

  • graver les sous-titres français dans la vidéo avec ffmpeg ;
  • générer une version doublée en français (text-to-speech, avec les voix gratuites d’Edge ou Mac) ;
  • créer automatiquement des clippings ou extraits vidéo à partir des sous-titres et de leurs timestamps.

En résumé

Le workflow complet peut être résumé ainsi :

Vidéo chinoise → transcription → correction → traduction → contrôle qualité → sous-titres français → doublage / clippings

L’intérêt de cette organisation est de séparer clairement les différentes tâches et de laisser les agents autonomes traiter les parties les plus volumineuses. La session principale reste ainsi légère et se concentre sur l’orchestration du workflow.

Comment créer un bot Telegram avec Claude Code ou Codex (guide Débutant)
Tour du Monde 2016-2026 : Notre Itinéraire
    Anh

    Anh est franco-vietnamienne et a vécu dans de nombreux pays (Russie, Australie, France, Norvège, Vietnam). Elle aime par dessus tout les chats, le DIY et la bonne cuisine. Ayant une très bonne mémoire, Anh est capable de vous donner le tarif du petit bus pris entre le Chili et la Bolivie qu'elle a pris il y a 3 ans.

    Tous Mes Articles
    Write a comment

    Ce site utilise Akismet pour réduire les indésirables. En savoir plus sur la façon dont les données de vos commentaires sont traitées.