Skip to content
All terms

Synchronisation labiale

La synchronisation labiale est l'alignement des mouvements de la bouche d'un locuteur sur une piste audio, de sorte que la bouche semble produire le son entendu.

Last checked

La synchronisation labiale est l'alignement des mouvements de la bouche d'un locuteur sur une piste audio, de sorte que la bouche semble produire le son entendu. Elle relève de la production audiovisuelle et compte le plus lorsqu'un visage enregistré ou généré est montré en train de parler à l'écran. Quand la synchronisation échoue, les spectateurs s'en aperçoivent en quelques secondes et la confiance dans la vidéo chute.

Pourquoi c'est important

Un créateur qui ne comprend pas la synchronisation labiale commet une erreur prévisible : il suppose que n'importe quelle séquence de visage parlant fonctionnera avec n'importe quelle voix off. Ce n'est pas le cas. Si vous filmez un présentateur puis remplacez sa voix par une piste de synthèse vocale, la bouche bouge au mauvais moment et la vidéo paraît fausse. La correction coûte soit un réenregistrement, soit un montage qui évite le visage, soit le choix de visuels où aucune bouche n'est visible.

La deuxième mauvaise décision est de budgéter pour le mauvais outil. Les outils qui génèrent un présentateur à l'écran doivent résoudre la synchronisation labiale comme un problème technique central, et ce coût se retrouve dans leurs tarifs. Les outils qui utilisent des séquences sans locuteur visible, comme des images d'archives, des cartes ou des graphiques, évitent entièrement le problème. Savoir dans quelle catégorie se situe un outil vous dit si la qualité de la synchronisation labiale doit même faire partie de votre évaluation.

Un exemple

Prenons un documentaire vertical sur un naufrage construit à partir de véritables images d'archives. La narration est une voix off synthétisée, les visuels sont des extraits historiques, des cartes et des graphiques, et les sous-titres sont incrustés dans l'image mot par mot. Aucun visage à l'écran ne parle, donc il n'y a rien à synchroniser. Le même script passé dans un outil qui génère un présentateur IA exigerait que chaque seconde du mouvement de la bouche du présentateur corresponde à la narration, et le moindre décalage serait visible. C'est pourquoi deux outils aux durées de sortie similaires peuvent différer fortement en complexité de production : l'un doit résoudre la synchronisation labiale, l'autre ne la rencontre jamais.

Termes avec lesquels on confond ce concept

  • Text to video : générer une vidéo à partir d'une consigne écrite ; la synchronisation labiale ne devient pertinente que si le résultat inclut un visage qui parle.
  • Text to speech : convertir du texte écrit en audio parlé ; cela produit la voix mais ne dit rien de son alignement avec une bouche.
  • AI voiceover : une piste de narration synthétisée ; dans les vidéos de style documentaire, elle passe sur des images où personne ne parle visiblement, donc la synchronisation labiale ne s'applique pas.
  • Voice cloning : reproduire la voix d'une personne précise ; si cette voix clonée anime un avatar à l'écran, la synchronisation labiale devient la partie difficile.