Skip to content
All terms

Clonage de voix

Le clonage de voix est une technique de synthèse audio qui crée une copie générée par ordinateur de la voix d'une personne spécifique à partir d'échantillons enregistrés.

Last checked

Le clonage de voix est une technique de synthèse audio qui crée une copie générée par ordinateur de la voix d'une personne spécifique à partir d'échantillons enregistrés. Le résultat reproduit le ton, la hauteur et les habitudes de parole de cette personne, de sorte qu'un nouvel audio parlé peut être produit avec sa voix sans qu'elle ait à l'enregistrer.

Pourquoi c'est important

Si vous ne savez pas ce qu'est le clonage de voix, vous pouvez mal juger ce que vous entendez dans une vidéo. Une narration qui ressemble à celle d'un vrai présentateur peut être une copie synthétique, ce qui change la façon dont vous évaluez la source : un extrait d'archives avec l'audio d'origine a une valeur probante différente d'une parole générée superposée à des images.

Cela affecte aussi les décisions de production. Si vous créez du contenu vidéo sans visage, vous devez décider si votre piste vocale est une identité clonée ou un narrateur synthétique neutre. Cloner une voix reconnaissable soulève des questions de consentement et de politique des plateformes ; une voix de narrateur générique ne comporte pas ces risques au même degré.

Un exemple

Une chaîne de true crime qui produit un Short sur une affaire a besoin d'une narration sur des images d'actualités d'archives. Avec la synthèse vocale, le script devient un audio dans une voix de narrateur standard. Avec le clonage de voix, le même script pourrait être rendu dans la voix d'une personne spécifique, par exemple un reporter dont les extraits d'archives apparaissent à l'écran. ViewMade utilise de vraies images sous licence avec un fichier de crédits média nommant la source de chaque extrait, et l'associe à une narration plutôt que de cloner la voix d'un individu.

Termes avec lesquels on confond cela

  • Text to speech : convertit du texte écrit en audio parlé en utilisant une voix générale, et non celle d'une personne spécifique.
  • AI voiceover : la pratique plus large de générer une narration avec l'IA, qui peut ou non utiliser une voix clonée.
  • Lip sync : aligne un audio existant avec le mouvement des lèvres à l'écran ; cela ne crée pas la voix elle-même.
  • Text to video : génère des visuels à partir d'une invite ; le clonage de voix ne concerne que la piste audio.