Skip to content
All terms

Voice Cloning

Voice Cloning ist eine Technik der Audiosynthese, die aus aufgenommenen Sprachproben eine computergenerierte Kopie der Stimme einer bestimmten Person erstellt.

Last checked

Voice Cloning ist eine Technik innerhalb der Audiosynthese, die aus aufgenommenen Sprachproben eine computergenerierte Kopie der Stimme einer bestimmten Person erstellt. Das Ergebnis gibt Tonlage, Stimmhöhe und Sprechmuster dieser Person wieder, sodass neue gesprochene Audioinhalte in ihrer Stimme erzeugt werden können, ohne dass sie diese selbst aufnimmt.

Warum das wichtig ist

Wenn Sie nicht wissen, was Voice Cloning ist, können Sie falsch einschätzen, was Sie in einem Video hören. Eine Erzählung, die wie ein echter Moderator klingt, kann eine synthetische Kopie sein, und das verändert Ihre Bewertung der Quelle: Ein Archivclip mit Originalaudio hat ein anderes Beweisgewicht als generierte Sprache, die über Aufnahmen gelegt wurde.

Es wirkt sich auch auf Produktionsentscheidungen aus. Wenn Sie Faceless-Videocontent erstellen, müssen Sie entscheiden, ob Ihre Tonspur eine geklonte Identität oder ein neutraler synthetischer Erzähler ist. Das Klonen einer wiedererkennbaren Stimme wirft Fragen zu Einwilligung und Plattformrichtlinien auf; eine generische Erzählerstimme birgt diese Risiken nicht im selben Maße.

Ein Beispiel

Ein True-Crime-Kanal, der einen Short über einen Fall produziert, braucht eine Erzählung über Archivaufnahmen von Nachrichtensendungen. Mit Text-to-Speech wird das Skript zu Audio in einer Stock-Erzählerstimme. Mit Voice Cloning könnte dasselbe Skript in der Stimme einer bestimmten Person wiedergegeben werden, zum Beispiel eines Reporters, dessen Archivclips auf dem Bildschirm erscheinen. ViewMade verwendet lizenziertes echtes Filmmaterial mit einer Media-Credits-Datei, die die Quelle jedes Clips nennt, und kombiniert es mit einer Erzählung, anstatt die Stimme einer einzelnen Person zu klonen.

Begriffe, die damit verwechselt werden

  • Text to Speech: wandelt geschriebenen Text in gesprochenes Audio um, wobei eine allgemeine Stimme verwendet wird, nicht die einer bestimmten Person.
  • AI Voiceover: die weiter gefasste Praxis, Erzählungen mit KI zu generieren, bei der eine geklonte Stimme verwendet werden kann, aber nicht muss.
  • Lip Sync: richtet vorhandenes Audio an der Mundbewegung auf dem Bildschirm aus; es erzeugt die Stimme selbst nicht.
  • Text to Video: generiert visuelle Inhalte aus einem Prompt; Voice Cloning betrifft nur die Tonspur.