Skip to content
All terms

Lippensynchronisation

Lippen-Sync ist die Ausrichtung der Mundbewegungen eines Sprechers an eine Audiospur, sodass der Mund den gehörten Ton hervorzubringen scheint.

Last checked

Lip sync ist die Ausrichtung der Mundbewegungen eines Sprechers an eine Audiospur, sodass der Mund den gehörten Ton hervorzubringen scheint. Es gehört zur audiovisuellen Produktion und ist am wichtigsten, wenn ein aufgezeichnetes oder generiertes Gesicht auf dem Bildschirm sprechend gezeigt wird. Wenn die Synchronisation fehlschlägt, bemerken es die Zuschauer innerhalb von Sekunden und das Vertrauen in das Video sinkt.

Warum es wichtig ist

Ein Creator, der Lip sync nicht versteht, macht einen vorhersehbaren Fehler: Er nimmt an, dass jede Talking-Head-Aufnahme mit jedem Voiceover funktioniert. Das tut sie nicht. Wenn Sie einen Präsentator vor der Kamera aufnehmen und dann seine Stimme durch eine Text-to-Speech-Spur ersetzen, bewegt sich der Mund zur falschen Zeit und das Video wirkt gefälscht. Die Behebung kostet entweder eine Neuaufnahme, das Schneiden um das Gesicht herum oder die Wahl von Bildern, auf denen kein Mund sichtbar ist.

Die zweite falsche Entscheidung ist die Budgetierung für das falsche Werkzeug. Tools, die einen On-Camera-Präsentator generieren, müssen Lip sync als zentrales technisches Problem lösen, und diese Kosten stecken in ihren Preisen. Tools, die Aufnahmen ohne sichtbare Sprecher verwenden, etwa Archivmaterial, Karten oder Grafiken, umgehen das Problem vollständig. Zu wissen, in welche Kategorie ein Tool fällt, verrät Ihnen, ob Lip-sync-Qualität überhaupt Teil Ihrer Bewertung sein sollte.

Ein Beispiel

Betrachten Sie einen vertikalen Dokumentarfilm über ein Schiffsunglück, der aus echtem Archivmaterial aufgebaut ist. Die Erzählung ist ein synthetisiertes Voiceover, die Bilder sind historische Clips, Karten und Diagramme, und die Untertitel sind Wort für Wort ins Bild eingebrannt. Kein Gesicht auf dem Bildschirm spricht, also gibt es nichts zu synchronisieren. Dasselbe Skript durch ein Tool geleitet, das einen KI-Präsentator generiert, würde erfordern, dass jede Sekunde der Mundbewegung des Präsentators mit der Erzählung übereinstimmt, und jedes Abweichen wäre sichtbar. Deshalb können sich zwei Tools mit ähnlicher Ausgabelänge stark in der Produktionskomplexität unterscheiden: eines muss Lip sync lösen, das andere stößt nie darauf.

Begriffe, mit denen man das verwechselt

  • Text to video: Video aus einem schriftlichen Prompt generieren; Lip sync wird nur relevant, wenn die Ausgabe ein sprechendes Gesicht enthält.
  • Text to speech: geschriebenen Text in gesprochenes Audio umwandeln; dies erzeugt die Stimme, sagt aber nichts darüber aus, wie sie einem Mund zugeordnet wird.
  • AI voiceover: eine synthetisierte Erzählspur; in dokumentarischen Videos läuft sie über Aufnahmen, auf denen niemand sichtbar spricht, daher gilt Lip sync nicht.
  • Voice cloning: die Stimme einer bestimmten Person reproduzieren; wenn diese geklonte Stimme einen On-Camera-Avatar antreibt, wird Lip sync zum schwierigen Teil.