Sincronización labial
La sincronización labial es la alineación de los movimientos de la boca de una persona con una pista de audio, de modo que la boca parezca producir el sonido que se escucha.
Last checked
La sincronización labial es la alineación de los movimientos de la boca de una persona con una pista de audio, de modo que la boca parezca producir el sonido que se escucha. Pertenece a la producción audiovisual y tiene mayor importancia cuando se muestra en pantalla un rostro grabado o generado que habla. Cuando la sincronización falla, los espectadores lo notan en segundos y la confianza en el video cae.
Por qué importa
Un creador que no entiende la sincronización labial comete un error predecible: asume que cualquier metraje de una persona hablando funcionará con cualquier locución. No funcionará. Si grabas a un presentador en cámara y luego reemplazas su voz con una pista de texto a voz, la boca se mueve en los momentos equivocados y el video parece falso. La solución cuesta volver a grabar, editar evitando el rostro, o elegir visuales donde no se vea ninguna boca.
La segunda decisión equivocada es presupuestar para la herramienta incorrecta. Las herramientas que generan un presentador en cámara deben resolver la sincronización labial como un problema técnico central, y ese costo está reflejado en sus precios. Las herramientas que usan metraje sin oradores visibles, como material de archivo, mapas o gráficos, evitan el problema por completo. Saber en qué categoría cae una herramienta te dice si la calidad de la sincronización labial debería formar parte de tu evaluación.
Un ejemplo
Considera un documental vertical sobre un desastre marítimo construido a partir de metraje real de archivo. La narración es una locución sintetizada, los visuales son clips históricos, mapas y gráficos, y los subtítulos están incrustados en el fotograma palabra por palabra. Ningún rostro en pantalla habla, así que no hay nada que sincronizar. El mismo guion pasado por una herramienta que genera un presentador de IA necesitaría que cada segundo del movimiento de la boca del presentador coincidiera con la narración, y cualquier desviación sería visible. Por eso dos herramientas con duraciones de salida similares pueden diferir mucho en complejidad de producción: una tiene que resolver la sincronización labial, la otra nunca se topa con ella.
Términos con los que la gente confunde esto
- Texto a video: generar video a partir de un texto escrito; la sincronización labial solo resulta relevante si la salida incluye un rostro que habla.
- Texto a voz: convertir texto escrito en audio hablado; esto produce la voz pero no dice nada sobre cómo hacerla coincidir con una boca.
- Locución de IA: una pista de narración sintetizada; en videos estilo documental suena sobre metraje donde nadie está hablando visiblemente, así que la sincronización labial no aplica.
- Clonación de voz: reproducir la voz de una persona específica; si esa voz clonada impulsa un avatar en cámara, la sincronización labial se vuelve la parte difícil.