Clonación de voz
La clonación de voz es una técnica dentro de la síntesis de audio que crea una copia generada por computadora de la voz de una persona específica a partir de muestras grabadas.
Last checked
La clonación de voz es una técnica dentro de la síntesis de audio que crea una copia generada por computadora de la voz de una persona específica a partir de muestras grabadas. El resultado reproduce el tono, el timbre y los patrones de habla de esa persona, de modo que se puede producir nuevo audio hablado con su voz sin que ella lo grabe.
Por qué importa
Si no sabes qué es la clonación de voz, puedes juzgar mal lo que escuchas en un video. Una narración que suena como un presentador real puede ser una copia sintética, lo cual cambia cómo evalúas la fuente: un clip de archivo con audio original tiene un peso probatorio distinto al de un discurso generado sobre imágenes.
También afecta las decisiones de producción. Si creas contenido de video sin rostro, necesitas decidir si tu pista de voz es una identidad clonada o un narrador sintético neutro. Clonar una voz reconocible plantea preguntas de consentimiento y de políticas de plataforma; una voz de narrador genérica no conlleva esos riesgos en el mismo grado.
Un ejemplo
Un canal de crimen real que produce un Short sobre un caso necesita narración sobre material noticioso de archivo. Con texto a voz, el guion se convierte en audio con una voz de narrador genérica. Con clonación de voz, el mismo guion podría renderizarse con la voz de una persona específica, por ejemplo un reportero cuyos clips de archivo aparecen en pantalla. ViewMade usa material real con licencia junto con un archivo de créditos mediáticos que indica la fuente de cada clip, y lo combina con narración en lugar de clonar la voz de ninguna persona.
Términos con los que se suele confundir
- Texto a voz: convierte texto escrito en audio hablado usando una voz general, no la de una persona específica.
- Locución con IA: la práctica más amplia de generar narración con IA, que puede usar o no una voz clonada.
- Sincronización labial: alinea audio existente con el movimiento de la boca en pantalla; no crea la voz en sí.
- Texto a video: genera visuales a partir de un prompt; la clonación de voz concierne solo a la pista de audio.