Cómo doblar un vídeo con varios hablantes
Las entrevistas y pódcasts son el reto más difícil para el doblaje con IA. Descubre qué pasa con las voces superpuestas y cómo solucionarlo.
Tener varios hablantes no es ningún problema. El verdadero obstáculo es cuando hablan a la vez, y este es un reto muy distinto al que la mayoría de la gente imagina.
Antes de producir cualquier resultado en otro idioma, nuestro pipeline de doblaje tiene que descifrar qué se ha dicho, quién lo ha dicho y dónde termina una persona y empieza la siguiente. Cuando los turnos de palabra están claros, el sistema lo resuelve sin problemas. Sin embargo, las voces superpuestas arruinan este proceso por completo: al coincidir dos voces en el mismo instante, estas se mezclan físicamente en el archivo, y ningún procesamiento posterior puede separar del todo lo que nunca estuvo separado.
Por tanto, la pregunta útil no es "¿puede procesar a dos personas?", sino "¿cuántas partes de tu audio tienen a dos personas hablando simultáneamente?".
¿Qué pasa con las voces superpuestas?
Se producen errores en cadena que no se quedan en un único sitio.
Cuando las voces se superponen, la transcripción que sirve de base tiene que decidir a quién pertenece cada palabra. Si se equivoca ahí, la traducción heredará el error y el audio generado volverá a arrastrarlo, por lo que una frase terminará asignada al hablante equivocado en el resultado final. Para el oyente, esto resulta mucho más chocante que una traducción imperfecta, ya que el contenido pasa a ser erróneo y no simplemente aproximado.
Las interrupciones son el caso más habitual y, en cierto sentido, resultan peores que una conversación cruzada continua: son tan breves que no solemos verlas como una superposición. Que un presentador diga "claro, claro" de fondo mientras el invitado responde es una superposición de voces. También lo son las risas sobre un chiste, o esa fracción de segundo en la que alguien empieza a hablar antes de que la otra persona haya terminado.
El número de hablantes importa menos de lo que crees. Un archivo con cuatro personas que respetan sus turnos de palabra es mucho más fácil de procesar que uno con dos personas que se pisan constantemente.
¿Se puede indicar cuántos hablantes hay?
No, y eso descarta una solución que la gente suele pedir.
Nosotros enviamos tres elementos: el archivo, el idioma de destino y un único parámetro de configuración. Tres argumentos entre los que no se incluye el número de hablantes, por lo que no hay forma de indicarlo. El modelo decide cuántas voces hay presentes y cómo gestionarlas, y nosotros no podemos anular esa decisión en tu nombre.
Además, no hay ningún proceso posterior. El doblaje se ejecuta de forma completamente automática de principio a fin y nada se edita a mano una vez terminado, algo que indicamos claramente en nuestra página de asistencia. Por eso, no podemos reasignar una frase atribuida al hablante equivocado aunque nos lo pidas, ni parchear una sección donde las voces se hayan mezclado.
Esta es la realidad técnica de esta limitación: lo único que puedes controlar es el archivo que subes.
¿Qué puedes corregir antes de subir el archivo?
Bastantes cosas, siempre que aún conserves el proyecto de edición original y no solo el archivo exportado.
Usa pistas independientes si dispones de ellas. Una entrevista en remoto grabada con una plataforma que guarde el audio de cada participante por separado te proporcionará voces aisladas. Este es el mejor material de origen posible, y merece la pena comprobar si tu configuración de grabación ya lo genera antes de dar por hecho que solo tienes la mezcla final.
Elimina las voces cruzadas que no aporten nada. Los ruidos de asentimiento, como los "sí, claro" o "ajá" de fondo mientras otra persona habla, no aportan contenido y provocan superposiciones. Eliminarlos en edición no cuesta nada y quita de en medio los momentos más difíciles de procesar.
Divide el archivo según los turnos de palabra si la conversación lo permite. Doblar una entrevista larga en fragmentos que contengan a un solo hablante evita el problema por completo. Eso sí, tiene un coste real: cada fragmento se considera un trabajo independiente con su propio cargo, y el consumo se redondea al minuto completo por archivo. Por ejemplo, una entrevista de 50 minutos dividida en doce fragmentos de 4 minutos y 10 segundos consumirá 60 créditos, mientras que procesar el mismo audio en un solo archivo consumirá 50.
Acondiciona la sala, no intentes arreglar el archivo. La reverberación desibuja los límites entre un hablante y el siguiente, y no se puede eliminar después de la grabación. Si produces contenido que sabes que vas a doblar, esta es una razón de peso para cuidar acústicamente tu espacio de grabación.
Nuestra guía general para preparar el audio de origen antes de doblarlo explica el resto de recomendaciones para el material de entrada, incluyendo por qué aplicar compresión de forma anticipada suele ser contraproducente.
¿Qué puedes esperar de un archivo difícil?
Las expectativas varían según el tipo de contenido, ya que los resultados cambian mucho entre los 32 idiomas a los que doblamos y según el formato.
Un guion a dos voces con turnos de palabra bien definidos suele salir muy bien. Una mesa redonda moderada con un presentador disciplinado ofrece un resultado bastante aceptable. Un pódcast dinámico en el que dos amigos se pisan constantemente al hablar es lo más difícil que le puedes entregar a cualquier sistema de doblaje, y ninguna campaña de marketing de la competencia te lo va a decir. La duración raras veces es el factor limitante en estos contenidos: aceptamos hasta 180 minutos y 2 GB por archivo, lo que cubre prácticamente cualquier episodio.
Este último caso no es del todo imposible, pero es en el que más deberías hacer una prueba antes de procesar todo un catálogo.
Y hacer esta prueba es muy barato: procesa un solo episodio a un idioma de destino y escucha los dos peores minutos que encuentres, no los mejores.
Si la prueba no genera ningún resultado, el trabajo se reembolsa de forma automática. Cualquier trabajo que falle, o que alcance el límite de tiempo de seis horas sin generar un archivo, te devolverá los créditos automáticamente sin que tengas que pedirlo. Lo que no es reembolsable es un trabajo que finalice correctamente pero produzca un doblaje mediocre, ya que el pipeline no tiene forma de clasificar eso como un fallo. El proceso se ejecutó, generó el archivo y se te cobró.
Así pues, la prueba solo te costará los créditos de un episodio y te confirmará si el formato funciona antes de gastar saldo en veinte. Eso sí, descárgalo el mismo día que esté listo: un doblaje terminado permanece disponible durante 90 días y después se elimina de forma permanente.
¿Empeora el problema de la duración al haber más hablantes?
El mecanismo es el mismo, pero el dinamismo de una conversación lo hace más evidente.
El habla traducida rara vez dura lo mismo que la original. En un monólogo, este desajuste se acumula de forma gradual.
En cambio, en un diálogo se manifiesta como un desfase temporal que deja de encajar con los turnos de palabra, lo cual se nota mucho más porque los oyentes siguen con gran precisión el ritmo de la conversación. Nuestra guía sobre por qué el audio doblado se desincroniza analiza la causa de fondo y lo que realmente ayuda a solucionarlo.
Qué leer a continuación
El contenido de entrevistas y mesas redondas es habitual en las comunicaciones internas corporativas, donde la sincronización suele ser menos crítica que en los vídeos que se publican: el doblaje de español a neerlandés para vídeos corporativos analiza este caso concreto, mientras que el doblaje de español a árabe para YouTube cubre el ámbito de los vídeos publicados. Tienes más opciones en nuestro índice de casos de uso.
Preguntas frecuentes
¿Puede el doblaje con IA gestionar varios hablantes?
Sí, y si los turnos de palabra están claros, funciona bien incluso con varias personas. El habla simultánea es la parte difícil, ya que las voces que coinciden en el tiempo se mezclan en el archivo y separarlas resulta muy complejo. Un archivo con cuatro personas que respetan sus turnos de palabra es más fácil que uno con dos que se interrumpen constantemente.
¿Puedo indicarle al sistema cuántos hablantes hay?
No. Al enviar el trabajo solo se incluye el archivo, el idioma de destino y un parámetro de configuración, sin especificar el número de hablantes, por lo que el modelo lo determina por sí mismo. Tampoco se realiza ninguna corrección manual a posteriori.
¿Cómo debería doblar una entrevista o un pódcast con dos presentadores?
Usa pistas independientes para cada participante si tu sistema de grabación las ha guardado. Si no es posible, elimina los ruidos y comentarios de fondo que se crucen en la conversación, y valora la opción de dividir el archivo en función de los turnos de palabra. Ten en cuenta que cada fragmento contará como un trabajo independiente y que el consumo se redondea por archivo, por lo que dividir el audio te costará más que subir un único archivo continuo.
¿Qué pasa si el resultado no es bueno?
Un trabajo que falle por completo se reembolsa de forma automática. En cambio, un trabajo que finalice de forma correcta pero genere un doblaje mediocre no se reembolsa, ya que ningún elemento del pipeline puede clasificar ese resultado como un fallo. Por eso, merece la pena gastar los créditos de un solo episodio para hacer una prueba antes de comprometer toda una serie.