Solução de problemas 7 min de leitura

Como dublar vídeos com várias pessoas falando com IA

Saiba como a dublagem com IA lida com várias pessoas, falas sobrepostas e entrevistas, e o que preparar no seu áudio antes do envio.

Ter várias pessoas no áudio não é um problema. O verdadeiro problema é quando várias pessoas falam ao mesmo tempo, e esse é um desafio diferente do que a maioria espera.

Um pipeline de dublagem precisa identificar o que foi dito, quem falou e onde termina a fala de uma pessoa e começa a da outra, antes mesmo de gerar qualquer conteúdo em outro idioma. Quando cada um fala na sua vez, o sistema consegue resolver esses três pontos facilmente. Falas sobrepostas eliminam essa clareza de uma só vez, porque duas vozes no mesmo instante estão fisicamente misturadas no arquivo, e nenhum processamento separa totalmente o que nunca esteve separado.

Portanto, a pergunta útil não é "o sistema aguenta duas pessoas?", mas sim "quanto do seu áudio tem duas pessoas falando simultaneamente?".

O que acontece com falas sobrepostas?

Ocorrem erros que se acumulam em vez de ficarem isolados.

Onde há sobreposição de vozes, a transcrição precisa decidir quais palavras pertencem a quem. Se essa etapa falhar, a tradução herda o erro, o áudio gerado herda o problema novamente e uma frase acaba atribuída ao falante errado no resultado final. Isso incomoda muito mais quem está ouvindo do que uma tradução imperfeita, porque o conteúdo passa a estar errado, não apenas aproximado.

Interrupções são o caso mais comum e conseguem ser piores do que conversas cruzadas contínuas por um motivo: são breves o suficiente para que as pessoas não as vejam como sobreposição. Um apresentador dizendo "com certeza" enquanto o convidado responde é fala sobreposta. Risadas sobre uma piada ou aquele meio segundo em que alguém começa a falar antes do outro terminar também são.

A quantidade de falantes importa menos do que você imagina. Quatro pessoas falando uma de cada vez geram um arquivo muito mais fácil de processar do que duas pessoas se interrompendo o tempo todo.

Você informa quantas pessoas estão falando?

Não, e isso descarta uma solução que os usuários costumam pedir.

Nós enviamos apenas três dados ao modelo: o arquivo, o idioma de destino e uma opção de configuração. São três argumentos, e a quantidade de falantes não é um deles. Portanto, não há como passar essa informação. O próprio modelo decide quantas vozes existem e como lidar com elas, sem que possamos interferir por você.

Também não há intervenção manual posterior. O processo de dublagem roda de forma totalmente automática do início ao fim e nada é editado à mão depois de pronto, como explicamos em nossa página de suporte. Por isso, uma frase atribuída ao falante errado não pode ser reatribuída manualmente, e um trecho com vozes misturadas não pode ser corrigido pontualmente.

Essa é a limitação real do sistema: o seu controle está exclusivamente no arquivo que você envia.

O que você pode corrigir antes do envio?

Bastante coisa, se você ainda tiver o projeto de edição em vez de apenas o arquivo exportado.

Use faixas separadas se tiver. Uma entrevista remota gravada em uma plataforma que salva o áudio individual de cada participante fornece falantes isolados. Esse é o melhor formato de entrada possível, e vale a pena checar se sua estrutura de gravação já gera essas faixas antes de assumir que você só tem o áudio misturado.

Remova as falas cruzadas desnecessárias. Barulhos de fundo, como "m-hm" ou "sim" ditos enquanto outra pessoa fala, não acrescentam conteúdo e criam sobreposição. Cortar esses trechos não custa nada e remove os momentos mais difíceis do arquivo.

Corte o arquivo nas trocas de falante se a conversa permitir. Dublar uma entrevista longa dividindo-a em trechos que contenham apenas um falante elimina o problema por completo. Há um custo real nisso: cada trecho conta como um trabalho separado com sua própria cobrança, e o sistema arredonda a cobrança para minutos inteiros por arquivo. Uma entrevista de 50 minutos cortada em doze trechos de 4 minutos e 10 segundos consome 60 créditos, enquanto o mesmo áudio em um único arquivo consome 50 créditos.

Melhore a acústica da sala, não o arquivo. O reverberamento confunde o limite entre um falante e outro e não pode ser removido após a gravação. Se você produz conteúdo sabendo que vai dublá-lo depois, esse é um ótimo motivo para cuidar da acústica do ambiente de gravação.

Nosso guia geral sobre preparar o áudio de origem antes de dublar cobre o restante dos aspectos de entrada, incluindo o motivo pelo qual a compressão aplicada previamente costuma prejudicar o resultado.

O que esperar de um arquivo complexo?

Ajuste suas expectativas de acordo com o tipo de conteúdo, pois o resultado varia bastante entre os 32 idiomas para os quais dublamos e entre diferentes formatos.

Um diálogo roteirizado entre duas pessoas com turnos bem definidos costuma ter um ótimo resultado. Um painel com mediação firme também se sai bem. Já um podcast informal onde dois amigos se interrompem constantemente é o tipo de arquivo mais difícil para qualquer sistema de dublagem, e nenhum marketing de fornecedor vai te contar isso. A duração do vídeo raramente é o fator limitante: aceitamos arquivos de até 180 minutos e 2 GB, o que atende a quase qualquer episódio.

Esse último caso não é impossível, mas é onde você deve fazer um teste antes de enviar um catálogo inteiro. O teste é barato: processe um episódio para um idioma e ouça os dois piores minutos que encontrar, não os melhores.

Se esse teste falhar por completo e não gerar nada, o trabalho é estornado automaticamente. Qualquer trabalho que falhe ou que atinja o limite de tempo de seis horas sem gerar um arquivo devolve os créditos sem que você precise solicitar. O que não é reembolsável é um trabalho concluído que gere uma dublagem mediana, pois o sistema não tem como classificar isso como uma falha. Ele processou, gerou o arquivo e os créditos foram consumidos.

Assim, o teste custa apenas os créditos de um episódio e mostra se o formato funciona antes de você gastar com vinte. Lembre-se de baixar o arquivo no dia em que ficar pronto: uma dublagem concluída fica disponível por 90 dias e depois é excluída permanentemente.

O problema de duração piora com mais falantes?

O mecanismo é o mesmo, mas a conversa deixa o problema mais visível.

A fala traduzida raramente tem exatamente a mesma duração do áudio original. Em um monólogo, esse descompasso se acumula de forma gradual. Em um diálogo, ele aparece como uma falta de sincronia com a troca de turnos, o que chama muito mais atenção porque os ouvintes acompanham o ritmo da conversa de perto. O artigo sobre por que o áudio dublado sai de sincronia explica a causa subjacente e o que realmente ajuda a resolver.

O que ler a seguir

Conteúdos de entrevistas e painéis são comuns na comunicação interna, onde a questão do tempo costuma ser menos crítica do que em vídeos publicados: a dublagem de vídeos corporativos do português para o holandês aborda essa combinação, a dublagem de vídeos do YouTube do português para o árabe cobre a parte de publicação, e o índice de casos de uso traz o restante.

Perguntas frequentes

A dublagem com IA funciona com várias pessoas falando?

Sim, e quando cada pessoa fala na sua vez o resultado é muito bom, mesmo com vários participantes. O ponto crítico é a fala simultânea, pois vozes no mesmo instante ficam misturadas no arquivo e separá-las é algo incerto. Quatro pessoas alternando a fala geram um arquivo mais simples de processar do que duas se interrompendo.

Posso informar ao sistema quantas pessoas estão no vídeo?

Não. O envio contém apenas o arquivo, o idioma de destino e uma configuração, sem contagem de falantes, de modo que o próprio modelo faz essa identificação. Nada é corrigido manualmente após o processamento.

Como devo dublar uma entrevista ou podcast com dois apresentadores?

Use faixas de áudio isoladas por participante se o seu sistema de gravação tiver salvo dessa forma. Se não for o caso, edite as falas cruzadas desnecessárias e considere cortar o arquivo nas trocas de falante. Lembre-se de que cada trecho é um trabalho separado com cobrança arredondada por arquivo, então cortar o áudio custa mais do que enviar um arquivo único.

E se o resultado da dublagem ficar ruim?

Um trabalho que falha por completo tem os créditos devolvidos automaticamente. Um trabalho concluído que gere uma dublagem razoável não é estornado, pois o sistema não consegue identificar isso como erro. Por isso vale a pena gastar créditos testando um episódio antes de dublar uma série inteira.

Continuar lendo

Pronto para ir global?

Comece a traduzir seus arquivos de áudio e vídeo para 32 idiomas hoje mesmo.

Comece a dublar agora