Doppiaggio AI con più voci: come gestire i dialoghi
Interviste, tavole rotonde e podcast a due voci sono l'input più difficile per una pipeline di doppiaggio. Cosa succede alle voci sovrapposte.
La presenza di più speaker non è un problema. Il vero problema sono più persone che parlano contemporaneamente, ed è una difficoltà diversa da quella che la maggior parte delle persone si aspetta.
Una pipeline di doppiaggio deve capire cosa è stato detto, chi lo ha detto e dove si ferma una persona e inizia la successiva, prima ancora di poter produrre qualsiasi cosa in un'altra lingua. L'alternanza netta delle battute garantisce tutti e tre questi elementi. Le voci sovrapposte, invece, li annullano all'istante: due voci che occupano lo stesso secondo sono fisicamente miscelate nel file, e nessun tipo di elaborazione può separare completamente ciò che non è mai stato separato alla fonte.
Quindi la domanda utile non è "può gestire due persone?". È "quanta parte del tuo audio contiene due persone che parlano contemporaneamente?".
Cosa succede quando le voci si sovrappongono?
Si generano errori a catena, invece di rimanere isolati.
Quando le voci si sovrappongono, la trascrizione alla base deve decidere a chi appartiene ogni parola. Se sbaglia questo passaggio, la traduzione erediterà l'errore e l'audio generato lo ripeterà, con il risultato che una battuta verrà attribuita allo speaker sbagliato nel file finale. Per chi ascolta, questo è molto più fastidioso di una traduzione imperfetta, perché il contenuto diventa errato, non solo approssimativo.
Le interruzioni sono il caso più comune e sono peggiori di un dialogo incrociato continuo sotto un aspetto: sono così brevi che spesso non le consideriamo sovrapposizioni. Un conduttore che dice "giusto, sì" mentre l'ospite risponde è una sovrapposizione vocale. Lo sono anche le risate sopra una battuta finale o quel mezzo secondo in cui una persona inizia a parlare prima che l'altra abbia finito.
Il numero di speaker conta meno di quanto pensi. Quattro persone che parlano a turno senza sovrapporsi creano un file più semplice da gestire rispetto a due persone che continuano a interrompersi a vicenda.
Si può indicare il numero di speaker?
No, e questo esclude una soluzione che gli utenti chiedono spesso.
Noi inviamo tre elementi: il file, la lingua di destinazione e un'impostazione (flag). Tre parametri, e il numero di speaker non è tra questi, quindi non c'è modo di impostarlo. Il modello decide quante voci sono presenti e come gestirle, e non possiamo forzarlo per conto tuo.
Inoltre, non c'è alcun intervento successivo. I processi di doppiaggio avvengono in modo completamente automatico dall'inizio alla fine e nulla viene modificato a mano una volta completato, come indicato chiaramente nella nostra pagina di supporto. Di conseguenza, una battuta attribuita allo speaker sbagliato non può essere riassegnata su richiesta, e una sezione di dialogo confusa non può essere corretta.
Questo è il limite effettivo: l'unica cosa che puoi controllare è il file che carichi.
Cosa puoi correggere prima del caricamento?
Parecchie cose, se hai ancora a disposizione il progetto di montaggio e non solo il file esportato.
Usa tracce separate, se le hai. Un'intervista a distanza registrata con una piattaforma che salva l'audio di ciascun partecipante ti offre voci isolate. Questo è il miglior input possibile, e vale la pena verificare se la tua configurazione di registrazione lo fa già prima di rassegnarti a usare solo il mix finale.
Taglia i rumori di assenso non necessari. I suoni di sottofondo come "mhm" o "sì" sussurrati mentre parla qualcun altro non aggiungono valore e creano sovrapposizioni. Tagliarli non ti costa nulla e rimuove i momenti più difficili da gestire nel file.
Dividi il file in corrispondenza dei cambi di speaker, se il tipo di conversazione lo permette. Doppiare un'intervista lunga dividendola in segmenti che contengono un solo speaker alla volta aggira completamente il problema. Il costo però è reale: ogni segmento è un lavoro separato con un proprio costo, e la fatturazione viene arrotondata al minuto intero per ogni file. Un'intervista di 50 minuti tagliata in dodici segmenti da 4 minuti e 10 secondi consumerà 60 crediti, mentre lo stesso audio in un unico file ne consumerà 50.
Correggi la stanza, non il file. Il riverbero sfuma i confini tra uno speaker e l'altro e non può essere rimosso dopo la registrazione. Se produci contenuti che sai già di voler doppiare, questo è un ottimo motivo per curare l'acustica del tuo spazio di registrazione.
La nostra guida generale su come preparare l'audio di origine prima del doppiaggio copre tutti gli altri aspetti dell'ottimizzazione dell'input, incluso il motivo per cui la compressione applicata in anticipo tende a peggiorare le cose.
Cosa aspettarsi da un file difficile?
È importante calibrare le aspettative in base al tipo di contenuto, perché i risultati variano molto tra le 32 lingue in cui effettuiamo il doppiaggio e tra i diversi formati.
Un dialogo scritto a due voci con un'alternanza netta di solito ottiene ottimi risultati. Un dibattito moderato con un conduttore attento funziona discretamente bene. Un podcast informale in cui due amici continuano a parlarsi sopra, invece, è il materiale più difficile in assoluto per qualsiasi sistema di doppiaggio, e nessun marketing dei concorrenti te lo dirà mai. La lunghezza raramente rappresenta un limite per questi contenuti: accettiamo file fino a 180 minuti e 2 GB, coprendo quasi ogni tipo di episodio.
Quest'ultimo caso non è disperato, ma richiede un test prima di impegnare un intero catalogo. Ed è una prova economica: avvia il doppiaggio di un solo episodio in una lingua e ascolta i due minuti peggiori che riesci a trovare, non i migliori.
Se quel test non produce alcun risultato, il lavoro viene rimborsato automaticamente. Qualsiasi elaborazione che fallisce, o che raggiunge il limite massimo di timeout di 6 ore senza produrre un file, restituisce i crediti senza che tu debba richiederlo. Quello che non è rimborsabile è un lavoro che si conclude con successo ma produce un doppiaggio mediocre, poiché la pipeline non ha modo di classificare questo esito come un fallimento. Il processo è stato eseguito, ha creato un file e ti sono stati scalati i crediti.
Quindi il test ti costa i crediti di un solo episodio e ti dice se il formato funziona prima di spendere per venti file. Ricordati però di scaricarlo non appena è pronto: un doppiaggio completato rimane disponibile per 90 giorni e poi viene eliminato definitivamente.
Il problema della lunghezza peggiora con più speaker?
Il meccanismo è lo stesso, ma la conversazione lo rende più evidente.
Il discorso tradotto ha raramente la stessa lunghezza dell'originale e, in un monologo, questo sfasamento si accumula in modo graduale. In un dialogo, si traduce in tempi che non corrispondono più all'alternanza delle battute, un dettaglio che salta subito all'orecchio perché chi ascolta segue attentamente il ritmo della conversazione. L'articolo sul perché l'audio doppiato va fuori sincrono spiega la causa fondamentale e cosa aiuta davvero a risolvere il problema.
Articoli consigliati
Il contenuto di interviste e dibattiti è comune nelle comunicazioni aziendali interne, dove la precisione dei tempi è solitamente meno critica rispetto ai video pubblicati: la guida per doppiare video aziendali dall'italiano all'olandese copre questa combinazione, quella per doppiare video di YouTube dall'italiano all'arabo analizza i contenuti destinati alla pubblicazione, mentre l'indice dei casi d'uso raccoglie tutto il resto.
Domande frequenti
Il doppiaggio AI gestisce più speaker contemporaneamente?
Sì, e se i turni di parola sono netti il sistema funziona bene anche con molte persone. La parte difficile è il parlato simultaneo, poiché le voci che si sovrappongono nello stesso momento sono miscelate nel file e separarle è estremamente complesso. Quattro persone che parlano a turno creano un file più semplice rispetto a due persone che si interrompono a vicenda.
Posso indicare al sistema il numero di speaker?
No. L'invio del file include solo la traccia audio, la lingua di destinazione e un'impostazione (flag); non c'è un parametro per il numero di speaker, quindi il modello lo determina autonomamente. Inoltre, nulla viene corretto a mano successivamente.
Come posso doppiare un'intervista o un podcast con due conduttori?
Se la tua configurazione di registrazione le ha salvate, usa tracce separate per ciascun partecipante. In alternativa, elimina i rumori di assenso e i dialoghi incrociati non necessari, e valuta di tagliare il file nei momenti di cambio speaker. Tieni presente che ogni segmento costituisce un lavoro a sé stante e la fatturazione viene arrotondata al minuto per ogni file, quindi dividere l'audio costa più di un singolo caricamento continuo.
Cosa succede se il risultato è scadente?
Un processo che fallisce del tutto viene rimborsato automaticamente. Un lavoro che si conclude con successo ma genera un doppiaggio mediocre non prevede rimborsi, perché nessun elemento della pipeline può classificare l'esito come un fallimento. Ecco perché conviene usare qualche credito per testare un singolo episodio prima di impegnarsi con un'intera serie.