Video's met meerdere sprekers nasynchroniseren
Interviews, panels en podcasts met twee hosts zijn de lastigste input. Wat er met overlappende spraak gebeurt, en wat je zelf als eerste kunt verhelpen.
Meerdere sprekers zijn geen probleem. Meerdere sprekers die tegelijkertijd praten zijn dat wel, en het is een ander probleem dan de meeste mensen verwachten.
Een nasynchronisatie-pipeline moet vaststellen wat er is gezegd, door wie het is gezegd en waar de ene persoon stopt en de volgende begint, voordat er iets in een andere taal kan worden geproduceerd. Duidelijke beurtwisselingen zorgen voor alle drie. Overlappende spraak neemt ze in één keer weg, omdat twee stemmen op hetzelfde moment fysiek gemengd zijn in het bestand. Geen enkele hoeveelheid bewerking kan volledig scheiden wat nooit gescheiden was.
De nuttige vraag is dus niet "kan het systeem twee mensen aan". Het gaat erom hoeveel van je audio uit gelijktijdig pratende mensen bestaat.
Wat gebeurt er bij overlappende spraak?
Fouten stapelen zich op in plaats van lokaal te blijven.
Wanneer stemmen overlappen, moet de onderliggende transcriptie beslissen welke woorden bij wie horen. Gaat dat mis, dan neemt de vertaling die fout over en de gegenereerde audio vervolgens ook. Zo kan een zin in de output bij de verkeerde spreker terechtkomen. Dat is voor een luisteraar storender dan een onvolmaakte vertaling, omdat de inhoud nu simpelweg onjuist is in plaats van bij benadering goed.
Onderbrekingen komen het meest voor, en ze zijn in één opzicht erger dan langdurige crosstalk: ze zijn zo kort dat mensen ze vaak niet als overlap zien. Een host die "precies, ja" zegt onder het antwoord van een gast, is overlappende spraak. Dat geldt ook voor gelach over een clou, of de halve seconde waarin de ene persoon begint voordat de andere klaar is.
Het aantal sprekers doet er minder toe dan je zou denken. Vier mensen die netjes op hun beurt wachten, vormen een makkelijker bestand dan twee mensen die elkaar constant in de rede vallen.
Geef je aan hoeveel sprekers er zijn?
Nee, en dat sluit een oplossing uit waar mensen vaak om vragen.
We sturen drie dingen naar het systeem: het bestand, de doeltaal en één vlag (flag). Drie argumenten, en het aantal sprekers is daar geen van. Er is dus geen manier om dit door te geven. Het model bepaalt zelf hoeveel stemmen er aanwezig zijn en hoe deze afgehandeld worden, en we kunnen dit niet namens je aanpassen.
Er vindt ook geen nabewerking plaats. Nasynchronisatie verloopt volledig automatisch van begin tot eind en niets wordt handmatig bewerkt nadat het klaar is, zoals ook op onze supportpagina staat. Een zin die aan de verkeerde spreker is toegewezen, kan dus niet op verzoek worden hersteld, en een mislukt stuk met crosstalk kan niet worden gerepareerd.
Dat is de eerlijke beperking: de enige controle die je hebt, is over het bestand dat je uploadt.
Wat kun je repareren vóór het uploaden?
Nog best veel, als je het project nog hebt en niet alleen het geëxporteerde bestand.
Gebruik aparte audiotracks als je die hebt. Een interview op afstand dat is opgenomen met een platform dat per deelnemer audio opslaat, geeft je geïsoleerde sprekers. Dat is de best mogelijke input. Het is de moeite waard om te controleren of je opname-setup dit al doet voordat je ervan uitgaat dat je alleen de mix hebt.
Knip de crosstalk weg die je niet nodig hebt. Achtergrondgeluid, de "hm-hm" en "ja" onder de zin van iemand anders, voegt niets toe aan de inhoud maar creëert wel overlap. Het wegknippen kost je niets en verwijdert de moeilijkste momenten uit het bestand.
Knip het bestand op bij de sprekergrenzen als het gesprek dat toelaat. Een lang interview nasynchroniseren in segmenten die elk één spreker bevatten, omzeilt het probleem volledig. De kosten zijn wel echt: elk segment is een aparte taak met eigen kosten, en de facturering rondt af naar boven op de hele minuut per bestand. Een interview van 50 minuten dat is opgeknipt in twaalf segmenten van 4 minuten en 10 seconden kost 60 credits, terwijl dezelfde audio in één bestand 50 credits kost.
Verbeter de ruimte, niet het bestand. Galm (reverb) vervaagt de grens tussen de ene en de volgende spreker en kan na de opname niet meer worden verwijderd. Als je content produceert waarvan je weet dat je deze gaat nasynchroniseren, is dat een reden om de opnameruimte serieus te nemen.
Onze algemene gids voor het bron-audio voorbereiden voor nasynchronisatie behandelt de rest van de inputkant, inclusief waarom vooraf toegepaste compressie vaak nadelig werkt.
Wat kun je verwachten van een lastig bestand?
Stel je verwachtingen bij op basis van het type content, want deze verschillen sterk tussen de 32 talen waarin we nasynchroniseren en tussen verschillende formats.
Een gescript gesprek tussen twee personen met duidelijke beurtwisselingen gaat meestal goed. Een geleid panelgesprek met een gedisciplineerde host gaat redelijk goed. Een levendige podcast waarin twee vrienden constant door elkaar heen praten, is het moeilijkste wat je een nasynchronisatiesysteem kunt voorschotelen; geen enkele marketingtekst van een concurrent zal je dat vertellen. Lengte is zelden de beperkende factor bij deze content: we accepteren tot 180 minuten en 2 GB per bestand, wat bijna elke aflevering dekt.
Dat laatste geval is niet hopeloos, maar het is wel de situatie waarin je eerst moet testen voordat je een hele catalogus verwerkt. Dat is goedkoop om te doen: laat één aflevering in één taal verwerken en luister naar de slechtste twee minuten die je kunt vinden, niet de beste.
Als die test helemaal niets oplevert, wordt de taak automatisch terugbetaald. Elke taak die mislukt, of die de harde tijdslimiet van zes uur bereikt zonder een bestand te produceren, geeft de credits terug zonder dat je erom hoeft te vragen. Wat niet restitueerbaar is, is een taak die slaagt en een matige nasynchronisatie produceert, omdat de pipeline dit niet als een fout kan classificeren. Het systeem heeft gedraaid, er is een bestand gemaakt en de kosten zijn in rekening gebracht.
De test kost je dus de credits van één aflevering en vertelt je of het format werkt voordat je betaalt voor twintig afleveringen. Download het resultaat wel direct: een voltooide nasynchronisatie blijft 90 dagen beschikbaar en wordt daarna definitief verwijderd.
Wordt het lengteprobleem erger met meer sprekers?
Het mechanisme is hetzelfde, maar in een gesprek valt het meer op.
Vertaalde spraak heeft zelden dezelfde lengte als het origineel. In een monoloog bouwt dat verschil zich geleidelijk op. In een dialoog uit zich dat in een timing die niet langer past bij de beurtwisselingen. Dat valt meer op omdat luisteraars de cadans van een gesprek nauwgezet volgen. Waarom nagesynchroniseerde audio uit de pas loopt behandelt de onderliggende oorzaak en wat echt helpt.
Verder lezen
Interviews en panels komen veel voor bij interne communicatie, waar de timing vaak minder kritisch is dan bij video's voor het grote publiek: zakelijke video's nasynchroniseren van Engels naar Nederlands behandelt die combinatie, YouTube-video's nasynchroniseren van Nederlands naar Arabisch gaat over de publieke kant, en de index met use cases bevat de rest.
Veelgestelde vragen
Kan AI-nasynchronisatie meerdere sprekers aan?
Ja, en bij duidelijke beurtwisselingen werkt het goed, zelfs met meerdere personen. Gelijktijdige spraak is het lastige deel, omdat stemmen die op hetzelfde moment praten in het bestand vermengd zijn. Het scheiden daarvan is complex. Vier mensen die om de beurt praten is een makkelijker bestand dan twee mensen die elkaar onderbreken.
Kan ik het systeem vertellen hoeveel sprekers er zijn?
Nee. Bij de aanvraag worden alleen het bestand, de doeltaal en één vlag meegestuurd. Er wordt geen aantal sprekers opgegeven, dus het model stelt dit zelf vast. Er vindt achteraf ook geen handmatige correctie plaats.
Hoe moet ik een interview of podcast met twee hosts nasynchroniseren?
Gebruik gescheiden audiotracks per deelnemer als je opname-setup die heeft opgeslagen. Als dat niet kan, knip dan de overlappende crosstalk weg en overweeg om het bestand op te splitsen bij de sprekergrenzen. Houd er rekening mee dat elk segment een aparte taak is en de facturering per bestand naar boven wordt afgerond.
Wat als het resultaat tegenvalt?
Een taak die volledig mislukt, wordt automatisch terugbetaald. Een taak die slaagt maar een matige nasynchronisatie oplevert niet, omdat de pipeline dit niet als een fout kan herkennen. Daarom is het verstandig om één aflevering te testen voordat je een hele serie verwerkt.