Problemen oplossen 6 min. leestijd

Audio voorbereiden voor AI-nasynchronisatie: 4 tips

Een goede nasynchronisatie begint bij je bronbestand. Voorkom galm en overlappende stemmen voor het beste resultaat met onze AI-tool.

Een nasynchronisatie is slechts zo goed als de opname waarvan deze is gemaakt, en de meeste kwaliteit wordt bepaald voordat je ook maar iets uploadt.

Dat is geen disclaimer, het is een beschrijving van de pipeline. Nasynchronisatie moet begrijpen wat er is gezegd en door wie, voordat het hetzelfde in een andere taal kan zeggen. Alles wat dit in je bronmateriaal belemmert (een tweede stem, muziek in hetzelfde frequentiebereik, een ruimte met te veel galm) verslechtert elke stap die volgt.

Het belangrijkste punt: we sturen je bestand door zoals het is. Geen voorbewerking, geen opschoonronde, geen normalisatie. Wat je uploadt, is wat er wordt nagesynchroniseerd, dus fouten in de bron blijven aanwezig in het resultaat.

Waarom kan het achteraf niet worden hersteld?

Omdat er geen 'achteraf' is. Nasynchronisatie verloopt automatisch van begin tot eind, en niets wordt achteraf handmatig aangepast. Onze supportpagina vermeldt dit direct, wat betekent dat een enkele slechte zin niet op verzoek opnieuw kan worden opgenomen.

Dat is een ongebruikelijk iets voor een aanbieder om zwart op wit te zetten, maar het is de eerlijke context voor deze pagina. Er komt geen mens aan te pas die de output oppoetst, dus de enige plek waar je de kwaliteit kunt beïnvloeden, is bij de input.

Wat verslechtert een nasynchronisatie?

Vier zaken, ongeveer in volgorde van de schade die ze aanrichten.

Overlappende sprekers. Twee mensen die tegelijk praten is de lastigste situatie die er is. Waar spraak overlapt, moet de onderliggende transcriptie woorden toeschrijven aan sprekers die fysiek met elkaar vermengd zijn. Fouten die daar ontstaan, worden direct meegenomen via de vertaling naar de output. Het advies op onze supportpagina is dan ook helder: gebruik schone bronaudio met één spreker tegelijk. Dat is geen formaliteit.

Muziek in hetzelfde frequentiebereik als de stem. Achtergrondmuziek is niet automatisch een probleem. Muziek die dezelfde bandbreedte inneemt als de spraak is dat wel, omdat het scheiden van de twee echt dubbelzinnig is. Een track die zacht op de achtergrond staat blijft behouden; een track met prominente zang of een drukke mid-range niet.

Veel galm. Een ruimte met harde oppervlakken zorgt ervoor dat elk woord in het volgende overloopt. Galm die eenmaal in het bestand zit, kan later niet worden verwijderd. Het vervaagt precies de grenzen tussen woorden die het systeem nodig heeft.

Vooraf toegepaste compressie en limiting. Dit verrast mensen vaak, omdat het voelt als een verbetering. Agressieve compressie vlakt het dynamisch bereik af dat spraak van de achtergrond onderscheidt. Een zwaar gelimiteerde podcast-master is vaak moeilijker te verwerken dan de ruwe opname. Als je de pre-master hebt, gebruik die dan.

Wat moet ik doen voor het uploaden?

In volgorde van effect:

Neem de schoonst mogelijke versie op of exporteer deze. Als de audio van je video is gemixt met muziek en effecten, en je hebt het losse dialoogspoor nog, dub dan dat spoor. Een afzonderlijke audiotrack met alleen stem wint het altijd van een voltooide mix.

Zorg voor één spreker tegelijk. Als je een interview of een paneldiscussie hebt en de sprekers staan op afzonderlijke sporen, kijk dan of de segmenten zo kunnen worden ingedeeld dat overlap wordt vermeden, in plaats van een mix te uploaden waarin twee stemmen botsen.

Knip stiltes en niet-gesproken materiaal aan de uiteinden weg. Credits worden afgerond op hele minuten met een minimum van één per bestand. Die laatste 40 seconden outro-muziek kunnen je dus een extra credit kosten voor content zonder spraak.

Sla de 'verfraaiing' over. Voeg geen extra compressie, EQ of ruisonderdrukking toe in de hoop te helpen. Tenzij je een specifiek probleem oplost, is de kans groter dat je informatie verwijdert in plaats van ruis.

Maakt het bestandsformaat uit?

Minder dan de inhoud van het bestand, maar het is de moeite waard om het goed te doen.

We accepteren 17 formaten: MP3, WAV, AAC, M4A, FLAC, AIFF, OGA, OGG en Opus voor audio, plus MP4, MOV, AVI, MKV, WebM, M4V, MPEG en MPG voor video. De extensie wordt gecontroleerd voordat er iets anders gebeurt.

Als je al een lossless master hebt, upload die dan in plaats van een MP3 die je voor distributie hebt geëxporteerd. Het opnieuw coderen van lossy audio naar een ander lossy formaat stapelt artefacten op, en er is geen reden om de pipeline een slechtere kopie te geven dan nodig.

Als je einddoel een bestand met alleen audio is, zoals een YouTube-audiotrack in meerdere talen, upload dan de audio in plaats van de video. Dat bespaart een conversie aan het eind.

Limieten: 2 GB en 180 minuten per bestand. Beide worden gecontroleerd voordat er ook maar één credit wordt aangeraakt. De duur van je bestand wordt direct uit de binnengekomen bytes gelezen en nooit naar schijf geschreven om te worden gemeten.

Hoe weet ik of het is gelukt?

Luister naar de eerste minuut en de laatste minuut, in die volgorde.

De eerste minuut vertelt je iets over de kwaliteit: klinkt de stem goed, is de vertaling natuurlijk, is er niets vervormd? De laatste minuut vertelt je over verloop, omdat lengteverschillen zich gedurende een video ophopen. We hebben eerder uitgelegd waarom nagesynchroniseerde audio uit de pas loopt en wat je daaraan kunt doen.

Een testrun met één bestand en één taal is de goedkoopste manier om te testen. Als de taak volledig mislukt, krijg je de credits automatisch terug, ook bij de timeout van zes uur. Wat niet kan worden teruggedraaid, is een taak die slaagt maar een matige nasynchronisatie produceert door slechte bronaudio. Dat is namelijk geen fout die het systeem kan herkennen. De taak is uitgevoerd, er is een bestand geproduceerd en de kosten zijn in rekening gebracht.

Dat is de reden om tien minuten aan de bron te besteden voordat je credits uitgeeft aan de nasynchronisatie.

Wat je nu kunt lezen

Als je cursusmateriaal voorbereidt waar vaak al schone spraak beschikbaar is maar het lengteverschil een grotere uitdaging vormt, lees dan onze gids over e-learning nasynchroniseren van Nederlands naar Portugees. Onze gids over SaaS-productvideo's nasynchroniseren van Nederlands naar Spaans behandelt hetzelfde probleem bij productdemo's. Het overzicht van use cases bevat de rest.

Veelgestelde vragen over audio-voorbereiding

Verwijdert AI-nasynchronisatie achtergrondmuziek?

Reken er niet op. Muziek die zacht en duidelijk buiten het frequentiebereik van de stem blijft, overleeft het meestal wel. Maar muziek die de mid-range deelt met spraak maakt de scheiding onduidelijk en verslechtert het resultaat. Als je een apart dialoogspoor hebt, dub dan dat spoor.

Waarom klinkt mijn AI-nasynchronisatie robotachtig?

Meestal ligt dit aan de bron in plaats van aan het model. Overlappende sprekers, veel galm en agressieve compressie verhullen de spraak waarvan het systeem afhankelijk is. Een monotone of houterige delivery in de output is vaak terug te voeren op een opname die simpelweg lastig te interpreteren was.

Moet ik mijn audio opschonen voor het uploaden?

Verwijder echte problemen, maar voeg geen bewerkingen toe om het bewerken. Gebruik de schoonste versie die je hebt, idealiter een onbewerkte audiotrack met alleen stem, en knip stiltes aan de uiteinden weg omdat de facturering per bestand naar boven afrondt. Blind compressie of ruisonderdrukking toevoegen verwijdert meestal informatie in plaats van ruis.

Wat is het beste bestandsformaat om te uploaden?

Het formaat dat het dichtst bij je origineel ligt. We accepteren 17 formaten en verwerken het bestand zoals het is zonder voorbewerking. Een lossless master is dus beter dan een MP3 voor distributie. Het omzetten van het ene lossy formaat naar het andere stapelt alleen maar artefacten op.

Lees verder

Klaar om wereldwijd te gaan?

Begin vandaag nog met het vertalen van je audio- en videobestanden naar 32 talen.

Start nu met nasynchroniseren