Lokalisatiestrategie 8 min. leestijd

Hoe AI-nasynchronisatie werkt: van upload tot bestand

Vijf stappen, elk met een eigen faalwijze, plus de volgorde die onze eigen pipeline doorloopt: de tijden, en wat er per stap met je bestand gebeurt.

AI-nasynchronisatie bestaat uit vijf opeenvolgende bewerkingen, niet één. Taalherkenning, spraakscheiding, transcriptie en vertaling, stemsynthese en het her-timen ten opzichte van het origineel.

Weten welke stap wat doet is niet zomaar een weetje, maar praktisch nuttig. Wanneer een dub niet goed terugkomt, is er namelijk in één specifieke stap iets misgegaan, en de oplossing hangt volledig af van welke stap dat was. De meeste uitleg behandelt het hele proces als één grote black box, waardoor je niets kunt doen als het resultaat tegenvalt.

Hier zijn de vijf stappen, gevolgd door de exacte volgorde waarin onze eigen pipeline werkt, inclusief de cijfers.

Stap 1: Taalherkenning

Het systeem stelt vast in welke taal de bron is, puur op basis van de audio zelf.

Je geeft dit hier nooit op. Er is in het product simpelweg geen "van"-veld te bekennen. Dat is een bewuste ontwerpkeuze en geen omissie: de audio bevat het antwoord al, en als we jou vragen het in te vullen, ontstaat er alleen maar een kans op fouten.

Foutmodus: een bestand waarvan de opening in een andere taal is dan de rest van de tekst, of een bestand met zo weinig duidelijke spraak dat de herkenning niets heeft om op te bouwen. Als een dub terugkomt waarbij de brontaal verkeerd is herkend, controleer dan de eerste dertig seconden van wat je hebt geüpload.

Stap 2: Spraakscheiding

Spraak wordt gescheiden van alles wat geen spraak is, en sprekers worden van elkaar gescheiden.

Dit is de stap die de kwaliteit bepaalt bij rommelige bestanden, en dit is waar het verschil tussen een schone opname en een rommelige opname wordt vastgelegd. Muziek die hetzelfde frequentiebereik heeft als de stem, zware galm en door elkaar pratende sprekers maken deze stap onduidelijk, en elke latere stap erft die onduidelijkheid.

Foutmodus: vervormde spraak door elkaar en zinnen die aan de verkeerde spreker worden toegeschreven. We geven geen aantal sprekers mee, dus het model maakt die beoordeling zelf. Een video met meerdere sprekers nasynchroniseren behandelt wat je zelf kunt beïnvloeden, en wat je aan je audio moet herstellen voordat je gaat dubben legt de voorbereiding uit die het meeste hiervan voorkomt.

Stap 3: Transcriptie en vertaling

De gescheiden spraak wordt omgezet in tekst, en die tekst wordt tekst in de doeltaal.

Dit zijn twee gestapelde stappen waarbij fouten zich opstapelen: een verkeerd verstaan woord wordt een zelfverzekerd verkeerd vertaald woord. Dit is ook waar betekenis voorrang krijgt boven tijdsduur, wat de basis legt voor het probleem in stap 5.

Foutmodus: vakjargon, productnamen en merknamen. Een transcriptiemodel dat je productnaam nog nooit gehoord heeft, maakt er het dichtstbijzijnde bestaande woord van, en de vertaling vertaalt dat vervolgens getrouw mee.

Stap 4: Stemsynthese

De vertaalde tekst wordt uitgesproken in een stem die is afgeleid van de bronaudio, in plaats van een standaard voice-over stem.

Er is geen aanmeldstap en geen opgeslagen stemprofiel. Het enige beschikbare materiaal is het bestand dat je hebt geüpload. Daarom komt bronkwaliteit hier net zo goed naar voren als in stap 2. Bewaart AI-nasynchronisatie je eigen stem behandelt wat dat wel en niet belooft.

Foutmodus: een vlakke uitspraak en een stemkarakter dat veranderd naarmate een lang bestand vordert. Dit is meestal te herleiden tot het materiaal waar stap 2 mee moest werken.

Stap 5: Her-timen

De gesynthetiseerde spraak wordt op de originele tijdslijn geplaatst.

Hier zit het structurele probleem van de hele industrie: een getrouwe vertaling van een zin duurt zelden even lang om uit te spreken als het origineel. Deze stap is dus altijd een compromis tussen het afstemmen van de timing en het behouden van de inhoud. Geen enkele hoeveelheid verwerking kan een langere zin in een korter gat laten passen zonder iets op te offeren.

Foutmodus: verloop in timing. De opening klinkt synchroon, maar in de laatste minuten zie je duidelijk dat het niet meer klopt, omdat kleine verschillen zich opstapelen. Waarom nagesynchroniseerde audio uit sync loopt legt uit waarom dit een lengteprobleem is en geen synchronisatieprobleem.

Wat onze pipeline daadwerkelijk doet, op volgorde

De meeste diensten beschrijven het concept en niet hun eigen implementatie. Hier is de onze, stap voor stap, met de cijfers.

Bij uploaden. Het bestand stroomt binnen met één megabyte tegelijk, zodat er nooit een onbeperkte hoeveelheid in het geheugen wordt gehouden. De extensie wordt gecontroleerd aan de hand van 17 ondersteunde bestandsindelingen. De grootte wordt gecontroleerd aan de hand van een limiet van 2 GB, en wel twee keer: eenmaal op basis van de opgegeven lengte en nogmaals terwijl de bytes binnenkomen. De tijdsduur wordt uit het bestand in het geheugen gelezen, nooit naar schijf geschreven, en gecontroleerd aan de hand van een limiet van 180 minuten. Als een van deze controles mislukt, wordt de upload geweigerd. Er is nog niets in rekening gebracht, want er heeft nog geen betaling plaatsgevonden.

Het bestand wordt opgeslagen, er wordt een taakrij aangemaakt met de status in afwachting, en je krijgt een geschatte kostprijs terug.

Bij bevestigen. Credits worden afgeschreven onder een vergrendeling op rijniveau, zodat twee gelijktijdige verzoeken niet twee keer hetzelfde saldo kunnen besteden. Het bestand wordt weer opgehaald en ingediend bij de nasynchronisatiedienst.

De dienst geeft een eigen meting van de audioduur terug, die kan afwijken van de onze. Het verschil wordt direct verrekend: als het langer is, worden de extra kosten in rekening gebracht; als het korter is, krijg je het verschil terug. Je wordt gefactureerd op basis van gemeten audio, niet op basis van onze schatting. Hoe nasynchronisatieminuten worden geteld legt de regels uit.

Als de indiening mislukt, worden de zojuist afgeschreven credits direct teruggestort en krijgt de taak de status mislukt voordat er iets anders gebeurt.

Tijdens verwerking. De status van de taak wordt verwerken en er start een poller. Deze controleert de nasynchronisatiedienst elke 10 seconden, met een harde limiet van 6 uur. Er is geen status waarin een taak voor altijd blijft hangen: bij het bereiken van de limiet wordt de taak als mislukt gemarkeerd en terugbetaald.

Als de server halverwege de taak opnieuw opstart, stopt de polling-thread daarmede. Bij het opstarten zoeken we naar elke taak die nog als verwerken staat aangegeven en starten we een nieuwe poller voor elke taak met een nasynchronisatie-id. Een deployment halverwege je taak laat dus je taak noch je credits in de steek.

Bij succes. De voltooide audio wordt gedownload, opgeslagen onder je account en je oorspronkelijke upload wordt direct verwijderd. De taak wordt als voltooid gemarkeerd met een voltooiingstijdcode.

Achteraf. Je dub blijft 90 dagen downloadbaar en wordt daarna definitief verwijderd. Je geüploade bronbestand is in alle gevallen binnen een dag verdwenen. Archiveer wat je nodig hebt.

Bij mislukking. Alles wat in rekening is gebracht, wordt automatisch terugbetaald en de taak wordt getoond als mislukt. Dat geldt voor zowel een storing bij de nasynchronisatiedienst als het verstrijken van de zes uur. Je dub is verkeerd uitgepakt is de diagnosehulp.

Hoelang duurt het?

Langer dan een transcriptie, korter dan het plafond van zes uur, en evenredig met je bestand.

Het plafond is er voor extreme situaties, niet om het normale gedrag te beschrijven. Een korte clip is snel klaar. Een video van 90 minuten is geen klusje van twee minuten; iets anders verwachten is de meest voorkomende oorzaak van ongeduld.

Wat het niet kan

Goed om duidelijk te zeggen, aangezien de meeste handleidingen voor dit deel stoppen.

Het kan niet worden aangestuurd. Er is nergens in de interface een instructieveld: het accepteert een bestand en een doeltaal, en dat is alles.

Het kan achteraf niet worden gecorrigeerd. Nasynchronisatie loopt van begin tot eind automatisch zonder handmatige bewerkingsfase, dus één slechte regel kan niet op verzoek worden aangepast. De invoer is de enige plek waar je het resultaat kunt veranderen.

Het kan een langere zin niet in een korter gat laten passen zonder compromis. Dat is stap 5 en dat is een eigenschap van taal, niet van de software.

En het kan je niet vertellen dat je vertaalde slogan ongunstig uitvalt in de doelmarkt. Dat is werk voor een persoon die er woont.

Waar te beginnen

Eén taak neemt één bestand en één doeltaal, dus de eerlijkste eerste stap is een enkel bestand naar één taal, op je eigen inhoud in plaats van een testclip. De handleidingen per taal behandelen de praktische details: e-learning nasynchroniseren van het Nederlands naar het Duits en YouTube-video's nasynchroniseren van het Nederlands naar het Spaans zijn twee veelvoorkomende vertrekpunten, met de rest op het overzicht van toepassingen.

Veelgestelde vragen

Hoe werkt AI-nasynchronisatie?

In vijf stappen: het detecteren van de brontaal uit de audio, het scheiden van spraak van al het andere, het transcriberen en vertalen ervan, het synthetiseren van spraak in een stem afgeleid van de bron, en het her-timen van het resultaat ten opzichte van het origineel. Elke stap heeft zijn eigen foutmodus, wat betekent dat het diagnosticeren van een slechte dub inhoudt dat je uitzoekt bij welke stap het misging.

Hoelang duurt AI-nasynchronisatie?

Evenredig met de bestandsduur. Onze poller controleert elke 10 seconden met een harde limiet van 6 uur. Dat plafond is er voor de uiterste gevallen, niet als typische duur. Korte clips zijn snel klaar; een lange film kost echt tijd.

Moet ik opgeven in welke taal mijn bestand is?

Nee. De brontaal wordt automatisch gedetecteerd uit de audio en er is geen veld om deze op te geven. Je kiest alleen de doeltaal, één per taak.

Wat gebeurt er na het nasynchroniseren met mijn bestand?

Je geüploade bronbestand wordt verwijderd zodra de dub is gemaakt, en in ieder geval binnen een dag. De voltooide dub blijft 90 dagen downloadbaar en wordt daarna definitief verwijderd, dus download en archiveer deze op tijd.

Lees verder

Klaar om wereldwijd te gaan?

Begin vandaag nog met het vertalen van je audio- en videobestanden naar 32 talen.

Start nu met nasynchroniseren