Audio für die KI-Synchronisation richtig vorbereiten
Die Qualität der Synchronisation entscheidet sich vor dem Upload. Überlappende Stimmen, Hall und Musik beeinträchtigen das Ergebnis.
Eine Synchronisation kann nur so gut sein wie die Aufnahme, auf der sie basiert. Der Großteil der Qualität entscheidet sich bereits vor dem Upload.
Das ist kein Haftungsausschluss, sondern eine Beschreibung unserer Pipeline. Eine Synchronisation muss zuerst verstehen, was gesagt wurde und wer es gesagt hat, bevor sie dasselbe in einer anderen Sprache ausgeben kann. Alles, was das in deiner Quelldatei erschwert (eine zweite Stimme, Musik im gleichen Frequenzbereich, ein Raum mit zu viel Hall), beeinträchtigt jeden darauffolgenden Schritt.
Das Wichtigste vorab: Wir übermitteln deine Datei genau so, wie sie ist. Kein Preprocessing, keine Bereinigung, keine Normalisierung. Was du hochlädst, wird synchronisiert. Fehler in der Quelldatei bleiben also bestehen.
Warum lässt sich das nachträglich nicht korrigieren?
Weil es kein "Danach" gibt. Die Synchronisation läuft vollautomatisch von Anfang bis Ende ab, und danach wird nichts mehr manuell bearbeitet. Auf unserer Supportseite steht das unmissverständlich: Eine einzelne fehlerhafte Tonspur kann nicht auf Anfrage neu aufgenommen werden.
Es ist ungewöhnlich, dass ein Anbieter das so deutlich schreibt, aber es ist die einzig ehrliche Perspektive für diese Seite. Da kein Mensch das Ergebnis nachträglich korrigiert, ist die Quelldatei der einzige Ort, an dem du die Qualität beeinflussen kannst.
Was verschlechtert eine Synchronisation tatsächlich?
Vier Faktoren, grob sortiert nach der Schwere ihres Einflusses:
Überlappende Sprecher. Zwei Menschen, die gleichzeitig reden, sind die größte Herausforderung. Wo sich Sprache überschneidet, muss die Transkription Wörter den Sprechern zuordnen, die physisch miteinander vermischt sind. Fehler an dieser Stelle ziehen sich durch die gesamte Übersetzung bis in die fertige Tonspur. Der Rat auf unserer Supportseite lautet daher klar: Nutze saubere Quelldateien mit jeweils nur einem Sprecher zur gleichen Zeit, das ist keine reine Formsache.
Musik im selben Frequenzbereich wie die Stimme. Hintergrundmusik ist nicht automatisch ein Problem. Problematisch wird es, wenn Musik im selben mittleren Frequenzbereich liegt wie die Sprache, da die Trennung extrem schwierig ist. Eine leise, unaufdringliche Untermalung ist unbedenklich; eine Tonspur mit lautem Gesang oder unruhigen Mitten dagegen nicht.
Starker Hall. Ein Raum mit schallharten Oberflächen lässt Wörter ineinanderfließen. Einmal aufgenommener Hall lässt sich nachträglich nicht mehr entfernen und verwischt genau die Wortgrenzen, die das System für die weitere Verarbeitung braucht.
Bereits angewendete Kompression und Limiting. Das überrascht viele, weil es oft als Qualitätsmerkmal gilt. Aggressive Kompression flacht jedoch den Dynamikumfang ab, der Sprache von Hintergrundgeräuschen unterscheidet. Ein stark komprimiertes Podcast-Master ist oft schwerer zu verarbeiten als die Rohaufnahme. Wenn du das Pre-Master hast, nutze lieber dieses.
Was sollte ich vor dem Upload tun?
In der Reihenfolge ihrer Wirkung:
Nimm die sauberste Version auf oder exportiere sie. Wenn der Ton deines Videos mit Musik und Effekten gemischt wurde und du die Sprachspur noch separat hast, synchronisiere nur diese Sprachspur. Eine isolierte Dialogspur schlägt eine fertige Mischung jedes Mal.
Achte darauf, dass immer nur eine Person spricht. Wenn du ein Interview oder eine Diskussionsrunde hast und die Sprecher auf separaten Spuren liegen, prüfe, ob du die Segmente so anordnen kannst, dass Überschneidungen vermieden werden, anstatt eine fertige Mischung hochzuladen, in der zwei Stimmen aufeinandertreffen.
Schneide Stille und geräuschlose Passagen an den Enden ab. Guthaben wird pro Datei auf ganze Minuten aufgerundet (mit einem Minimum von einer Minute). Ein 40-sekündiges Outro mit Musik am Ende kann dich also ein ganzes zusätzliches Credit kosten, obwohl dort gar keine Sprache mehr zu synchronisieren ist.
Verzichte auf nachträgliche Verschönerungen. Füge keine Kompression, keinen EQ oder Rauschunterdrückung hinzu, in der Hoffnung, dem System zu helfen. Solange du kein konkretes Problem löst, entfernst du damit sehr wahrscheinlich eher wertvolle Audioinformationen als Störgeräusche.
Spielt das Dateiformat eine Rolle?
Weniger als der eigentliche Inhalt der Datei, aber es lohnt sich, hier präzise zu sein.
Wir akzeptieren 17 Formate: MP3, WAV, AAC, M4A, FLAC, AIFF, OGA, OGG und Opus für Audio sowie MP4, MOV, AVI, MKV, WebM, M4V, MPEG und MPG für Video. Die Dateiendung wird geprüft, bevor irgendein anderer Schritt startet.
Wenn du bereits ein verlustfreies Master hast, lade dieses hoch und nicht ein für den Vertrieb exportiertes MP3. Das erneute Codieren eines verlustbehafteten Formats in ein anderes verstärkt Artefakte. Es gibt keinen Grund, unserer Pipeline eine schlechtere Kopie zu übergeben als nötig.
Wenn dein Ziel eine reine Audiodatei ist, wie zum Beispiel ein mehrsprachiger Audiotrack für YouTube, lade direkt das Audio statt des Videos hoch und spare dir die Konvertierung am Ende.
Limits: 2 GB und 180 Minuten pro Datei. Beide Grenzwerte werden geprüft, bevor auch nur ein Credit angerührt wird. Die Dauer deiner Datei wird direkt im Arbeitsspeicher aus den Rohdaten ausgelesen und für die Messung niemals auf die Festplatte geschrieben.
Wie weiß ich, ob es funktioniert hat?
Höre dir die erste und die letzte Minute an, genau in dieser Reihenfolge.
Die erste Minute zeigt dir die Qualität: Klingt die Stimme natürlich, wirkt die Übersetzung flüssig, gibt es unverständliche Stellen? Die letzte Minute zeigt dir, ob die Tonspur asynchron wird, da sich Längenunterschiede im Laufe eines Videos aufsummieren und sich das Ende am deutlichsten unterscheidet. Wir haben bereits ausführlich beschrieben, warum synchronisiertes Audio asynchron wird und was du dagegen tun kannst.
Ein Testlauf mit einer Datei und einer Sprache ist der günstigste Weg. Wenn ein Auftrag komplett fehlschlägt, erstatten wir die Credits automatisch zurück, das gilt auch bei einem Timeout nach sechs Stunden. Was hingegen nicht erstattet werden kann, ist ein technisch erfolgreicher Auftrag, der aufgrund einer schlechten Quelldatei eine mangelhafte Synchronisation liefert. Das ist für unser System kein Fehler: Der Auftrag lief durch, hat eine Datei erzeugt und wurde berechnet.
Deshalb lohnt es sich, zehn Minuten in die Quelldatei zu investieren, bevor du Credits für die Synchronisation ausgibst.
Was du als Nächstes lesen solltest
Wenn du Kursinhalte vorbereitest, bei denen meist schon ein sauberer Sprechertext vorliegt und eher die Längenunterschiede die Herausforderung sind, hilft dir unser Leitfaden zur Synchronisation von E-Learning von Deutsch auf Portugiesisch. Wer SaaS-Produktvideos von Deutsch auf Spanisch synchronisieren möchte, findet dort Lösungen für Demos. Die Übersicht aller Anwendungsfälle zeigt dir den Rest.
Häufige Fragen
Entfernt KI-Synchronisation die Hintergrundmusik?
Verlasse dich nicht darauf. Musik, die leise und klar getrennt vom Frequenzbereich der Stimme liegt, bleibt meistens erhalten. Musik, die sich jedoch die Mitten mit der Sprache teilt, macht die Trennung ungenau und verschlechtert das Gesamtergebnis. Wenn du die Dialogspur separat von der Abmischung vorliegen hast, synchronisiere am besten diese isolierte Spur.
Warum klingt meine KI-Synchronisation roboterhaft?
Meistens liegt das an der Quelldatei und nicht am Modell. Überlappende Sprecher, starker Hall und aggressive Kompression erschweren die Spracherkennung, auf die alle nachfolgenden Schritte aufbauen. Eine monotone Stimme im Ergebnis lässt sich fast immer auf eine Aufnahme zurückführen, die für das System von Anfang an schwer verständlich war.
Sollte ich meinen Ton vor dem Upload bereinigen?
Behebe echte Probleme, aber füge keine Effekte ohne Grund hinzu. Nutze die sauberste Version, die du bereits hast, idealerweise eine ungemasterte Dialogspur. Schneide außerdem tonlose Passagen an den Enden ab, da die Abrechnung pro Datei aufgerundet wird. Kompression oder Rauschunterdrückung auf gut Glück einzusetzen, entfernt meist eher nützliche Audioinformationen als echtes Rauschen.
Welches Format eignet sich am besten für den Upload?
Immer das Format, das am nächsten an deiner Originalaufnahme liegt. Wir akzeptieren 17 Formate und verarbeiten die Datei genau so, wie sie ist, ohne Vorab-Filterung. Ein verlustfreies Master ist daher immer besser als ein komprimiertes MP3 für den Vertrieb. Das erneute Konvertieren von einem verlustbehafteten Format in ein anderes verstärkt lediglich die Artefakte.