Warum deine Synchronisation nicht zum Video passt
Eine driftende Tonspur ist ein Längenproblem, kein Synchronproblem. Derselbe Satz dauert in jeder Sprache anders lang, und Verschieben hilft dagegen nicht.
Deine Synchronisation ist wahrscheinlich nicht falsch ausgerichtet. Sie hat einfach eine andere Länge als das Original, und das ist ein Übersetzungsproblem, kein technischer Fehler.
Derselbe Satz dauert in verschiedenen Sprachen unterschiedlich lange. Wenn du einen 12 Sekunden langen englischen Satz originalgetreu ins Deutsche übersetzt, erhältst du keinen 12 Sekunden langen deutschen Satz, sondern eine längere Fassung. Wenn sich das im Laufe eines Videos fünfzigmal wiederholt, summiert sich die Verzögerung. Die erste Minute klingt dann noch völlig normal, aber in der letzten Minute hinkt der Ton sichtlich hinterher.
Deshalb lässt sich das Problem auch nie lösen, indem du die Audiospur auf der Timeline einfach nach links verschiebst. Du kannst den Anfang ausrichten oder das Ende. Beides gleichzeitig klappt nicht, weil die beiden Dateien schlicht nicht gleich lang sind.
Warum ist die synchronisierte Audiospur unterschiedlich lang?
Sprachen unterscheiden sich darin, wie viel Zeit sie benötigen, um dieselbe Bedeutung zu vermitteln. Einige verpacken Informationen sehr dicht, andere dehnen sie aus. Eine sinngetreue Übersetzung entspricht daher fast nie der ursprünglichen Dauer.
Das Deutsche fällt hier besonders auf, weil zusammengesetzte Wörter und die Satzstellung oft zu längeren gesprochenen Fassungen desselben Gedankens führen. Das Japanische verhält sich wiederum ganz anders: Seine Silbenstruktur und Sprechgeschwindigkeit weisen ein ganz eigenes Verhältnis zum englischen Timing auf. Die Richtung und das Ausmaß des Unterschieds hängen vom jeweiligen Sprachpaar und dem Register ab, ein technischer Vortrag verhält sich anders als eine lockere Unterhaltung.
Dieser Effekt summiert sich. Eine halbe Sekunde zusätzliche Länge bei jedem von vierzig Sätzen ergibt am Ende des Videos bereits zwanzig Sekunden Abweichung.
Eine synchronisierte Tonspur mit einer abweichenden Länge ist also kein Fehler im System. Es ist das völlig normale Ergebnis einer Sprachübersetzung. Jedes Tool, das dir eine Synchronisation mit exakt derselben Dauer wie das Original liefert, musste dafür Kompromisse eingehen, meistens durch das künstliche Beschleunigen der Sprache, das Kürzen von Inhalten oder das Zusammenpressen von Pausen.
Verändert irgendetwas in der Pipeline das Timing meiner Audiospur?
Nicht auf unserer Seite. Diesen Punkt räumen wir am besten direkt aus dem Weg, weil viele Nutzer genau das vermuten.
Wir übergeben deine gesamte Datei zusammen mit genau drei Parametern: der Datei, der Zielsprache und einer einzelnen Option. Das ist der komplette Aufruf. Keine Startzeit, keine Endzeit, keine Sprecheranzahl, keine Segmentaufteilung, kein zeilenweises Kürzen. Nichts in unserem Code öffnet deine Audiodatei, um einzelne Teile darin zu verschieben.
Die Synchronisation läuft zudem vollautomatisch ab, und es erfolgt im Nachhinein keine manuelle Bearbeitung. Auf unserer Support-Seite weisen wir ganz offen darauf hin, was auch bedeutet, dass wir einzelne Zeilen nicht auf Anfrage anpassen können. Das ist eine ungewöhnliche Aussage für einen Software-Anbieter, aber es ist die einzig ehrliche Perspektive für ein Thema wie dieses: Wenn das Timing eines einzelnen Satzes nicht stimmt, gibt es keinen manuellen Schritt, bei dem jemand die Spur wieder zurechtrückt.
Wie finde ich heraus, wie stark die Abweichung tatsächlich ist?
Du kannst es direkt von deiner Rechnung ablesen, eine Diagnosemöglichkeit, die dir die meisten Tools vorenthalten.
Credits entsprechen Minuten, die immer aufgerundet werden, mit einem Minimum von einem Credit pro Datei. Die Berechnungsformel lautet: max(1, math.ceil(seconds / 60)). Eine Datei mit einer Länge von 61 Sekunden kostet also 2 Credits.
Hilfreich ist hierbei das Verfahren nach der Bestätigung deines Auftrags. Wir schlagen dir einen Preis basierend auf der von uns ausgelesenen Dateidauer vor. Anschließend meldet der Synchronisationsdienst die tatsächlich gemessene Dauer zurück, und beide Werte werden abgeglichen. Fällt die synchronisierte Spur länger aus, wird die Differenz berechnet; ist sie kürzer, erhältst du das entsprechende Guthaben zurück. Die am Ende berechnete Anzahl an Credits spiegelt also die tatsächliche Audiolänge wider, nicht nur unsere Schätzung.
Vergleiche diesen Wert mit der Länge deiner Quelldatei. Wenn eine Datei, bei der du mit einer Abrechnung von 5 Minuten gerechnet hast, am Ende mit 6 Minuten abgerechnet wird, verrät dir das bereits viel über die Länge der Ausgabe, noch bevor du sie überhaupt angehört hast.
Was hilft wirklich?
Drei Dinge, und das erste ist genau das, was die meisten übergehen.
Verwende eine saubere Audioquelle mit jeweils nur einem Sprecher. Das ist der wichtigste Rat auf unserer Support-Seite, und er ist keineswegs nebensächlich. Überlappende Stimmen, laute Hintergrundmusik und Durcheinandersprechen verschlechtern die Transkription, auf der alle folgenden Schritte aufbauen. Wenn eine Übersetzung auf einem fehlerhaften Transkript basiert, weicht das Timing am Ende noch viel stärker ab, als es durch den reinen Sprachunterschied zu erklären wäre.
Arbeite mit kürzeren Abschnitten, wenn das Timing kritisch ist. Da sich die Abweichung mit der Länge summiert, driftet ein 90-Sekunden-Segment niemals so stark ab wie ein Video von 40 Minuten. Bei Kursmodulen oder visuell exakt abgestimmten Inhalten sorgt die abschnittsweise Synchronisation dafür, dass die Abweichung bei jedem einzelnen Teil klein genug bleibt, um kaum aufzufallen. Der Preis dafür sind mehr Aufträge. Da jeder Auftrag genau eine Datei und eine Zielsprache umfasst, bedeutet das einen echten Kompromiss bei den verbrauchten Credits und nicht nur beim Arbeitsaufwand.
Akzeptiere, dass die Tonspur nicht Frame für Frame identisch sein wird. Wenn in deinem Video bei Minute 4:12 ein Text auf dem Bildschirm erscheint, der gesprochene Text in der Synchronisation diese Stelle aber erst bei 4:19 erreicht, kann kein Synchronisationstool dieses Problem für dich lösen. Entweder passt du den Videoschnitt an oder du planst die Synchronisation schon bei der Erstellung deines Contents ein. Inhalte, die für die Lokalisierung optimiert sind, lassen den Sprechern zwischen den einzelnen Abschnitten bewusst etwas Luft, statt den Schnitt extrem eng an die gesprochenen Worte anzupassen.
Wo dieses Problem am schwersten wiegt
Zwei Fälle sind besonders lesenswert, falls du dich in einer ähnlichen Situation befindest. Kursinhalte sind das naheliegendste Beispiel, da E-Learning-Module meist eng auf Folien und Bildschirmaufnahmen abgestimmt sind: Unser Leitfaden zur E-Learning-Synchronisation von Englisch ins Deutsche befasst sich mit einem Sprachpaar, bei dem der Längenunterschied besonders deutlich ist. Der andere Fall betrifft die interne Kommunikation. Unser Artikel über die Synchronisation von Unternehmensvideos von Deutsch ins Japanische behandelt ein Paar mit völlig anderen zeitlichen Voraussetzungen. Die vollständige Übersicht findest du im Verzeichnis der Anwendungsfälle.
Häufige Fragen
Warum ist meine synchronisierte Audiospur länger als das Original?
Weil eine originalgetreue Übersetzung eines Satzes nur in den seltensten Fällen genauso viel Sprechzeit benötigt wie das Original. Dieser Unterschied ist je nach Sprachpaar verschieden und summiert sich im Laufe eines Videos. Eine Spur, die anfangs noch perfekt synchron läuft, kann am Ende also spürbar hinterherhinken.
Könnt ihr die Synchronisation kürzen, damit sie zum Video passt?
Nein. Die Synchronisation läuft vollautomatisch ab und es wird im Nachhinein nichts von Hand bearbeitet. Daher können einzelne Zeilen nicht auf Anfrage gekürzt oder im Timing angepasst werden. Wenn dein Video eine exakte Dauer erfordert, ist der pragmatischste Weg, es in kürzeren Segmenten zu synchronisieren und die Unterschiede beim anschließenden Schnitt auszugleichen.
Hilft Lippensynchronität gegen dieses Problem?
Lippensynchronisation sorgt dafür, dass die Mundbewegungen zu den Lauten passen. Das ist eine völlig andere Baustelle als die Frage, ob die Tonspur die richtige Gesamtlänge hat. Eine lippensynchrone Vertonung einer längeren Übersetzung bleibt am Ende trotzdem länger. Die Länge ist die Hürde, die du zuerst lösen musst.
Sollte ich mein Video vor der Synchronisation aufteilen?
Wenn die zeitliche Abstimmung auf das Bild wichtig ist: ja. Da sich Abweichungen mit der Zeit summieren, driften kürzere Abschnitte weniger ab und lassen sich unabhängig voneinander prüfen. Bedenke jedoch, dass jedes Segment einen eigenen Auftrag mit eigener Abrechnung darstellt. Da die Credits pro Datei aufgerundet werden, kosten zehn kurze Abschnitte am Ende mehr als eine einzelne lange Datei mit derselben Gesamtlänge.