Rozwiązywanie problemów z dubbingiem 6 min czytania

Dubbing wideo z kilkoma osobami mówiącymi

Wywiady, panele i podcasty z dwojgiem prowadzących to najtrudniejszy materiał dla dubbingu. Co dzieje się z nakładającą się mową i co da się poprawić.

Wielu mówców w nagraniu to żaden problem. Problemem są osoby mówiące jednocześnie, przy czym natura tego problemu różni się od tego, czego większość ludzi się spodziewa.

System dubbingowy (który zastępuje oryginalne głosy w nagraniu) musi ustalić, co zostało powiedziane, kto to powiedział oraz gdzie jedna osoba kończy wypowiedź, a zaczyna druga, zanim stworzy jakąkolwiek ścieżkę w innym języku. Płynna wymiana zdań daje systemowi komplet tych informacji. Nakładające się głosy odbierają je od razu, ponieważ dwa głosy zarejestrowane w tym samym momencie są fizycznie zmieszane w pliku i żaden proces przetwarzania nie rozdzieli całkowicie tego, co od początku nie było odseparowane.

Przydatne pytanie nie brzmi więc "czy system poradzi sobie z dwoma osobami", ale "jaka część Twojego nagrania zawiera głosy dwóch osób jednocześnie".

Co dzieje się przy nakładających się głosach?

Błędy, które się kumulują, zamiast pozostać lokalne.

Gdy głosy się nakładają, transkrypcja pod spodem musi rozstrzygnąć, które słowa należą do kogo. Jeśli pomyli się na tym etapie, tłumaczenie przejmuje ten błąd, a następnie wygenerowane audio powiela go po raz kolejny. W efekcie dana kwestia zostaje przypisana niewłaściwemu mówcy w pliku wynikowym. Dla słuchacza jest to znacznie bardziej rażące niż niedoskonałe tłumaczenie, ponieważ treść staje się błędna, a nie tylko przybliżona.

Wtrącenia w wypowiedź to powszechny przypadek i pod jednym względem są gorsze niż ciągła rozmowa dwóch osób naraz: są na tyle krótkie, że ludzie nie traktują ich jako nakładania się głosów. Prowadzący mówiący "racja, racja" w trakcie odpowiedzi gościa to właśnie nakładające się głosy. Tak samo jak śmiech w trakcie puenty czy pół sekundy, w której jedna osoba zaczyna mówić, zanim druga skończy.

Liczba mówców ma mniejsze znaczenie, niż mogłoby się wydawać. Cztery osoby płynnie zmieniające się przy głosie to łatwiejszy plik niż dwie osoby stale wchodzące sobie w słowo.

Czy podaje się liczbę mówców?

Nie, i to wyklucza rozwiązanie, o które ludzie często pytają.

Przesyłamy trzy rzeczy: plik, język docelowy i jedną opcję. Trzy argumenty, wśród których nie ma liczby mówców, więc nie ma możliwości jej przekazania. Model sam decyduje, ile głosów znajduje się w nagraniu i jak je obsłużyć, a my nie możemy zmienić tej decyzji w Twoim imieniu.

Nie ma też możliwości edycji po fakcie. Proces dubbingowania przebiega automatycznie od początku do końca i nic nie jest poprawiane ręcznie po jego zakończeniu, o czym wprost informujemy na naszej stronie pomocy. Oznacza to, że kwestia przypisana złemu mówcy nie może zostać przeniesiona na zamówienie, a zniekształcona sekcja z nakładającymi się głosami nie zostanie poprawiona ręcznie.

To uczciwe przedstawienie ograniczeń: kontrolujesz plik, który przesyłasz, i tylko go.

Co możesz poprawić przed przesłaniem?

Całkiem sporo, jeśli nadal masz projekt nagrania, a nie tylko wyeksportowany plik końcowy.

Używaj osobnych ścieżek, jeśli je masz. Wywiad zdalny nagrany przez platformę zapisującą audio osobno dla każdego uczestnika daje Ci odseparowanych mówców. To najlepszy możliwy materiał źródłowy i warto sprawdzić, czy Twój system nagrywania już go nie generuje, zanim założysz, że dysponujesz tylko zmieszaną ścieżką.

Wytnij niepotrzebne wtrącenia. Odgłosy tła, potakiwanie "mhm" czy "tak" pod zdaniem kogoś innego nie niosą treści, a tworzą nakładanie się głosów. Ich usunięcie nic nie kosztuje, a eliminuje najtrudniejsze momenty w pliku.

Podziel plik w miejscach zmiany mówcy, jeśli pozwala na to rozmowa. Dubbingowanie długiego wywiadu w częściach, z których każda zawiera tylko jednego mówcę, całkowicie eliminuje ten problem. Koszt jest jednak realny: każda część to osobne zadanie z własną opłatą, a rozliczenie za każdy plik zaokrągla się w górę do pełnej minuty. Wywiad trwający 50 minut podzielony na dwanaście części po 4 minuty i 10 sekund zużyje 60 kredytów, podczas gdy to samo audio w jednym pliku kosztuje 50 kredytów.

Zadbaj o akustykę pomieszczenia, a nie tylko plik. Pogłos rozmywa granicę między wypowiedziami poszczególnych osób i nie da się go usunąć po nagraniu. Jeśli tworzysz treści, które planujesz dubbingować, to ważny argument za starannym przygotowaniem miejsca nagrań.

Nasz ogólny przewodnik po tym, jak przygotować dźwięk źródłowy przed dubbingiem, omawia pozostałe kwestie dotyczące materiału wejściowego, w tym powody, dla których wstępna kompresja dźwięku może zaszkodzić.

Czego oczekiwać od trudnego pliku?

Warto dostosować oczekiwania do typu treści, ponieważ różnią się one znacznie w zależności od formatu i 32 języków, na które dubbingujemy.

Napisany wcześniej scenariusz dla dwóch osób płynnie zmieniających się przy głosie zazwyczaj daje świetne rezultaty. Prowadzony panel dyskusyjny z dyscyplinowanym moderatorem wychodzi całkiem dobrze. Żywiołowy podcast, w którym dwaj przyjaciele stale wchodzą sobie w słowo, to najtrudniejszy materiał dla każdego systemu dubbingowego i żaden marketer nie powie Ci tego wprost. Długość nagrania rzadko stanowi przeszkodę przy takich treściach: akceptujemy pliki do 180 minut i 2 GB, co pokrywa niemal każdy odcinek.

Ten ostatni przypadek nie jest beznadziejny, ale wymaga przetestowania przed przetworzeniem całego katalogu. A test jest tani: przetestuj jeden odcinek w jednym języku i odsłuchaj najgorsze dwa fragmenty, jakie znajdziesz, a nie te najlepsze.

Jeśli ten test nie przyniesie żadnego rezultatu, opłata za zadanie zostanie automatycznie zwrócona. Każde zadanie, które zakończy się błędem lub osiągnie sztywny limit czasu 6 godzin bez wygenerowania pliku, zwraca kredyty bez konieczności składania wniosku. Zwrotowi nie podlega natomiast zadanie zakończone sukcesem, które wygeneruje przeciętny dubbing, ponieważ system nie ma możliwości zaklasyfikowania tego jako błędu. Zadanie się wykonało, plik powstał, kredyty zostały pobrane.

Test kosztuje Cię więc kredyty za jeden odcinek i daje odpowiedź, czy dany format się sprawdza, zanim wydasz środki na dwadzieścia kolejnych. Pobierz gotowy plik w dniu jego utworzenia: zdubbingowany plik pozostaje dostępny przez 90 dni, po czym jest trwale usuwany.

Czy problem z długością narasta przy wielu mówcach?

Mechanizm jest ten sam, ale w rozmowie staje się bardziej widoczny.

Przetłumaczona wypowiedź rzadko ma dokładnie taką samą długość jak oryginał, przy czym w monologu te różnice kumulują się w sposób niezauważalny. W dialogu objawia się to przesunięciem czasowym, które nie pasuje do wymiany zdań, co zwraca większą uwagę, ponieważ słuchacze mocno śledzą rytm rozmowy. Artykuł o tym, dlaczego zdubbingowane audio traci synchronizację, omawia głębsze przyczyny tego zjawiska i metody, które naprawdę pomagają.

Co przeczytać w następnej kolejności

Wywiady i panele dyskusyjne są powszechne w komunikacji korporacyjnej, gdzie kwestia precyzji czasowej jest zazwyczaj mniej krytyczna niż w opublikowanym wideo: dubbing wideo firmowych z języka polskiego na holenderski opisuje tę parę językową, dubbing filmów na YouTube z języka polskiego na arabski dotyczy publikowanych materiałów wideo, a przegląd zastosowań zawiera pozostałe przypadki.

Często zadawane pytania

Czy dubbing AI radzi sobie z wieloma mówcami?

Tak, a płynna wymiana zdań działa dobrze nawet przy kilku osobach. Mówienie w tym samym czasie jest najtrudniejszą częścią, ponieważ głosy zarejestrowane w tym samym momencie są ze sobą zmieszane w pliku, a ich rozdzielenie jest obiektywnie trudne. Cztery osoby płynnie zmieniające się przy głosie to łatwiejszy plik niż dwie osoby stale wchodzące sobie w słowo.

Czy mogę wskazać systemowi liczbę mówców?

Nie. Przesyłane zgłoszenie zawiera plik, język docelowy i jedną opcję, bez określania liczby mówców, więc model sam podejmuje tę decyzję. Nic nie jest też poprawiane ręcznie po zakończeniu procesu.

Jak dubbingować wywiad lub podcast z dwoma prowadzącymi?

Użyj osobnych ścieżek dla każdego uczestnika, jeśli Twój system nagrywania je zapisał. Jeśli ich nie masz, wytnij niepotrzebne wtrącenia i rozważ podział pliku w miejscach zmiany mówców. Pamiętaj, że każdy fragment to osobne zadanie, a rozliczenie za każdy plik zaokrągla się w górę, więc podział na części kosztuje więcej niż przesłanie jednego ciągłego nagrania.

Co jeśli wynik będzie słabej jakości?

Zadanie, które zakończy się niepowodzeniem, automatycznie zwraca opłatę. Zadanie, które zakończy się sukcesem, ale wygeneruje dubbing przeciętnej jakości, nie podlega zwrotowi, ponieważ żaden element systemu nie potrafi zaklasyfikować tego jako błędu. Dlatego warto poświęcić kredyty na przetestowanie jednego odcinka przed przetworzeniem całej serii.

Czytaj dalej

  • Rozwiązywanie problemów z dubbingiem

    Dlaczego zdubbingowany dźwięk rozjeżdża się z wideo

    Rozjeżdżająca się ścieżka to problem długości, a nie synchronizacji. To samo zdanie trwa dłużej w każdym języku, a przesuwanie osi czasu tego nie naprawi.

  • Rozwiązywanie problemów z dubbingiem

    Zdubbingowany plik brzmi źle? Sprawdź przyczynę

    Ścieżka diagnostyczna od zadania, które nigdy nie ruszyło, po takie, które skończyło się źle. Co dzieje się z kredytami i kiedy wracają pieniądze.

  • Rozwiązywanie problemów z dubbingiem

    Jak przygotować dźwięk przed dubbingiem AI

    O jakości dubbingu decyduje moment przed przesłaniem pliku. Nakładające się głosy, muzyka pod głosem, pogłos i kompresja psują wynik nieodwracalnie.

Gotowy na globalny zasięg?

Zacznij tłumaczyć swoje pliki audio i wideo na 32 języków już dziś.

Rozpocznij dubbing