Provenance et détection 6 min de lecture

Doublage IA : peut-on conserver sa propre voix ?

Le doublage IA promet de conserver votre voix grâce au clonage vocal. Voici ce que la technologie permet réellement, sans fausses promesses.

Oui, le doublage est construit à partir de votre voix et non d'une voix off de catalogue. Mais cette affirmation suscite des attentes parfois irréalistes : voici ce qu'elle signifie concrètement.

Nos propres pages de cas d'usage affichent la promesse suivante : "Conservez votre voix d'origine grâce à un clonage vocal IA de haute fidélité." C'est exact, mais isolée, cette phrase suscite des attentes que la technologie ne peut pas honorer. Cette page vous propose une explication honnête de cette fonctionnalité.

D'où provient la voix

Du fichier que vous importez, et de rien d'autre.

Il n'y a aucune étape d'enregistrement préalable dans notre produit. Aucun écran ne vous demande de lire trois phrases dans un micro, il n'y a aucun profil vocal stocké, ni aucune bibliothèque de vos anciens enregistrements. L'import nécessite simplement un fichier et une langue cible, et la soumission du travail transmet ce fichier, la langue cible et un paramètre unique.

Cela a une conséquence importante : le seul matériel disponible pour créer la voix doublée est l'audio du fichier que vous venez d'envoyer. Une vidéo de 5 minutes fournit 5 minutes de votre voix. Un extrait de 30 secondes en fournit 30 secondes.

Cela signifie également qu'aucun clone vocal réutilisable n'est conservé de notre côté. Rien ne permet de générer des paroles que vous n'auriez jamais prononcées, puisqu'aucun profil de ce type n'est créé. Votre fichier importé est supprimé dès que le doublage est généré, et dans tous les cas sous 24 heures.

Ce que "conserver votre voix" promet réellement

Elle garantit le timbre et le caractère général de la voix. Le résultat est reconnaissable comme étant le vôtre, plutôt que celui d'une voix off générique.

En revanche, elle ne promet pas les éléments suivants :

Votre accent dans la langue cible. Vous entendre parler allemand n'est pas la même chose qu'entendre un locuteur natif allemand ayant votre timbre de voix. Le doublage vise la seconde option.

Vos intentions de jeu. L'accent mis sur un mot précis, une pause marquée au bon moment, le ton d'une plaisanterie. Ce sont des choix artistiques d'interprétation, et ils sont réinventés dans la langue cible plutôt que transférés.

Une régularité parfaite sur un long fichier. Le timbre vocal peut légèrement dériver sur une longue séquence, surtout si la qualité de l'audio source varie.

Votre voix à partir d'un mauvais enregistrement. Le modèle fait avec ce que le fichier lui donne. Une forte réverbération, une musique de fond dans les mêmes fréquences que votre voix, ou des locuteurs qui se coupent la parole nuisent à la qualité du traitement, et le résultat s'en ressent. Notre guide de préparation de l'audio source explique comment corriger ces problèmes.

Pour être tout à fait honnête : le résultat ressemble à votre voix, s'exprimant dans une langue que vous ne parlez peut-être pas, avec une intonation qui n'est pas tout à fait la vôtre. Pour la plupart des contenus, c'est le résultat recherché. Pour une véritable performance d'acteur, ce n'est pas le cas.

S'agit-il de la même chose que le clonage vocal ?

La technologie sous-jacente est la même, mais le fonctionnement diffère, et cette distinction est tout aussi essentielle sur le plan juridique que technique.

Le clonage vocal, au sens strict, consiste à enregistrer une voix dans un modèle réutilisable, puis à s'en servir pour générer de nouveaux discours arbitraires. Vous pourriez alors faire dire n'importe quoi à cette voix.

Le doublage, quant à lui, prend un enregistrement existant et produit une version traduite de cet enregistrement précis. Il n'en résulte aucun modèle réutilisable, et aucune possibilité de vous faire dire des mots que vous n'avez pas prononcés.

Cette différence explique pourquoi l'analyse du consentement s'applique différemment lorsque vous doublez vos propres contenus, un sujet que nous avons abordé dans l'article faut-il un consentement pour cloner une voix dans le cadre d'un doublage. C'est aussi pour cela que l'absence d'étape d'enregistrement préalable n'est pas un manque de fonctionnalité, mais une réduction de la surface d'attaque.

Que se passe-t-il si plusieurs personnes s'expriment dans le fichier ?

La voix de chaque locuteur structure ses propres répliques doublées, de sorte qu'un dialogue à deux voix ne se retrouve pas résumé à un seul narrateur lisant les deux rôles.

La principale limite réside dans la séparation des voix plutôt que dans la synthèse. Lorsque les paroles se chevauchent, attribuer chaque mot au bon locuteur devient complexe, et les erreurs se répercutent sur le résultat final. Nous ne transmettons pas de nombre de locuteurs, le modèle prend donc cette décision seul, et aucune correction manuelle n'est effectuée a posteriori. Notre article sur le doublage d'une vidéo avec plusieurs locuteurs détaille les solutions possibles à la source.

Peut-on détecter qu'il s'agit d'une voix synthétique ?

Parfois à l'oreille, et de plus en plus grâce à des outils de détection : ce sont deux questions distinctes avec des réponses différentes. L'article Est-il possible de détecter si votre vidéo a été doublée par une IA sépare ces deux aspects, tandis que notre sujet sur ce qu'est SynthID aborde la question du filigrane.

En résumé : ce qui trahit généralement un doublage n'est pas tant le timbre de la voix, mais plutôt les décalages de synchronisation et une intonation trop plate sur un contenu source complexe.

Définir vos attentes avant d'acheter

Le test le plus réaliste consiste à traiter un fichier et à demander à quelqu'un qui vous connaît bien s'il reconnaît votre voix. Nous sommes de mauvais juges lorsqu'il s'agit d'écouter nos propres enregistrements, et votre propre réaction en vous entendant ne sera pas celle de votre public.

Un seul travail, une seule langue, des crédits sans date d'expiration, et un remboursement intégral si le travail échoue complètement. Écoutez une séquence contenant votre moins bon enregistrement audio plutôt que le meilleur, car c'est là que les limites de la technologie se révèlent.

Pour l'aspect pratique d'un projet spécifique, doubler des vidéos YouTube de l'anglais vers le français est un point de départ fréquent, tout comme doubler des vidéos YouTube du français vers l'italien, et notre catalogue des cas d'usage présente les 32 langues que nous prenons en charge.

FAQ

Le doublage IA utilise-t-il ma propre voix ?

Il génère l'audio doublé à partir de la voix présente dans le fichier que vous importez. Le résultat conserve donc votre timbre de voix plutôt que de faire appel à une voix off de catalogue. Il n'y a aucune étape d'enregistrement préalable ni de profil vocal stocké : le matériel source se limite au fichier lui-même.

Mon doublage ressemblera-t-il exactement à ma voix ?

Il ressemblera de manière reconnaissable à votre voix, avec une intonation qui ne sera pas tout à fait la vôtre. L'accentuation, le rythme et la formulation sont réadaptés dans la langue cible plutôt que transférés, et vous n'y entendrez pas votre accent habituel. Un audio source de mauvaise qualité altère sensiblement la ressemblance.

Conservez-vous une copie de ma voix ?

Non. Aucun profil vocal n'est créé à aucun moment, et le fichier que vous avez importé est supprimé dès que le doublage est généré, et sous 24 heures dans tous les cas. Rien ne subsiste pour générer un nouveau discours avec votre voix.

Cela fonctionne-t-il avec plusieurs locuteurs ?

Oui, chaque locuteur détermine ses propres répliques doublées. La difficulté réside dans les chevauchements de paroles, où attribuer les mots à la bonne personne devient incertain, et aucune correction manuelle n'est effectuée après coup.

Continuer la lecture

Prêt à passer à l'échelle mondiale ?

Commencez à traduire vos fichiers audio et vidéo dans 32 langues dès aujourd'hui.

Commencer le doublage maintenant