Je vous ai déjà fait un petit article de clonage de voix avec l'IA avec TTS (Text-to-Speech) en Python, ici.
Cela fera presque 2 ans, et j'ai testé des technologies différentes:
- Bark
- TTS
- ElevenLabs (en payant)
Mon constat ?
En opensource je n'ai jamais trouvé d'équivalent à ElevenLabs. Il y a tout de même un écart de qualité considérable car j'arrive souvent à reproduire le timbre, mais rarement la diction ou les accents.
Mais ça... C'était avant !
Avant de découvrir Qwen3-TTS un model chinois qui est dinguissime et qui permet de faire tout ce que je pensais jusqu'alors trop compliqué. Et les chinois, dans leur élan de générosité et leur démonstration de compétence, nous ont offert ce model en opensource !
On parle d'un modèle de 1.7 milliards de paramètres, même s'il vous faut une bécane solide pour pouvoir en profiter.
J'ai fait des tests sur mon Mac M4 et je l'ai mis en PLS. Alors que ça marche nickel sur ma station IA avec une RTX 5060 Ti.
Vous pouvez tester le model sur HuggingFace, ça vous donnera déjà une idée de son potentiel.

Et pour vous donner un exemple, j'ai essayé de faire chanter du Kaaris à Cartman:
J'ai même essayé avec Eddy Malou et là il reprend même l'accent (ce qui est une prouesse):
Pour générer de tels samples sur ma RTX 5060 Ti il faut compter 15 secondes environ.
Amusez-vous bien 😉.