Benchmark TTSFR
Benchmark · TTS open-source · Français

Quel modèle pour quelle voix, en français.

Neuf modèles de synthèse vocale open-source, mis à l'épreuve sur un corpus français annoté — liaison, nombres, noms propres, homographes, dialogue émotionnel. Mesures reproductibles ; l'écoute humaine tranche.

6 modèles classés 34 phrases annotées 3 répétitions 11 voix de référence RTX 4090 révisions HF épinglées
WER — voix « papa_narration », barre courte = meilleur
0%2%4%6%8%firered_tts33.6%voxcpm24.2%chatterbox_v34.8%cosyvoice3_05b4.9%xtts_v27.4%moss_tts_local_v157.9%

Recap des scores

voix « papa_narration » · passe-1

Les trois métriques qui comptent — WER (intelligibilité, transcription whisper-large-v3-french + jiwer), UTMOS (naturel prédit), SIM (similarité au locuteur, ECAPA). Clic sur un en-tête, ou :

meilleurcorrectà surveiller↓ plus bas = mieux↑ plus haut = mieux
hors classement — f5_tts (FR non supporté)

Les modèles

contexte · vitesse · stabilité
1firered_tts3Apache-2.0
dcf1bdcd1b · candidat SOTA n°1 (veille sept. 2026)
1.00× RTF·4% CV·0% anom.·8 Go VRAM~
2voxcpm2Apache-2.0
32279effe8 · candidat de référence (veille juin 2026)
0.42× RTF·3% CV·6% anom.·6 Go VRAM~
5bb1f6ee58 · baseline de référence (moteur de prod avisol)
0.59× RTF·3% CV·2% anom.·4 Go VRAM~
4cosyvoice3_05bApache-2.0
29e01c4e8d · backup stable, FR inclus
0.82× RTF·7% CV·0% anom.·5 Go VRAM~
5xtts_v2CPML · non comm.
6c2b0d75ea · référence qualité (hors service : licence non commerciale)
0.24× RTF·10% CV·1% anom.·4 Go VRAM~
be7766a673 · moteur de prod avisol (5B, piloté par durée cible)
0.69× RTF·8% CV·3% anom.·15 Go VRAM~

Table complète (toutes voix, toutes métriques, détail par phrase) →

Les métriques priorisent l'écoute, elles ne tranchent pas. Le WER est brut (une vraie voix dans le même Whisper fait déjà 2–4 %). UTMOS est entraîné sur du MOS anglophone — à lire en classement relatif. Le verdict vient du test d'écoute en aveugle.

À l'écoute

MOS · A/B · émotion, en aveugle

3 auditeur·rice·s · 40 A/B · 60 MOS · 40 émotion — en tête A/B : firered_tts3 (79%)  Agrégation complète →

Méthode

docs/METHODOLOGIE.md
Corpus

34 phrases annotées

Longueur × registre × piège : liaison, nombre, nom propre, silence/rythme, homographe hétérophone, emprunt anglais, ponctuation répétée, onomatopée. Plus un volet long-form (podcast, journalisme).

Pré-traitement

Identique pour tous

Les 6 étapes du pipeline avisol appliquées à l'identique. Les nombres ne sont pas développés à l'entrée : on teste le TN de chaque modèle.

Voix de référence

Clonage zero-shot

Une propre, une « difficile », féminine, âgée, accent régional. Piège avéré : un texte de référence trop célèbre casse le clonage audio+transcript.

Reproductibilité

models.lock

repo_id + révision SHA Hugging Face épinglée + commit GitHub pour le code. Re-téléchargement bit-à-bit ; une révision non épinglée est refusée.

Révisions épinglées

Hugging Face
chatterbox_v35bb1f6ee58
cosyvoice3_05b29e01c4e8d
firered_tts3dcf1bdcd1b
kokoro_82mf3ff357179
moss_tts_local_v15be7766a673
voxcpm232279effe8
xtts_v26c2b0d75ea