Recap des scores
voix « papa_narration » · passe-1Les trois métriques qui comptent — WER (intelligibilité, transcription whisper-large-v3-french + jiwer), UTMOS (naturel prédit), SIM (similarité au locuteur, ECAPA). Clic sur un en-tête, ou :
Les modèles
contexte · vitesse · stabilitéTable complète (toutes voix, toutes métriques, détail par phrase) →
Les métriques priorisent l'écoute, elles ne tranchent pas. Le WER est brut (une vraie voix dans le même Whisper fait déjà 2–4 %). UTMOS est entraîné sur du MOS anglophone — à lire en classement relatif. Le verdict vient du test d'écoute en aveugle.
À l'écoute
MOS · A/B · émotion, en aveugle3 auditeur·rice·s · 40 A/B · 60 MOS · 40 émotion — en tête A/B : firered_tts3 (79%) Agrégation complète →
Méthode
docs/METHODOLOGIE.md34 phrases annotées
Longueur × registre × piège : liaison, nombre, nom propre, silence/rythme, homographe hétérophone, emprunt anglais, ponctuation répétée, onomatopée. Plus un volet long-form (podcast, journalisme).
Identique pour tous
Les 6 étapes du pipeline avisol appliquées à l'identique. Les nombres ne sont pas développés à l'entrée : on teste le TN de chaque modèle.
Clonage zero-shot
Une propre, une « difficile », féminine, âgée, accent régional. Piège avéré : un texte de référence trop célèbre casse le clonage audio+transcript.
models.lock
repo_id + révision SHA Hugging Face épinglée + commit GitHub pour le code. Re-téléchargement bit-à-bit ; une révision non épinglée est refusée.