Classement personnalisé des outils Voice
Pondérez les critères selon votre contexte et obtenez un classement dynamique TTS / STT.
Profils prédéfinis
Pondération des critères
0–10Chaque critère est noté de 0 à 10. Un poids de 0 exclut le critère du calcul. Le score final est la moyenne pondérée.
Classement TTS — 25 outils
Trié par score pondéréInworld Realtime TTS-2 + Flash
TTS conversationnel disponible : direction libre, contexte audio, non-verbaux et variante Flash à faible délai serveur
Miso-TTS v1 (8B)
110ms latency — most emotive open-source TTS with RVQ architecture
Orpheus 3B
LLM-based TTS — ultra-natural speech with emotion tags and non-verbals
Eleven v4 / v4 Turbo
Eleven v4 (28 sept. 2026) — 90+ langues, tags audio et Turbo ~150 ms premier son (éditeur). v3 reste le repère ELO d’août.
Sesame CSM
Conversational Speech Model — crosses the uncanny valley of voice
Dia (Nari Labs)
Ultra-realistic dialogue generation — multi-speaker, emotion, non-verbals
Kyutai TTS 1.6B
Delayed streams modeling — streaming-native, timestamps, batching
Voxtral TTS (Mistral)
Open-weights TTS from Mistral — fast, adaptable, 9 languages (Mar 2026)
StepAudio 2.5 TTS
Contextual TTS — ELO 1187, dual-level context control, zero-shot voice cloning in 3 sec
MiniMax Speech 2.8
Sound tags natifs — $0.10/1M chars, 17 langues, clonage vocal instant
xAI Grok TTS
TTS naturel et expressif — #3 Humanness Index Vapi (93/100), 460ms TTFA, 5 voix, 20 langues, $15/1M chars
Cartesia Sonic 3.6
Sonic 3.6 (27 août 2026) — 44 langues, plafond éditeur sous 90 ms. ELO fiche = snapshot du 18 août.
Gemini 3.8 Flash TTS
Nouveau — design de voix et acting ligne à ligne, 130 langues. Pas de TTFA publié.
Chatterbox (Resemble AI)
MIT license — beats ElevenLabs in blind tests (63.75% preference)
Smallest.ai Lightning V3.1
Full voice pipeline (TTS + STT + LLM + S2S) — sub-100ms, 15+ languages
Gradium TTS
TTS streaming français avec précision de prononciation structurée et résidence UE activable
Gemini 3.8 Flash-Lite TTS
Nouveau — variante débit et agents en cascade, 101 langues. Pas de TTFA publié.
Fish Audio OpenAudio S1
Pay-as-you-go voice cloning — 70% cheaper than ElevenLabs
Ultravox v0.5
Speech-to-speech model — ~100ms latency, no ASR/TTS pipeline needed
Moshi (Kyutai)
Full-duplex spoken dialogue — simultaneous listening and speaking
Hume AI Octave 2
LLM-based emotional TTS — natural language emotion control
Kokoro 82M v1.0
Highest-ranked open-weight TTS — ELO 1059, 82M params, Apache 2.0
Deepgram Flux TTS
Nouveau — TTS conversationnel natif : 80ms premier audio (éditeur), contexte inter-tours, WebSocket + REST
OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1
2.1 : interruptions et bruit annoncés améliorés. GPT-Live-1 (10 sept.) : full-duplex à 0,05 $/min, plus le modèle derrière.
Deepgram Aura 2
Aura 2 baseline — Coval: 327ms median TTFA, 5.1% WER (12 Aug 2026)
Méthodologie : Les scores bruts (1–10) sont issus de benchmarks publics (Artificial Analysis ELO, WER Koenecke, TTFA mesurés). La pondération est appliquée via une moyenne pondérée. Les badges souveraineté et lock-in proviennent de l'analyse stratégique GamiWays.