GamiWays

Classement personnalisé des outils Voice

Pondérez les critères selon votre contexte et obtenez un classement dynamique TTS / STT.

Profils prédéfinis

Pondération des critères

0–10
Qualité vocale5
Latence (TTFA)5
Clonage vocal5
Expressivité / direction de jeu5
Souveraineté données5
Coût / Prix5
Multilingue5

Chaque critère est noté de 0 à 10. Un poids de 0 exclut le critère du calcul. Le score final est la moyenne pondérée.

Classement TTS — 25 outils

Trié par score pondéré
🥇
API CloudMAJ

Inworld Realtime TTS-2 + Flash

TTS conversationnel disponible : direction libre, contexte audio, non-verbaux et variante Flash à faible délai serveur

Sov. mediumLock-in medium
8.4
/10
Qualité×5
9
Latence×5
8
Clonage×5
9
Expressivité / direction de jeu×5
10
Souveraineté×5
6
Prix×5
7
100ms TTFAELO 1198Commercial (training framework open-sourced)
🥈
Open Source

Miso-TTS v1 (8B)

110ms latency — most emotive open-source TTS with RVQ architecture

8.3
/10
Qualité×5
9
Latence×5
9
Clonage×5
9
Expressivité / direction de jeu×5
10
Souveraineté×5
10
Prix×5
10
110ms TTFAModified MIT (open-source weights on Hugging Face)
🥉
Open Source

Orpheus 3B

LLM-based TTS — ultra-natural speech with emotion tags and non-verbals

Sov. highLock-in low
7.9
/10
Qualité×5
8
Latence×5
6
Clonage×5
7
Expressivité / direction de jeu×5
9
Souveraineté×5
10
Prix×5
10
200ms TTFAApache 2.0
4
API CloudMAJ

Eleven v4 / v4 Turbo

Eleven v4 (28 sept. 2026) — 90+ langues, tags audio et Turbo ~150 ms premier son (éditeur). v3 reste le repère ELO d’août.

Sov. mediumLock-in medium
7.1
/10
Qualité×5
8
Latence×5
8
Clonage×5
10
Expressivité / direction de jeu×5
10
Souveraineté×5
2
Prix×5
2
150ms TTFAELO 1177Commercial
5
Open Source

Sesame CSM

Conversational Speech Model — crosses the uncanny valley of voice

Sov. highLock-in low
7.1
/10
Qualité×5
9
Latence×5
3
Clonage×5
7
Expressivité / direction de jeu×5
10
Souveraineté×5
10
Prix×5
10
400ms TTFAApache 2.0 (research)
6
Open Source

Dia (Nari Labs)

Ultra-realistic dialogue generation — multi-speaker, emotion, non-verbals

Sov. highLock-in low
7.0
/10
Qualité×5
8
Latence×5
4
Clonage×5
7
Expressivité / direction de jeu×5
9
Souveraineté×5
10
Prix×5
10
300ms TTFAApache 2.0
7
Open Source

Kyutai TTS 1.6B

Delayed streams modeling — streaming-native, timestamps, batching

Sov. highLock-in low
7.0
/10
Qualité×5
7
Latence×5
8
Clonage×5
6
Expressivité / direction de jeu×5
6
Souveraineté×5
10
Prix×5
10
100ms TTFACC-BY 4.0
8
Open SourceMAJ

Voxtral TTS (Mistral)

Open-weights TTS from Mistral — fast, adaptable, 9 languages (Mar 2026)

Sov. highLock-in low
7.0
/10
Qualité×5
4
Latence×5
8
Clonage×5
7
Expressivité / direction de jeu×5
6
Souveraineté×5
9
Prix×5
9
150ms TTFAELO 1081Open weights (Mistral license)
9
API Cloud

StepAudio 2.5 TTS

Contextual TTS — ELO 1187, dual-level context control, zero-shot voice cloning in 3 sec

7.0
/10
Qualité×5
9
Latence×5
6
Clonage×5
9
Expressivité / direction de jeu×5
10
Souveraineté×5
1
Prix×5
5
200ms TTFAELO 1205Proprietary (StepFun / 阶跃星辰)
10
API CloudNouveau

MiniMax Speech 2.8

Sound tags natifs — $0.10/1M chars, 17 langues, clonage vocal instant

7.0
/10
Qualité×5
8
Latence×5
6
Clonage×5
8
Expressivité / direction de jeu×5
9
Souveraineté×5
1
Prix×5
10
200ms TTFAELO 1175Commercial
11
API CloudNouveau

xAI Grok TTS

TTS naturel et expressif — #3 Humanness Index Vapi (93/100), 460ms TTFA, 5 voix, 20 langues, $15/1M chars

6.7
/10
Qualité×5
8
Latence×5
8
Clonage×5
7
Expressivité / direction de jeu×5
8
Souveraineté×5
2
Prix×5
7
285ms TTFACommercial
12
API CloudMAJ

Cartesia Sonic 3.6

Sonic 3.6 (27 août 2026) — 44 langues, plafond éditeur sous 90 ms. ELO fiche = snapshot du 18 août.

Sov. lowLock-in medium
6.6
/10
Qualité×5
4
Latence×5
9
Clonage×5
8
Expressivité / direction de jeu×5
8
Souveraineté×5
4
Prix×5
5
90ms TTFAELO 1072Commercial
13
API CloudNouveau

Gemini 3.8 Flash TTS

Nouveau — design de voix et acting ligne à ligne, 130 langues. Pas de TTFA publié.

6.4
/10
Qualité×5
8
Latence×5
4
Clonage×5
7
Expressivité / direction de jeu×5
9
Souveraineté×5
2
Prix×5
5
0ms TTFACommercial
14
Open Source

Chatterbox (Resemble AI)

MIT license — beats ElevenLabs in blind tests (63.75% preference)

Sov. highLock-in low
6.4
/10
Qualité×5
2
Latence×5
7
Clonage×5
8
Expressivité / direction de jeu×5
8
Souveraineté×5
10
Prix×5
9
150ms TTFAELO 1021MIT
15
API Cloud

Smallest.ai Lightning V3.1

Full voice pipeline (TTS + STT + LLM + S2S) — sub-100ms, 15+ languages

6.4
/10
Qualité×5
2
Latence×5
9
Clonage×5
7
Expressivité / direction de jeu×5
6
Souveraineté×5
6
Prix×5
8
100ms TTFAELO 1024Commercial
16
API CloudNouveau

Gradium TTS

TTS streaming français avec précision de prononciation structurée et résidence UE activable

6.4
/10
Qualité×5
5
Latence×5
7
Clonage×5
8
Expressivité / direction de jeu×5
3
Souveraineté×5
6
Prix×5
9
216ms TTFAELO 1096Commercial
17
API CloudNouveau

Gemini 3.8 Flash-Lite TTS

Nouveau — variante débit et agents en cascade, 101 langues. Pas de TTFA publié.

6.1
/10
Qualité×5
7
Latence×5
5
Clonage×5
6
Expressivité / direction de jeu×5
8
Souveraineté×5
2
Prix×5
6
0ms TTFACommercial
18
API Cloud

Fish Audio OpenAudio S1

Pay-as-you-go voice cloning — 70% cheaper than ElevenLabs

Sov. highLock-in low
6.1
/10
Qualité×5
6
Latence×5
6
Clonage×5
8
Expressivité / direction de jeu×5
7
Souveraineté×5
4
Prix×5
7
200ms TTFAELO 1124Commercial
19
Open Source

Ultravox v0.5

Speech-to-speech model — ~100ms latency, no ASR/TTS pipeline needed

Sov. highLock-in low
6.1
/10
Qualité×5
7
Latence×5
10
Clonage×5
1
Expressivité / direction de jeu×5
6
Souveraineté×5
7
Prix×5
7
100ms TTFACommercial API (CC-BY-NC-4.0 weights)
20
Open Source

Moshi (Kyutai)

Full-duplex spoken dialogue — simultaneous listening and speaking

Sov. highLock-in low
6.1
/10
Qualité×5
7
Latence×5
8
Clonage×5
1
Expressivité / direction de jeu×5
6
Souveraineté×5
10
Prix×5
10
200ms TTFACC-BY 4.0
21
API Cloud

Hume AI Octave 2

LLM-based emotional TTS — natural language emotion control

Sov. lowLock-in high
5.9
/10
Qualité×5
3
Latence×5
8
Clonage×5
6
Expressivité / direction de jeu×5
10
Souveraineté×5
2
Prix×5
8
100ms TTFAELO 1057Commercial
22
Open Source

Kokoro 82M v1.0

Highest-ranked open-weight TTS — ELO 1059, 82M params, Apache 2.0

Sov. highLock-in low
5.7
/10
Qualité×5
3
Latence×5
9
Clonage×5
1
Expressivité / direction de jeu×5
5
Souveraineté×5
10
Prix×5
10
60ms TTFAELO 1059Apache 2.0
23
API CloudNouveau

Deepgram Flux TTS

Nouveau — TTS conversationnel natif : 80ms premier audio (éditeur), contexte inter-tours, WebSocket + REST

Sov. mediumLock-in high
5.1
/10
Qualité×5
7
Latence×5
9
Clonage×5
1
Expressivité / direction de jeu×5
8
Souveraineté×5
6
Prix×5
4
80ms TTFACommercial
24
API CloudMAJ

OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1

2.1 : interruptions et bruit annoncés améliorés. GPT-Live-1 (10 sept.) : full-duplex à 0,05 $/min, plus le modèle derrière.

Sov. lowLock-in high
4.7
/10
Qualité×5
4
Latence×5
6
Clonage×5
1
Expressivité / direction de jeu×5
8
Souveraineté×5
2
Prix×5
3
300ms TTFAELO 1070Commercial
25
API CloudMAJ

Deepgram Aura 2

Aura 2 baseline — Coval: 327ms median TTFA, 5.1% WER (12 Aug 2026)

Sov. mediumLock-in medium
4.4
/10
Qualité×5
6
Latence×5
9
Clonage×5
1
Expressivité / direction de jeu×5
4
Souveraineté×5
3
Prix×5
7
80ms TTFACommercial

Méthodologie : Les scores bruts (1–10) sont issus de benchmarks publics (Artificial Analysis ELO, WER Koenecke, TTFA mesurés). La pondération est appliquée via une moyenne pondérée. Les badges souveraineté et lock-in proviennent de l'analyse stratégique GamiWays.