xAI Grok TTS
TTS naturel et expressif — #3 Humanness Index Vapi (93/100), 460ms TTFA, 5 voix, 20 langues, $15/1M chars
Scores comparatifs
Architecture
Pertinence moyenne : #3 Humanness Index et 285ms TTFA compétitifs pour agents vocaux Storygami/Edugami. Hébergement US uniquement et absence de documentation RGPD sont des blocants pour un déploiement suisse/EU. Pas de timestamps lip-sync limite l'intégration avatar. À évaluer plutôt dans le cadre du pipeline S2S Grok Voice Think Fast 2.0 ($0.08/min tout compris).
Analyse
Grok TTS est le modèle text-to-speech derrière Grok Voice, les véhicules Tesla et le support client Starlink. Il se classe #3 sur le Vapi Humanness Index (93/100, 1050 votes en aveugle) — derrière Speechify Simba 3.2 (#1) et ElevenLabs Eleven v3 (#2) — avec 460ms TTFA médian (285ms avec optimize_streaming_latency). Cinq voix expressives (eve, ara, rex, sal, leo) en 20 langues, avec contrôle fin via speech tags inline ([laugh], [whisper], <emphasis>, <pause>). Clonage vocal custom via clip de référence court. Fait partie du pipeline S2S Grok Voice Think Fast 2.0 à $0.08/min tout compris.
Points forts
- #3 Humanness Index Vapi (93/100, 1050 votes) — très naturel
- 285ms TTFA (streaming optimisé)
- Speech tags inline expressifs ([laugh], [whisper], <emphasis>)
- Clonage vocal via Custom Voices API
- 5 voix, 20 langues
- Pipeline S2S Grok Voice TF2.0 à $0.08/min
- Pronunciation replacements
Limitations
- Cloud US uniquement — pas de région EU, RGPD à vérifier
- Pas d'option on-premise
- Pas de timestamps/visèmes pour lip-sync avatar
- 5 voix intégrées (vs 3000+ ElevenLabs)
- Pay-as-you-go uniquement
- Pas de score ELO Artificial Analysis TTS
Capacités vocales
Clonage vocal via Custom Voices API (clip de référence court). Le voice_id résultant fonctionne comme une voix intégrée dans session.update.
Les tags de style et les non-verbaux permettent de prescrire souffle, intensité, vitesse et intention dans le texte.
Comment : `voice_id`, `speed`, `replace`, `[pause]`, `[laugh]`, `<whisper>`, `<slow>`, `<build-intensity>` et autres tags inline.
À tester : Tester chaque balise avec la voix et la langue cibles ; les styles restent une interprétation générative.
WebSocket streaming temps réel (optimize_streaming_latency : 285ms TTFA). REST API pour batch. Speech tags inline : [laugh], [sigh], [whisper], <emphasis>, <slow>, <pause>. Vitesse de parole ajustable (0.7–1.5×).
Pas de timestamps/visèmes natifs pour lip-sync. À combiner avec un STT pour obtenir des timestamps.
Tarification
$15.00/1M chars (~$0.0075/min estimé). Pay-as-you-go uniquement. Pas de plan d'abonnement.
| Plan | Abonnement/mois | Inclus | Dépassement/min |
|---|---|---|---|
Pay-as-you-goRecommandé $15.00/1M chars (~$0.0075/min) | Gratuit | Pay-as-you-go | $0.0075 |
Souveraineté & Conformité
Cloud uniquement (US). Pas d'option on-premise documentée.
Résidence des données : US (xAI). Pas de région EU documentée. RGPD à vérifier.
Vérification de cette fiche
Vapi Humanness Index #3 (93/100, 1050 votes, 30 juil. 2026). TTFA 460ms médian / 285ms streaming optimisé (Vapi benchmark, juin 2026).
Note de mise à jour : Ajout initial — lancement standalone STT/TTS API xAI (17 avril 2026). Grok Voice Think Fast 2.0 lancé le 29 juillet 2026. Humanness Index #3 (30 juil. 2026).
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.