GamiWays
API CloudCommercial

xAI Grok TTS

TTS naturel et expressif — #3 Humanness Index Vapi (93/100), 460ms TTFA, 5 voix, 20 langues, $15/1M chars

285 ms
TTFA (meilleur cas)
460 ms
TTFA (typique)
$15/1M
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale8/10
Latence8/10
Clonage vocal7/10
Expressivité8/10
Direction de jeu7/10
Souveraineté2/10
Accessibilité prix7/10
Multilingue7/10

Architecture

ArchitecturePropriétaire (xAI), même stack que Grok Voice Think Fast 2.0. Streaming WebSocket + REST batch.
ParamètresN/A (cloud)
Langues20
Auto-hébergeable No
Streaming Oui
GamiWays
Phase B R&D — Évaluation pipeline S2S

Pertinence moyenne : #3 Humanness Index et 285ms TTFA compétitifs pour agents vocaux Storygami/Edugami. Hébergement US uniquement et absence de documentation RGPD sont des blocants pour un déploiement suisse/EU. Pas de timestamps lip-sync limite l'intégration avatar. À évaluer plutôt dans le cadre du pipeline S2S Grok Voice Think Fast 2.0 ($0.08/min tout compris).

Analyse

Grok TTS est le modèle text-to-speech derrière Grok Voice, les véhicules Tesla et le support client Starlink. Il se classe #3 sur le Vapi Humanness Index (93/100, 1050 votes en aveugle) — derrière Speechify Simba 3.2 (#1) et ElevenLabs Eleven v3 (#2) — avec 460ms TTFA médian (285ms avec optimize_streaming_latency). Cinq voix expressives (eve, ara, rex, sal, leo) en 20 langues, avec contrôle fin via speech tags inline ([laugh], [whisper], <emphasis>, <pause>). Clonage vocal custom via clip de référence court. Fait partie du pipeline S2S Grok Voice Think Fast 2.0 à $0.08/min tout compris.

Points forts

  • #3 Humanness Index Vapi (93/100, 1050 votes) — très naturel
  • 285ms TTFA (streaming optimisé)
  • Speech tags inline expressifs ([laugh], [whisper], <emphasis>)
  • Clonage vocal via Custom Voices API
  • 5 voix, 20 langues
  • Pipeline S2S Grok Voice TF2.0 à $0.08/min
  • Pronunciation replacements

Limitations

  • Cloud US uniquement — pas de région EU, RGPD à vérifier
  • Pas d'option on-premise
  • Pas de timestamps/visèmes pour lip-sync avatar
  • 5 voix intégrées (vs 3000+ ElevenLabs)
  • Pay-as-you-go uniquement
  • Pas de score ELO Artificial Analysis TTS

Capacités vocales

Clonage vocal Oui

Clonage vocal via Custom Voices API (clip de référence court). Le voice_id résultant fonctionne comme une voix intégrée dans session.update.

Direction émotionnelle & jeuDirection par instructions

Les tags de style et les non-verbaux permettent de prescrire souffle, intensité, vitesse et intention dans le texte.

Comment : `voice_id`, `speed`, `replace`, `[pause]`, `[laugh]`, `<whisper>`, `<slow>`, `<build-intensity>` et autres tags inline.

À tester : Tester chaque balise avec la voix et la langue cibles ; les styles restent une interprétation générative.

Streaming Oui

WebSocket streaming temps réel (optimize_streaming_latency : 285ms TTFA). REST API pour batch. Speech tags inline : [laugh], [sigh], [whisper], <emphasis>, <slow>, <pause>. Vitesse de parole ajustable (0.7–1.5×).

Données lip-sync No

Pas de timestamps/visèmes natifs pour lip-sync. À combiner avec un STT pour obtenir des timestamps.

Tarification

Prix / 1M chars
à partir de $15
selon l'abonnement souscrit
Prix / minute
à partir de $0.0075
selon l'abonnement souscrit
Offre gratuite
Crédit de démarrage via console.x.ai (montant non publié)

$15.00/1M chars (~$0.0075/min estimé). Pay-as-you-go uniquement. Pas de plan d'abonnement.

PlanAbonnement/moisInclusDépassement/min
Pay-as-you-goRecommandé

$15.00/1M chars (~$0.0075/min)

GratuitPay-as-you-go$0.0075

Souveraineté & Conformité

On-premise No

Cloud uniquement (US). Pas d'option on-premise documentée.

GDPR No

Résidence des données : US (xAI). Pas de région EU documentée. RGPD à vérifier.

Vérification de cette fiche

Vérifiée le 30 juillet 2026

Vapi Humanness Index #3 (93/100, 1050 votes, 30 juil. 2026). TTFA 460ms médian / 285ms streaming optimisé (Vapi benchmark, juin 2026).

Note de mise à jour : Ajout initial — lancement standalone STT/TTS API xAI (17 avril 2026). Grok Voice Think Fast 2.0 lancé le 29 juillet 2026. Humanness Index #3 (30 juil. 2026).

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.