Deepgram Flux TTS
Nouveau — TTS conversationnel natif : 80ms premier audio (éditeur), contexte inter-tours, WebSocket + REST
Scores comparatifs
Architecture
TTS conversationnel natif, voix anglaises seulement. Utile pour étudier la réconciliation des interruptions, pas comme voix française d’Où est Ava ?. L’offre gratuite s’est terminée le 12 septembre 2026. À comparer plus tard à Sonic 3.6, Inworld TTS-2 et Gradium seulement si une voix française apparaît.
Analyse
Deepgram Flux TTS (GA, 12 août 2026) est une famille TTS conversationnelle native pour agents vocaux temps réel. Au lieu de redémarrer à chaque réponse, le modèle conserve le contexte inter-tours, rapporte ce que l'interlocuteur a réellement entendu après une interruption et permet d'ajuster vitesse, rythme et prononciation pendant la parole. Deepgram annonce un premier audio dès 80ms et inférieur à 200ms quelle que soit la longueur de réponse. Son benchmark interne revendique 2,2% de WER médian en lecture et 3,4% sur prompts difficiles, mais aucun classement indépendant public spécifique à Flux TTS n'a été identifié à ce stade. À distinguer d'Aura-2-Thalia-en : Coval/Openbenchmarks la mesure à 327ms TTFA médian, 547ms p95 et 5,1% WER ; ces chiffres indépendants ne sont pas attribuables à Flux.
Points forts
- Conversation-native : contexte inter-tours, événements de cycle de parole et réconciliation des interruptions
- Premier audio 80ms / latence <200ms indépendante de la longueur revendiqués par Deepgram
- Streaming WebSocket et batch REST sur le même endpoint /v2/speak
- Configuration Flux STT + Flux TTS unifiée pour une boucle temps réel
- Cloud, self-hosted et on-premise annoncés
Limitations
- Voix anglaises uniquement au lancement ; multilingue sur la roadmap
- Pas de clonage vocal au lancement
- Pas de timestamps mot/phonème/visème documentés pour le lip-sync avatar
- $45/1M caractères après l'offre de lancement — 3× le tarif affiché d'Aura-2
- Les chiffres 80ms et WER sont des benchmarks éditeur ; pas encore de score indépendant Flux TTS
Capacités vocales
Non disponible au lancement ; voice cloning annoncé sur la roadmap Deepgram.
Flux permet d’agir sur le rythme et une expressivité globale conversationnelle entre les tours.
Comment : `speed` (0,85–1,15) et `expressivity` bêta (-2 à 2) sur `/v2/speak`.
À tester : Ce n’est pas un dictionnaire d’émotions par réplique : valider la granularité et la disponibilité bêta sur le voice model retenu.
WebSocket streaming à /v2/speak : génération audio dès le premier token, cycle de parole, interruption, reprise et contexte inter-tours. Deepgram annonce 80ms de premier audio au mieux et <200ms quelle que soit la longueur de réponse.
Aucun timestamp mot/phonème/visème documenté au lancement.
Tarification
L’offre gratuite s’est terminée le 12 septembre 2026. Tarif ensuite : $45/1M caractères PAYG ; $40.50/1M sur Growth.
| Plan | Abonnement/mois | Inclus | Dépassement/min | Topup |
|---|---|---|---|---|
Pay As You Go La concurrence standard après lancement dépend du plan/contrat — à confirmer avec Deepgram. | Gratuit | $45 / 1M chars | $0.0450 | Oui |
GrowthRecommandé Tarif caractères réduit de 10% ; crédits prépayés Growth et concurrence à confirmer. | Gratuit | $40.50 / 1M chars | $0.0405 | Oui |
Souveraineté & Conformité
Cloud, self-hosted et on-premise annoncés ; confirmer les modalités, la résidence UE et les garanties contractuelles avec Deepgram.
Résidence des données : Régions cloud non précisées publiquement pour Flux TTS ; self-hosted/on-premise annoncés, à qualifier pour Suisse/UE.
Positionnement de Deepgram Flux TTS
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Flux TTS fait évoluer l'offre Deepgram d'une synthèse rapide vers une couche vocale conversationnelle avec état. Sa promesse est la simplicité opérationnelle, pas encore une avance de qualité vérifiée indépendamment — tester les revendications sous charge multi-tours proche d'Où est Ava ? avant tout engagement.
A. Positionnement stratégique
Client cible : Voice-agent developer / Enterprise — English real-time conversational agents
TTS conversationnel natif : contexte inter-tours, réconciliation des interruptions et génération vocale streaming-first sont pris en charge par le modèle plutôt que reconstruits par l'orchestration cliente.
B. Avantage concurrentiel
- Stack apparié Flux STT + Flux TTS : un fournisseur, une configuration et un cycle de parole explicite
- Architecture Mamba à espace d'états et génération texte/audio intercalée pour viser une faible latence sans réinitialiser le contexte de session
- Déploiement cloud, self-hosted et on-premise annoncé pour les agents vocaux réglementés
Vulnérabilité : Nouveau modèle anglophone sans clonage vocal ni benchmark public indépendant propre à Flux pour l'instant. Le prix post-lancement est sensiblement supérieur à Aura-2 et les conditions self-hosted/UE restent à vérifier contractuellement.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Le self-hosted et l'on-premise sont annoncés, mais les preuves de déploiement, la résidence UE et les conditions commerciales doivent être validées avant de considérer Flux comme une option souveraine.
Build vs. Buy
Acheter pour une expérimentation Phase B sur agents anglophones. Préserver un adaptateur TTS modulaire et garder Cartesia, Inworld ou Gradium comme voies comparables jusqu'à l'obtention de benchmarks indépendants Flux.
Risque de lock-in
Les capacités les plus différenciantes — état conversationnel, réconciliation des interruptions et futur état partagé STT/TTS — sont des comportements de plateforme propriétaires qui accroissent les coûts de migration.
Alignement roadmap
Fort intérêt expérimental pour la conversation temps réel et les interruptions ; intérêt conditionnel pour Où est Ava ? tant que FR/DE, données d'alignement avatar et déploiement UE/on-premise ne sont pas validés.
Vérification de cette fiche
Deepgram Flux TTS launch benchmark (vendor, 12 Aug 2026). Independent Flux ranking not yet available. Coval/Openbenchmarks Aura-2 baseline refreshed 12 Aug 2026.
Note de mise à jour : 30 septembre 2026 : l’offre gratuite du 12 août au 12 septembre est terminée. Pas de nouveau modèle. Les voix restent anglaises.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.