GamiWays
API CloudCommercial

Deepgram Flux TTS

Nouveau — TTS conversationnel natif : 80ms premier audio (éditeur), contexte inter-tours, WebSocket + REST

80 ms
TTFA (meilleur cas)
200 ms
TTFA (typique)
$45/1M
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale7/10
Latence9/10
Clonage vocal1/10
Expressivité8/10
Direction de jeu10/10
Souveraineté6/10
Accessibilité prix4/10
Multilingue1/10

Architecture

ArchitectureMamba State Space Model + codec neural haute fidélité + génération texte/audio intercalée
ParamètresN/A (cloud / enterprise self-hosted)
Langues1
Auto-hébergeable Oui
Streaming Oui
GamiWays
Phase B R&D — Test conversationnel temps réel

TTS conversationnel natif, voix anglaises seulement. Utile pour étudier la réconciliation des interruptions, pas comme voix française d’Où est Ava ?. L’offre gratuite s’est terminée le 12 septembre 2026. À comparer plus tard à Sonic 3.6, Inworld TTS-2 et Gradium seulement si une voix française apparaît.

Analyse

Deepgram Flux TTS (GA, 12 août 2026) est une famille TTS conversationnelle native pour agents vocaux temps réel. Au lieu de redémarrer à chaque réponse, le modèle conserve le contexte inter-tours, rapporte ce que l'interlocuteur a réellement entendu après une interruption et permet d'ajuster vitesse, rythme et prononciation pendant la parole. Deepgram annonce un premier audio dès 80ms et inférieur à 200ms quelle que soit la longueur de réponse. Son benchmark interne revendique 2,2% de WER médian en lecture et 3,4% sur prompts difficiles, mais aucun classement indépendant public spécifique à Flux TTS n'a été identifié à ce stade. À distinguer d'Aura-2-Thalia-en : Coval/Openbenchmarks la mesure à 327ms TTFA médian, 547ms p95 et 5,1% WER ; ces chiffres indépendants ne sont pas attribuables à Flux.

Points forts

  • Conversation-native : contexte inter-tours, événements de cycle de parole et réconciliation des interruptions
  • Premier audio 80ms / latence <200ms indépendante de la longueur revendiqués par Deepgram
  • Streaming WebSocket et batch REST sur le même endpoint /v2/speak
  • Configuration Flux STT + Flux TTS unifiée pour une boucle temps réel
  • Cloud, self-hosted et on-premise annoncés

Limitations

  • Voix anglaises uniquement au lancement ; multilingue sur la roadmap
  • Pas de clonage vocal au lancement
  • Pas de timestamps mot/phonème/visème documentés pour le lip-sync avatar
  • $45/1M caractères après l'offre de lancement — 3× le tarif affiché d'Aura-2
  • Les chiffres 80ms et WER sont des benchmarks éditeur ; pas encore de score indépendant Flux TTS

Capacités vocales

Clonage vocal No

Non disponible au lancement ; voice cloning annoncé sur la roadmap Deepgram.

Direction émotionnelle & jeuPilotage API explicite

Flux permet d’agir sur le rythme et une expressivité globale conversationnelle entre les tours.

Comment : `speed` (0,85–1,15) et `expressivity` bêta (-2 à 2) sur `/v2/speak`.

À tester : Ce n’est pas un dictionnaire d’émotions par réplique : valider la granularité et la disponibilité bêta sur le voice model retenu.

Streaming Oui

WebSocket streaming à /v2/speak : génération audio dès le premier token, cycle de parole, interruption, reprise et contexte inter-tours. Deepgram annonce 80ms de premier audio au mieux et <200ms quelle que soit la longueur de réponse.

Données lip-sync No

Aucun timestamp mot/phonème/visème documenté au lancement.

Tarification

Prix / 1M chars
à partir de $45
selon l'abonnement souscrit
Prix / minute
à partir de $0.0450
selon l'abonnement souscrit
Offre gratuite
Plus d’offre de lancement. Le PAYG à $45/1M caractères s’applique depuis le 13 septembre 2026.

L’offre gratuite s’est terminée le 12 septembre 2026. Tarif ensuite : $45/1M caractères PAYG ; $40.50/1M sur Growth.

Hybride (PAYG + Abonnement)
Page tarification officielle
PlanAbonnement/moisInclusDépassement/minTopup
Pay As You Go

La concurrence standard après lancement dépend du plan/contrat — à confirmer avec Deepgram.

Gratuit$45 / 1M chars$0.0450Oui
GrowthRecommandé

Tarif caractères réduit de 10% ; crédits prépayés Growth et concurrence à confirmer.

Gratuit$40.50 / 1M chars$0.0405Oui
Topup disponible : Certains plans permettent d'acheter des minutes supplémentaires (topup) sans changer de plan. Utile pour les pics d'utilisation ponctuels.

Souveraineté & Conformité

On-premise Oui

Cloud, self-hosted et on-premise annoncés ; confirmer les modalités, la résidence UE et les garanties contractuelles avec Deepgram.

GDPR No

Résidence des données : Régions cloud non précisées publiquement pour Flux TTS ; self-hosted/on-premise annoncés, à qualifier pour Suisse/UE.

Analyse stratégique & business

Positionnement de Deepgram Flux TTS

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Flux TTS fait évoluer l'offre Deepgram d'une synthèse rapide vers une couche vocale conversationnelle avec état. Sa promesse est la simplicité opérationnelle, pas encore une avance de qualité vérifiée indépendamment — tester les revendications sous charge multi-tours proche d'Où est Ava ? avant tout engagement.

Cloud + On-premise
Risque lock-in :Élevé
Souveraineté :Moyen
Menace open-source :Moyen
Prix :En hausse ↑

A. Positionnement stratégique

Client cible : Voice-agent developer / Enterprise — English real-time conversational agents

TTS conversationnel natif : contexte inter-tours, réconciliation des interruptions et génération vocale streaming-first sont pris en charge par le modèle plutôt que reconstruits par l'orchestration cliente.

B. Avantage concurrentiel

  • Stack apparié Flux STT + Flux TTS : un fournisseur, une configuration et un cycle de parole explicite
  • Architecture Mamba à espace d'états et génération texte/audio intercalée pour viser une faible latence sans réinitialiser le contexte de session
  • Déploiement cloud, self-hosted et on-premise annoncé pour les agents vocaux réglementés

Vulnérabilité : Nouveau modèle anglophone sans clonage vocal ni benchmark public indépendant propre à Flux pour l'instant. Le prix post-lancement est sensiblement supérieur à Aura-2 et les conditions self-hosted/UE restent à vérifier contractuellement.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Le self-hosted et l'on-premise sont annoncés, mais les preuves de déploiement, la résidence UE et les conditions commerciales doivent être validées avant de considérer Flux comme une option souveraine.

Build vs. Buy

Acheter pour une expérimentation Phase B sur agents anglophones. Préserver un adaptateur TTS modulaire et garder Cartesia, Inworld ou Gradium comme voies comparables jusqu'à l'obtention de benchmarks indépendants Flux.

Risque de lock-in

Les capacités les plus différenciantes — état conversationnel, réconciliation des interruptions et futur état partagé STT/TTS — sont des comportements de plateforme propriétaires qui accroissent les coûts de migration.

Alignement roadmap

Fort intérêt expérimental pour la conversation temps réel et les interruptions ; intérêt conditionnel pour Où est Ava ? tant que FR/DE, données d'alignement avatar et déploiement UE/on-premise ne sont pas validés.

Vérification de cette fiche

Vérifiée le 30 septembre 2026

Deepgram Flux TTS launch benchmark (vendor, 12 Aug 2026). Independent Flux ranking not yet available. Coval/Openbenchmarks Aura-2 baseline refreshed 12 Aug 2026.

Note de mise à jour : 30 septembre 2026 : l’offre gratuite du 12 août au 12 septembre est terminée. Pas de nouveau modèle. Les voix restent anglaises.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.