GamiWays
API CloudCommercial

Deepgram Aura 2

Aura 2 baseline — Coval: 327ms median TTFA, 5.1% WER (12 Aug 2026)

80 ms
TTFA (meilleur cas)
327 ms
TTFA (typique)
$15/1M
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale6/10
Latence9/10
Clonage vocal1/10
Expressivité4/10
Direction de jeu3/10
Souveraineté3/10
Accessibilité prix7/10
Multilingue1/10

Architecture

ArchitectureProprietary streaming neural TTS
ParamètresN/A (cloud)
Langues1
Auto-hébergeable No
Streaming Oui
GamiWays
Phase 1 MVP — Stack ASR+TTS intégré

Pertinent pour le MVP Phase 1 si utilisation de Deepgram Nova-3 pour l'ASR. Le stack ASR+TTS d'un seul fournisseur simplifie l'intégration et réduit la latence. Limité à l'anglais et sans clonage vocal sont des contraintes significatives.

Analyse

Deepgram Aura 2 reste l'option TTS antérieure de la famille Deepgram, optimisée pour les pipelines d'agents vocaux anglophones. L'éditeur revendiquait historiquement <100ms de TTFA ; le référentiel indépendant actuel Coval/Openbenchmarks est de 327ms TTFA médian, 547ms p95 et 5,1% WER pour aura-2-thalia-en (12 août 2026). L'utiliser comme baseline Deepgram mesurée, et non comme preuve pour le nouveau modèle Flux TTS, dont les chiffres de latence et WER restent pour l'instant déclarés par l'éditeur. Pas de clonage vocal, expressivité limitée — focalisé sur un fonctionnement anglophone prévisible.

Points forts

  • Baseline indépendante : 5,1% WER (Coval, 12 août 2026)
  • Optimisé pour pipelines agents vocaux
  • Couplage naturel avec Deepgram ASR
  • Fiable à l'échelle

Limitations

  • Pas de clonage vocal
  • Anglais uniquement (Aura 2)
  • Expressivité limitée
  • Pas de données lip-sync

Capacités vocales

Clonage vocal No

No voice cloning. Pre-built voices only.

Direction émotionnelle & jeuContrôle limité

Aura donne un contrôle propre du débit et de la prononciation, mais pas une émotion programmable documentée.

Comment : `speed` (0,7–1,5) et dictionnaire de prononciation IPA.

À tester : Pour les scènes émotionnelles, prévoir une écriture et un moteur expressif distincts plutôt que de lui attribuer un contrôle qu’il n’expose pas.

Streaming Oui

Vendor claim: <100ms TTFA. Independent Coval/Openbenchmarks measurement (12 Aug 2026): 327ms median TTFA, 547ms p95 and 5.1% WER for Aura-2-Thalia-en. Often paired with Deepgram Nova-3 ASR for a full stack.

Données lip-sync No

No native lip-sync data.

Tarification

Prix / 1M chars
à partir de $15
selon l'abonnement souscrit
Prix / minute
à partir de $0.0150
selon l'abonnement souscrit
Offre gratuite
$200 free credits on signup

$15/1M chars. Often bundled with Deepgram ASR for full voice agent stack.

Hybride (PAYG + Abonnement)
Page tarification officielle
PlanAbonnement/moisInclusDépassement/minStreams maxTopup
Pay As You Go

Même plan que Deepgram STT

Gratuit$200 free credit$0.0150150Oui
GrowthRecommandé

Remise sur volume disponible

$333/moPrepaid credits, up to 20% discount$0.0120225Oui
Limites de streams parallèles : Le nombre de streams simultanés est limité par plan. Pour des événements avec de nombreux utilisateurs simultanés, vérifiez le plan requis ou contactez le provider pour un accord Enterprise.
Topup disponible : Certains plans permettent d'acheter des minutes supplémentaires (topup) sans changer de plan. Utile pour les pics d'utilisation ponctuels.

Souveraineté & Conformité

On-premise No

Cloud only. Enterprise on-premise via agreement.

GDPR Conforme

Résidence des données : US, EU

Analyse stratégique & business

Positionnement de Deepgram Aura 2

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Deepgram Aura est le pari de la plateforme vocale unifiée : STT+TTS+LLM en une seule API, latence sub-200ms, valorisation 1,3Md$ — mais sa position VPC-only limite son attrait souveraineté pour les déploiements européens réglementés.

Cloud + VPC
Risque lock-in :Moyen
Souveraineté :Moyen
Menace open-source :Moyen
Prix :Commoditisation ↓↓

A. Positionnement stratégique

Client cible : Developer / Enterprise — real-time voice agents, unified STT+TTS platform

Latence TTS sub-200ms dans le cadre d'une plateforme unifiée STT+TTS+LLM — le guichet unique pour l'infrastructure d'agents IA vocaux.

B. Avantage concurrentiel

  • API unifiée STT+TTS+LLM — réduit la complexité d'intégration et la latence vs stacks multi-fournisseurs
  • Latence TTS sub-200ms avec voix naturelles — compétitif avec Cartesia pour les agents temps réel
  • Série C 130M$ (jan. 2026) — valorisation 1,3Md$ — force financière pour la R&D

Vulnérabilité : Pas d'option TTS on-premise (VPC uniquement). Les modèles open-source rattrapent. Pression tarifaire des concurrents.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Résidence des données UE via VPC disponible. Pas de TTS on-premise complet. Fit souveraineté modéré — mieux que le cloud pur, moins bien qu'Inworld.

Build vs. Buy

Acheter pour la Phase 1 (plateforme unifiée, faible overhead d'intégration). Évaluer les alternatives on-premise pour la souveraineté Phase 2.

Risque de lock-in

La plateforme unifiée STT+TTS crée un lock-in d'intégration. Le déploiement VPC et les prix compétitifs réduisent le risque de dépendance.

Alignement roadmap

Bon pour la Phase 1 (STT+TTS unifié pour agents vocaux). La Phase 2 nécessite un TTS on-premise — considérer Inworld ou open-source pour la souveraineté.

Vérification de cette fiche

Vérifiée le 12 août 2026

Coval/Openbenchmarks — Aura-2-Thalia-en, 12 Aug 2026 (327ms median TTFA, 547ms p95, 5.1% WER)

Note de mise à jour : Mise à jour Flux TTS : baseline Aura-2 indépendante ajoutée depuis Coval/Openbenchmarks. Les mesures Aura ne sont pas attribuables à Flux TTS.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.