GamiWays
API CloudCommercialAuto-hébergeable

Deepgram Nova-3

Real-time ASR — 45+ languages, EU endpoint, Enterprise on-premise option

75ms
Latence (meilleur cas)
200ms
Latence (typique)
5.2%
WER (audio général)
$0.0043/min
Prix par minute

Scores comparatifs

Précision (WER)8/10
Latence streaming10/10
Multilingue7/10
Souveraineté5/10
Accessibilité prix7/10
Qualité streaming10/10

Architecture

ArchitectureEnd-to-end deep learning (proprietary), streaming-native
ParamètresN/A (cloud)
Langues45+
Auto-hébergeable Oui
Streaming Oui
WER audio propre 3.2%
GamiWays
Phase 1 MVP — Streaming ASR

Candidat principal pour l'ASR du MVP Phase 1. 75ms latence critique pour le pipeline <2s. Option on-premise alignée avec les exigences de souveraineté suisse. Audiogami (Gamilab) déjà en production — Deepgram comme fallback/comparaison.

Analyse

Deepgram Nova-3 est une option ASR temps réel pour les agents vocaux, avec prise en charge de plus de 45 langues, VAD et endpointing intégrés. Voice Agent API fournit un pipeline complet STT+LLM+TTS en une connexion WebSocket, avec STT configurable, fournisseurs LLM, TTS et function calling pour intégrer un RAG. Son tarif standard à l’usage est promotionnel jusqu’au 12 septembre 2026, puis revient à 0,075$/min. La famille TTS Deepgram comprend Aura-2 et Flux TTS ; un TTS externe reste intégrable. Un déploiement on-premise Enterprise et un endpoint EU sont disponibles. La valeur de 75ms P90 reste un benchmark Pipecat historique, pas un SLA Deepgram en direct.

Points forts

  • Voice Agent API 3,36$/h jusqu’au 12 sept., puis 4,50$/h standard — pipeline configurable + function calling
  • VAD + endpointing intégrés
  • 45+ langues
  • Option on-premise Enterprise
  • Endpoint EU disponible
  • Intégration native LiveKit/Pipecat
  • Diarisation + timestamps mot-à-mot

Limitations

  • Cloud-first (souveraineté limitée — on-premise Enterprise uniquement)
  • AA-WER 5,2% : pas parmi les meilleurs scores de précision
  • Le WER français/allemand doit être testé sur le matériau du projet
  • Pas de clonage vocal natif — voix Aura-2 prédéfinies et clonage Flux indisponible au lancement
  • Pas de RAG natif — function calling + infrastructure externe requis
  • Pas d’open weights

Capacités STT

Streaming Oui

WebSocket streaming. 75ms P90 latency. Interim results with endpointing. Voice Activity Detection (VAD) built-in.

Diarisation Oui
Vocabulaire personnalisé Oui
Timestamps mot-à-mot Oui
Ponctuation auto Oui
Multilingue Oui

45+ langues

Tarification

Prix / minute
à partir de $0.0043
selon l'abonnement souscrit
Prix / heure
à partir de $0.258
selon l'abonnement souscrit
Offre gratuite
$200 credit on signup

$0.26/hr ($0.0043/min) Nova-3 Monolingual Pay As You Go, vérifié le 18 août 2026. Growth : $0.0036/min. Le benchmark Pipecat historique reste cité séparément ; on-premise : prix Enterprise sur devis.

Hybride (PAYG + Abonnement)
Page tarification officielle
PlanAbonnement/moisInclusDépassement/minStreams maxTopup
Pay As You Go

Prépayer des crédits au tarif PAYG

Gratuit$200 free credit$0.0043150Oui
GrowthRecommandé

Crédits prépayés supplémentaires au tarif Growth

$333/moPrepaid credits, up to 20% discount$0.0036225Oui
Enterprise

Tarification volumétrique personnalisée

GratuitCustom—∞Oui
Limites de streams parallèles : Le nombre de streams simultanés est limité par plan. Pour des événements avec de nombreux utilisateurs simultanés, vérifiez le plan requis ou contactez le provider pour un accord Enterprise.
Topup disponible : Certains plans permettent d'acheter des minutes supplémentaires (topup) sans changer de plan. Utile pour les pics d'utilisation ponctuels.

Souveraineté & Conformité

On-premise Oui

Self-hosted Docker deployment. Enterprise on-premise available. Partial sovereignty.

GDPR Conforme

Résidence des données : US (default). EU data residency available.

On-premise Oui

On-premise deployment available (enterprise). Self-hosted via Docker.

Déploiement auto-hébergé

On-premise deployment available (enterprise). Self-hosted via Docker.

Analyse stratégique & business

Positionnement de Deepgram Nova-3

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Deepgram Nova-3 est le leader STT entreprise avec 54,2% de WER inférieur sur audio bruité — mais sa position VPC-only (pas de STT on-premise complet) limite l'attrait souveraineté pour les déploiements européens réglementés.

Cloud + VPC
Risque lock-in :Moyen
Souveraineté :Moyen
Menace open-source :Moyen
Prix :Commoditisation ↓↓

A. Positionnement stratégique

Client cible : Developer / Enterprise — voice agents, real-time transcription

Plateforme unifiée STT+TTS+LLM avec 54,2% de WER inférieur sur audio bruité vs concurrents — l'épine dorsale de l'infrastructure IA vocale.

B. Avantage concurrentiel

  • 54,2% de WER inférieur sur audio bruité vs concurrents incluant les hyperscalers
  • API unifiée STT+TTS+LLM — réduit la complexité d'intégration et la latence bout en bout
  • Série C 130M$ (jan. 2026) — valorisation 1,3Md$ — force financière pour la R&D

Vulnérabilité : Les modèles open-source (Whisper, Voxtral) rattrapent. Pas d'option STT on-premise complète (VPC uniquement). Pression tarifaire des concurrents.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Résidence des données UE via VPC disponible. Pas de STT on-premise complet. Fit souveraineté modéré — mieux que le cloud pur, moins bien que l'auto-hébergé.

Build vs. Buy

Acheter pour la Phase 1 (meilleure précision, plateforme unifiée). Évaluer Whisper/Voxtral auto-hébergé pour la souveraineté Phase 2.

Risque de lock-in

La plateforme unifiée STT+TTS crée un lock-in d'intégration. Le déploiement VPC et les prix compétitifs réduisent le risque de dépendance.

Alignement roadmap

Bon pour les agents vocaux Phase 1. La souveraineté Phase 2 nécessite un STT on-premise — considérer Whisper ou Voxtral auto-hébergé.

Vérification de cette fiche

Vérifiée le 18 août 2026

Inworld benchmark 2026 + Koenecke et al.

Note de mise à jour : Vérification 18 août 2026 : AA-WER v2 5,2% et facteur de vitesse 541,1× via Artificial Analysis ; Nova-3 Monolingual Pay As You Go $0,0043/min via Deepgram. Voice Agent API Standard : $0,056/min jusqu’au 12 septembre, puis $0,075/min. Les mesures Pipecat de juin (1,71% WER, 75ms P90) sont conservées comme benchmark historique distinct, non comme mesures API actuelles.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis