Deepgram Nova-3
Real-time ASR — 45+ languages, EU endpoint, Enterprise on-premise option
Scores comparatifs
Architecture
Candidat principal pour l'ASR du MVP Phase 1. 75ms latence critique pour le pipeline <2s. Option on-premise alignée avec les exigences de souveraineté suisse. Audiogami (Gamilab) déjà en production — Deepgram comme fallback/comparaison.
Analyse
Deepgram Nova-3 est une option ASR temps réel pour les agents vocaux, avec prise en charge de plus de 45 langues, VAD et endpointing intégrés. Voice Agent API fournit un pipeline complet STT+LLM+TTS en une connexion WebSocket, avec STT configurable, fournisseurs LLM, TTS et function calling pour intégrer un RAG. Son tarif standard à l’usage est promotionnel jusqu’au 12 septembre 2026, puis revient à 0,075$/min. La famille TTS Deepgram comprend Aura-2 et Flux TTS ; un TTS externe reste intégrable. Un déploiement on-premise Enterprise et un endpoint EU sont disponibles. La valeur de 75ms P90 reste un benchmark Pipecat historique, pas un SLA Deepgram en direct.
Points forts
- Voice Agent API 3,36$/h jusqu’au 12 sept., puis 4,50$/h standard — pipeline configurable + function calling
- VAD + endpointing intégrés
- 45+ langues
- Option on-premise Enterprise
- Endpoint EU disponible
- Intégration native LiveKit/Pipecat
- Diarisation + timestamps mot-à-mot
Limitations
- Cloud-first (souveraineté limitée — on-premise Enterprise uniquement)
- AA-WER 5,2% : pas parmi les meilleurs scores de précision
- Le WER français/allemand doit être testé sur le matériau du projet
- Pas de clonage vocal natif — voix Aura-2 prédéfinies et clonage Flux indisponible au lancement
- Pas de RAG natif — function calling + infrastructure externe requis
- Pas d’open weights
Capacités STT
WebSocket streaming. 75ms P90 latency. Interim results with endpointing. Voice Activity Detection (VAD) built-in.
45+ langues
Tarification
$0.26/hr ($0.0043/min) Nova-3 Monolingual Pay As You Go, vérifié le 18 août 2026. Growth : $0.0036/min. Le benchmark Pipecat historique reste cité séparément ; on-premise : prix Enterprise sur devis.
| Plan | Abonnement/mois | Inclus | Dépassement/min | Streams max | Topup |
|---|---|---|---|---|---|
Pay As You Go Prépayer des crédits au tarif PAYG | Gratuit | $200 free credit | $0.0043 | 150 | Oui |
GrowthRecommandé Crédits prépayés supplémentaires au tarif Growth | $333/mo | Prepaid credits, up to 20% discount | $0.0036 | 225 | Oui |
Enterprise Tarification volumétrique personnalisée | Gratuit | Custom | — | ∞ | Oui |
Souveraineté & Conformité
Self-hosted Docker deployment. Enterprise on-premise available. Partial sovereignty.
Résidence des données : US (default). EU data residency available.
On-premise deployment available (enterprise). Self-hosted via Docker.
On-premise deployment available (enterprise). Self-hosted via Docker.
Positionnement de Deepgram Nova-3
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Deepgram Nova-3 est le leader STT entreprise avec 54,2% de WER inférieur sur audio bruité — mais sa position VPC-only (pas de STT on-premise complet) limite l'attrait souveraineté pour les déploiements européens réglementés.
A. Positionnement stratégique
Client cible : Developer / Enterprise — voice agents, real-time transcription
Plateforme unifiée STT+TTS+LLM avec 54,2% de WER inférieur sur audio bruité vs concurrents — l'épine dorsale de l'infrastructure IA vocale.
B. Avantage concurrentiel
- 54,2% de WER inférieur sur audio bruité vs concurrents incluant les hyperscalers
- API unifiée STT+TTS+LLM — réduit la complexité d'intégration et la latence bout en bout
- Série C 130M$ (jan. 2026) — valorisation 1,3Md$ — force financière pour la R&D
Vulnérabilité : Les modèles open-source (Whisper, Voxtral) rattrapent. Pas d'option STT on-premise complète (VPC uniquement). Pression tarifaire des concurrents.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Résidence des données UE via VPC disponible. Pas de STT on-premise complet. Fit souveraineté modéré — mieux que le cloud pur, moins bien que l'auto-hébergé.
Build vs. Buy
Acheter pour la Phase 1 (meilleure précision, plateforme unifiée). Évaluer Whisper/Voxtral auto-hébergé pour la souveraineté Phase 2.
Risque de lock-in
La plateforme unifiée STT+TTS crée un lock-in d'intégration. Le déploiement VPC et les prix compétitifs réduisent le risque de dépendance.
Alignement roadmap
Bon pour les agents vocaux Phase 1. La souveraineté Phase 2 nécessite un STT on-premise — considérer Whisper ou Voxtral auto-hébergé.
Vérification de cette fiche
Inworld benchmark 2026 + Koenecke et al.
Note de mise à jour : Vérification 18 août 2026 : AA-WER v2 5,2% et facteur de vitesse 541,1× via Artificial Analysis ; Nova-3 Monolingual Pay As You Go $0,0043/min via Deepgram. Voice Agent API Standard : $0,056/min jusqu’au 12 septembre, puis $0,075/min. Les mesures Pipecat de juin (1,71% WER, 75ms P90) sont conservées comme benchmark historique distinct, non comme mesures API actuelles.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis