GamiWays

STT / Reconnaissance vocale

Comparatif des solutions de reconnaissance vocale pour les pipelines conversationnels (2025–2026). Benchmarks, enjeux stratégiques et questions de décision.

🎯

Cadrage stratégique : lire le STT en situation

Ce que les chiffres disent

Le WER indique la précision sur un corpus donné ; il ne prédit pas les noms propres, accents, bruits ou tours de parole de votre terrain. Le TTFA indique le démarrage du flux, pas à lui seul la réactivité de la conversation.

À croiser dans le tableau

Pour un échange direct, lisez WER et TTFA avec le streaming, la diarisation et les langues. L’endpointing, la détection de tour et la qualité sur vos enregistrements comptent souvent davantage que le meilleur score isolé.

Rester attentif à

La résidence et la rétention des données, les limites de streams, la rédaction PII et le coût complet. Le prix/h compare le premier palier public ; il ne remplace ni un test de charge ni un plan de repli cloud ou auto-hébergé.

Méthode de lecture : filtrez d’abord les exigences non négociables, comparez ensuite précision et temps réel sur le même cas, puis validez avec des audios, langues et conditions de bruit représentatifs.

Comment sont mesurées les métriques du tableau ?ouvrir

WER : taux d’erreurs sur un corpus précis. Une valeur n’est comparable qu’à corpus, langue, variante de modèle et protocole identiques ; le WER n’est pas une prédiction directe de vos audios.

TTFA : délai jusqu’au premier fragment de transcription pour un flux donné. Une valeur « — » signifie qu’aucune mesure P50/P95 traçable n’est publiée, et non une valeur nulle.

RTFx : débit de traitement hors ligne ou batch : 100× traite une heure d’audio en environ 36 secondes. Ce n’est pas une latence conversationnelle ni une promesse de temps réel mono-stream.

Chunks streaming : réglages d’intégration qui déterminent la portion d’audio et le contexte envoyés au modèle. Ils ne doivent pas être lus comme une TTFA. Exemple : les 2 s de Parakeet sont un chunk NeMo, pas une mesure de latence.

Méthode : chaque ligne indique sa source et sa date de vérification dans la fiche complète. Pour une décision, comparer d’abord les valeurs sur un protocole commun, puis tester les audios et l’infrastructure du projet.

APIs STT cloud temps réel — Deepgram Nova-3 est la référence latence (75ms TTFA). Whisper large-v3 est le standard de qualité open-source. AssemblyAI Universal-3 Pro domine le benchmark WER multilingue — Voice Agent API $4.50/hr (lancement 29 avr. 2026).

Cliquez sur un en-tête pour trier

SolutionTTFAWERStreamingMultilingueDiarisationPrix/h · entréeSouverain
Google Gemini 3.5 TranscribeNouveau
STT live + analyse d’enregistrements — candidat au benchmark
——✓85 langs✗$0.54/h✗
Deepgram Nova-3MAJ
MVP Phase 1 — ASR streaming
75ms✓45 langs✓$0.26/h✓
Inworld STTMAJ
MVP Phase 1 — STT émotionnel + Axe 2 comportement avatar
92ms✓100 langs✓$0.10/h✗
Gradium STTNouveau
R&D Phase B — Détection de tour + infrastructure temps réel
100ms✓5 langs✓$0.62/h✓
AssemblyAI Universal-3.6 Pro RealtimeMAJ
Pipeline d’agent vocal — Référence précision
150ms✓32 langs✓$0.21/h✗
Azure Speech (Microsoft)
Souveraineté suisse — institutionnel
180ms✓100 langs✓$1.00/h✓
xAI Grok STTNouveau
R&D Phase B — Évaluation du pipeline S2S
200ms✓25 langs✓$0.10/h✗
Soniox v5Nouveau
Précision + économique — à valider en production
249ms✓50 langs✓$0.12/h✗
Cartesia Ink-2Nouveau
MVP Phase 1 — Pipeline Cartesia complet (STT + TTS)
299ms✓40 langs✗$0.54/h✗

Comparaison par solution

Google Gemini 3.5 TranscribeNouveau
STT live + analyse d’enregistrements — candidat au benchmark
Latencyà mesurer
0
Accuracy—
0
Accessibilité prix7/10
7

Google Gemini 3.5 Transcribe sépare la reconnaissance en direct de la transcription des enregistrements. Gemini 3.5 Transcribe Live diffuse des textes intermédiaires et finalisés via la Live API, avec VAD automatique, hybride ou manuelle et vocabulaire personnalisé. Le modèle fichiers ajoute diarisation et timestamps mot-à-mot, indisponibles dans le flux live. Google annonce des WER propres au modèle, mais sur un protocole différent des benchmarks du portail ; précision comparative et latence de bout en bout restent à mesurer. Les deux voies sont des services cloud Gemini Developer API, et non Google Cloud Speech-to-Text v2/Chirp.

Fiche complète →
Deepgram Nova-3Mis à jour
MVP Phase 1 — ASR streaming
Latency75ms
10
Accuracy5.2% WER
8
Accessibilité prix7/10
7

Deepgram Nova-3 est une option ASR temps réel pour les agents vocaux, avec prise en charge de plus de 45 langues, VAD et endpointing intégrés. Voice Agent API fournit un pipeline complet STT+LLM+TTS en une connexion WebSocket, avec STT configurable, fournisseurs LLM, TTS et function calling pour intégrer un RAG. Son tarif standard à l’usage est promotionnel jusqu’au 12 septembre 2026, puis revient à 0,075$/min. La famille TTS Deepgram comprend Aura-2 et Flux TTS ; un TTS externe reste intégrable. Un déploiement on-premise Enterprise et un endpoint EU sont disponibles. La valeur de 75ms P90 reste un benchmark Pipecat historique, pas un SLA Deepgram en direct.

Fiche complète →
Inworld STTMis à jour
MVP Phase 1 — STT émotionnel + Axe 2 comportement avatar
Latency92ms
10
Accuracy5% WER
9
Accessibilité prix7/10
7

Inworld STT (2025–2026) est l'API STT cloud la plus riche en fonctionnalités pour les agents vocaux interactifs. Latence documentée <100ms, 100+ langues via routage multi-fournisseur (Whisper large-v3 + AssemblyAI). Voice profiling temps réel unique extrait émotion, accent, âge, pitch et style vocal sur chaque chunk. Realtime API (pipeline complet STT+LLM+TTS) à partir de 0,015$/min — 4x moins cher qu'OpenAI Realtime (0,06$/min). Clonage vocal natif : voix intégrées + clonées + custom (jusqu'à 3 000 voix custom sur Growth). RAG via function calling mid-conversation. Support ZDR. On-premise disponible en Enterprise. Compatible drop-in avec l'API Realtime OpenAI.

Fiche complète →
Gradium STTNouveau
R&D Phase B — Détection de tour + infrastructure temps réel
Latency100ms
9
Accuracy8.4% WER
9
Accessibilité prix9/10
9

Gradium STT dispose d'un VAD sémantique pour la détection intelligente des tours de parole (basé sur le sens, pas juste le silence). Meilleure précision revendiquée par les fondateurs qui ont inventé les codecs audio neuronaux. 5 langues (FR/EN/DE/ES/PT), timestamps mot par mot, diarisation. Intégration native LiveKit et Pipecat. Option on-premise Enterprise avec zéro rétention de données.

Fiche complète →
AssemblyAI Universal-3.6 Pro RealtimeMis à jour
Pipeline d’agent vocal — Référence précision
Latency150ms
7
Accuracy3.1% WER
10
Accessibilité prix5/10
5

Le 29 septembre 2026, AssemblyAI a sorti Universal-3.6 Pro Realtime (`universal-3-6-pro`) : 32 langues, 0,45 $/h, endpointing sensible aux entités. Le WER anglais de 5,19 % est un protocole éditeur et n’est pas le WER comparatif de la fiche. Contexte antérieur : AssemblyAI a lancé sa Voice Agent API le 29 avril 2026 : pipeline complet STT+LLM+TTS en une seule connexion WebSocket à 4,50$/h forfait. Universal-3 Pro Streaming est le modèle STT temps réel avec détection de tour sémantique+acoustique, barge-in natif et reprise de session. Le tool calling (JSON Schema) permet d'intégrer un RAG custom (Pinecone, LlamaIndex, etc.) via function calling — pas de RAG natif mais intégration externe complète. Pas de clonage vocal natif : les voix sont prédéfinies (18+ voix EN/multilingue), mais il est possible d'intégrer un TTS externe (ElevenLabs, Cartesia) pour un clone vocal custom. Fonctionnalités LeMUR (résumé, Q&R, sentiment) disponibles sur les transcriptions.

Fiche complète →
Azure Speech (Microsoft)
Souveraineté suisse — institutionnel
Latency180ms
7
Accuracy5.9% WER
9
Accessibilité prix3/10
3

Azure Speech offre un STT enterprise avec 100+ langues, entraînement de modèles personnalisés et datacenter suisse (Zurich). 5,9% WER en anglais. Déploiement en conteneur déconnecté pour une souveraineté partielle. Option la plus chère mais la plus forte en conformité enterprise. Modèle personnalisé suisse-allemand disponible.

Fiche complète →
xAI Grok STTNouveau
R&D Phase B — Évaluation du pipeline S2S
Latency200ms
7
Accuracy6.9% WER
8
Accessibilité prix9/10
9

Grok STT est l'API de transcription standalone construite sur le même stack que Grok Voice Think Fast 2.0. Elle atteint 6.9% WER global sur appels téléphoniques, réunions, vidéos/podcasts et téléphonie — surpassant ElevenLabs Scribe v2 (9.0%), Deepgram Nova-3 (11.0%) et AssemblyAI (12.9%) dans le benchmark interne xAI. Particulièrement forte sur la reconnaissance d'entités grâce à l'ITN avancée. 25+ langues, timestamps mot par mot, diarisation, audio multicanal, keyterm biasing. Tarif $0.10/h batch — parmi les plus compétitifs. À évaluer plutôt dans le cadre du pipeline S2S Grok Voice Think Fast 2.0 ($0.08/min tout compris).

Fiche complète →
Soniox v5Nouveau
Précision + économique — à valider en production
Latency249ms
8
Accuracy3.8% WER
10
Accessibilité prix9/10
9

Soniox v5 revendique le meilleur WER du marché à 1,25% (benchmark interne). Prix : $0,12/hr — l'API STT la plus abordable du benchmark. 249ms TTFS, 50+ langues, diarisation. On-premise disponible sur Enterprise. Très récent — track record production limité. Nouvelle entrée juin 2026.

Fiche complète →
Cartesia Ink-2Nouveau
MVP Phase 1 — Pipeline Cartesia complet (STT + TTS)
Latency299ms
7
Accuracy1.47% WER
10
Accessibilité prix7/10
7

Cartesia Ink-2 atteint le meilleur WER du Pipecat STT Benchmark (juin 2026) à 1,47%, devant Deepgram (1,71%) et AssemblyAI (1,74%). Prix : 0,43 $/h avec 299 ms TTFS. Au 30 septembre 2026, Cartesia décrit encore ce modèle d’agent comme anglais seulement, le multilingue étant annoncé et non livré. Le TTS apparié du portail est désormais Sonic 3.6, qui parle français. Ink-2 n’est donc pas un STT français pour Où est Ava ?.

Fiche complète →