GamiWays
PHASE 1 MVPArchitecture de référence

Pipeline Vocal Voice-to-Voice

Diagramme interactif du pipeline vocal complet pour le MVP GamiWays Phase 1. Sélectionnez les composants de chaque bloc pour visualiser la latence cumulée et le coût estimé. Comparez l'approche Cascade (ASR → LLM → TTS) avec le Voice-to-Voice end-to-end.

Latence & Coût estimés

Meilleur cas
575ms
Cas typique
1250ms
Coût/min
$0.082
Coût/heure
$4.94
✓ Cible <2s
Meilleur cas
Cas typique
Cible 2s
Entrée: 10ms · free
ASR: 75ms · $0.004/min
Mémoire: 20ms · $0.004/min
LLM: 350ms · $0.060/min
TTS: 90ms · $0.014/min
Transport: 30ms · free
Répartition du coût
■ ASR: 5%■ Mémoire: 5%■ LLM: 73%■ TTS: 17%

Cible GamiWays Phase 1 : <2s bout-en-bout (pipeline vocal seul, hors génération avatar). La génération avatar ajoute 80–300ms (BeyondPresence) ou 3–8s (HeyGen).

Flux du pipeline

Convertit le flux audio en texte. L'ASR en streaming envoie des transcriptions partielles pour réduire le Time-to-First-Token du LLM. Bloc de latence critique.

Deepgram Nova-3
RecommandéCloud
75–200ms
$0.0043/min streaming

Industry reference for real-time ASR. Supports 30+ languages. Used by most voice agent frameworks.

Whisper.cpp (local)
AlternatifLocal
200–500ms
Free (MIT)
Souverain

Best sovereign option. Use faster-whisper with streaming VAD for near-real-time. Quantized small.en: ~200ms on CPU.

NVIDIA Parakeet TDT 0.6B v3
AlternatifLocal
à mesurer
Open weights (CC-BY-4.0) — GPU / CapEx à mesurer
Souverain

Débit batch publié : RTFx 3332,74. WER moyen : 6,34% sur HF Open ASR Leaderboard ; instantané du rapport : 6,32% vs 7,44% pour Whisper large-v3 sur le même protocole. NeMo propose chunks 2s + contexte droit 2s pour l’intégration, mais aucune TTFA P50/P95 n’est publiée : la latence est donc à mesurer. Ne pas confondre TDT v3 et le microservice Parakeet CTC/Riva distinct.

AssemblyAI Universal-2
AlternatifCloud
100–250ms
$0.0065/min streaming

Good alternative with EU data residency option. Better for multi-speaker scenarios.

Gradium STT
AlternatifCloud
100–200ms
$0.009/min (45k crédits/mois gratuits)

Gradium STT with semantic VAD enables meaning-based turn detection (not just silence). Word-level timestamps for avatar lip-sync. Native LiveKit/Pipecat integration. On-premise Enterprise with zero data retention. WER to validate independently via Pipecat benchmark.

Inworld STT
AlternatifCloud
80–180ms
Included in Inworld platform (TTS + STT + Realtime API bundle)
Souverain

Key advantage: when combined with Inworld TTS and LLM Router, eliminates inter-component network hops. Semantic VAD reduces hallucination triggers. Use for Inworld Single-Provider stack.

Pipeline Cascade

ASR → LLM → TTS — modulaire, contrôlable, prêt pour la production

Latence min
505ms
Typique
1150ms

Recommandé pour le MVP Phase 1. Meilleure stack : Deepgram Nova-3 + GPT-4o streaming + Cartesia Sonic 3. Alternative souveraine : Whisper.cpp + Llama 3.1 8B + Kokoro 82M.

Voix-à-Voix End-to-End

Audio direct entrée → sortie — latence minimale, prosodie naturelle

Latence min
150ms
Typique
350ms

Recommandé pour l'exploration de l'Axe R&D 1 (H2 2026). Non adapté au MVP Phase 1 en raison de l'absence de clonage vocal. Surveiller Voxtral TTS (Mistral) et Ultravox v0.5.

Stacks recommandées

Cliquez sur 'Appliquer' pour charger les composants dans le configurateur.

RECOMMANDÉ MVP

Stack MVP Cloud

Chemin le plus rapide vers un prototype fonctionnel

Latence min
555ms
Latence typ.
1140ms
Coût/min
$0.085
Cloud US — acceptable pour prototype

Chemin de prototype Phase 1. Deepgram (75 ms) + GPT-4o streaming (350 ms) + Sonic 3.6 (sous 90 ms, chiffre Cartesia) + WebRTC (30 ms) ≈ 555 ms comme somme de conception, pas comme mesure Où est Ava ?. Ink-2 n’est pas le STT français de cette pile.

Stack Souveraine

Souveraineté suisse complète — déploiement Exoscale/OVH

Latence min
710ms
Latence typ.
1620ms
Coût/min
$0.015
Souveraineté complète — déployable Exoscale/OVH

Souveraineté complète pour les partenaires institutionnels suisses/UE. Whisper.cpp (200ms) + Llama 3.1 8B (150ms) + Chatterbox (150ms) + Mem0 (20ms) + WebRTC (30ms) = ~710ms meilleur cas. Clonage vocal via Chatterbox. Déployable sur Exoscale Genève.

RECOMMANDÉ MVP

Couche conversationnelle Inworld

STT + Router + TTS-2 peuvent réduire les relais ; valider le parcours complet

Latence min
470ms
Latence typ.
1050ms
Coût/min
$0.060
Cloud US — acceptable pour prototype

STT, Router et Realtime TTS-2 d’Inworld peuvent réduire les relais côté application lorsqu’ils sont utilisés ensemble ; cela ne retire ni réseau, ni mémoire, ni LLM externe, ni rendu vidéo. TTS-2 apporte direction libre, non-verbaux et contexte audio inter-tours ; Flash publie un TTFB serveur de 20 ms. Les 470 ms du meilleur cas ne sont qu’un calcul de scénario, pas un résultat Où est Ava ? Résidence UE/Inde et on-premise exigent des conditions Enterprise. Tester directions françaises, lip-sync avatar et comportement complet de bout en bout.

Stack Hybride

Meilleur équilibre qualité/souveraineté pour la production

Latence min
555ms
Latence typ.
1230ms
Coût/min
$0.030
Cloud US — acceptable pour prototype

LLM EU-souverain (Mistral) + TTS souverain (Kokoro) + meilleur ASR (Deepgram) + mémoire long terme Mem0. Deepgram (75ms) + Mistral Nemo (200ms) + Kokoro (60ms) + Mem0 (20ms) + WebRTC (30ms) = ~555ms meilleur cas. Pas de clonage vocal — ajouter Chatterbox pour le persona.

Décision clé : clonage vocal

Le clonage vocal est critique pour le persona GamiWays. Options : Cartesia (cloud, 40ms), Chatterbox (local, 150ms, MIT), ElevenLabs (cloud, 75ms, $75/1M). La stack souveraine requiert Chatterbox + Kokoro en combinaison.

Comparer toutes les solutions TTS

14 solutions TTS/V2V avec scores comparatifs sur 7 axes.

État de l'Art TTS →