Pipeline Vocal Voice-to-Voice
Diagramme interactif du pipeline vocal complet pour le MVP GamiWays Phase 1. Sélectionnez les composants de chaque bloc pour visualiser la latence cumulée et le coût estimé. Comparez l'approche Cascade (ASR → LLM → TTS) avec le Voice-to-Voice end-to-end.
Latence & Coût estimés
Cible GamiWays Phase 1 : <2s bout-en-bout (pipeline vocal seul, hors génération avatar). La génération avatar ajoute 80–300ms (BeyondPresence) ou 3–8s (HeyGen).
Convertit le flux audio en texte. L'ASR en streaming envoie des transcriptions partielles pour réduire le Time-to-First-Token du LLM. Bloc de latence critique.
Industry reference for real-time ASR. Supports 30+ languages. Used by most voice agent frameworks.
Best sovereign option. Use faster-whisper with streaming VAD for near-real-time. Quantized small.en: ~200ms on CPU.
Débit batch publié : RTFx 3332,74. WER moyen : 6,34% sur HF Open ASR Leaderboard ; instantané du rapport : 6,32% vs 7,44% pour Whisper large-v3 sur le même protocole. NeMo propose chunks 2s + contexte droit 2s pour l’intégration, mais aucune TTFA P50/P95 n’est publiée : la latence est donc à mesurer. Ne pas confondre TDT v3 et le microservice Parakeet CTC/Riva distinct.
Good alternative with EU data residency option. Better for multi-speaker scenarios.
Gradium STT with semantic VAD enables meaning-based turn detection (not just silence). Word-level timestamps for avatar lip-sync. Native LiveKit/Pipecat integration. On-premise Enterprise with zero data retention. WER to validate independently via Pipecat benchmark.
Key advantage: when combined with Inworld TTS and LLM Router, eliminates inter-component network hops. Semantic VAD reduces hallucination triggers. Use for Inworld Single-Provider stack.
ASR → LLM → TTS — modulaire, contrôlable, prêt pour la production
Recommandé pour le MVP Phase 1. Meilleure stack : Deepgram Nova-3 + GPT-4o streaming + Cartesia Sonic 3. Alternative souveraine : Whisper.cpp + Llama 3.1 8B + Kokoro 82M.
Audio direct entrée → sortie — latence minimale, prosodie naturelle
Recommandé pour l'exploration de l'Axe R&D 1 (H2 2026). Non adapté au MVP Phase 1 en raison de l'absence de clonage vocal. Surveiller Voxtral TTS (Mistral) et Ultravox v0.5.
Stacks recommandées
Cliquez sur 'Appliquer' pour charger les composants dans le configurateur.
Stack MVP Cloud
Chemin le plus rapide vers un prototype fonctionnel
Chemin de prototype Phase 1. Deepgram (75 ms) + GPT-4o streaming (350 ms) + Sonic 3.6 (sous 90 ms, chiffre Cartesia) + WebRTC (30 ms) ≈ 555 ms comme somme de conception, pas comme mesure Où est Ava ?. Ink-2 n’est pas le STT français de cette pile.
Stack Souveraine
Souveraineté suisse complète — déploiement Exoscale/OVH
Souveraineté complète pour les partenaires institutionnels suisses/UE. Whisper.cpp (200ms) + Llama 3.1 8B (150ms) + Chatterbox (150ms) + Mem0 (20ms) + WebRTC (30ms) = ~710ms meilleur cas. Clonage vocal via Chatterbox. Déployable sur Exoscale Genève.
Couche conversationnelle Inworld
STT + Router + TTS-2 peuvent réduire les relais ; valider le parcours complet
STT, Router et Realtime TTS-2 d’Inworld peuvent réduire les relais côté application lorsqu’ils sont utilisés ensemble ; cela ne retire ni réseau, ni mémoire, ni LLM externe, ni rendu vidéo. TTS-2 apporte direction libre, non-verbaux et contexte audio inter-tours ; Flash publie un TTFB serveur de 20 ms. Les 470 ms du meilleur cas ne sont qu’un calcul de scénario, pas un résultat Où est Ava ? Résidence UE/Inde et on-premise exigent des conditions Enterprise. Tester directions françaises, lip-sync avatar et comportement complet de bout en bout.
Stack Hybride
Meilleur équilibre qualité/souveraineté pour la production
LLM EU-souverain (Mistral) + TTS souverain (Kokoro) + meilleur ASR (Deepgram) + mémoire long terme Mem0. Deepgram (75ms) + Mistral Nemo (200ms) + Kokoro (60ms) + Mem0 (20ms) + WebRTC (30ms) = ~555ms meilleur cas. Pas de clonage vocal — ajouter Chatterbox pour le persona.
Décision clé : clonage vocal
Le clonage vocal est critique pour le persona GamiWays. Options : Cartesia (cloud, 40ms), Chatterbox (local, 150ms, MIT), ElevenLabs (cloud, 75ms, $75/1M). La stack souveraine requiert Chatterbox + Kokoro en combinaison.
Comparer toutes les solutions TTS
14 solutions TTS/V2V avec scores comparatifs sur 7 axes.
État de l'Art TTS →