Ultravox v0.5
Speech-to-speech model — ~100ms latency, no ASR/TTS pipeline needed
Scores comparatifs
Architecture
Référence critique pour la décision d'architecture du MVP Phase 1 : en cascade (ASR+LLM+TTS) vs end-to-end (Ultravox). L'end-to-end élimine l'accumulation de latence mais perd en contrôlabilité. GamiWays Phase 1 devrait benchmarker les deux approches. CC-BY-NC-4.0 limite l'auto-hébergement commercial.
Analyse
Ultravox v0.5 est un modèle speech-to-speech end-to-end qui élimine le pipeline en cascade ASR+LLM+TTS. ~100ms de latence de réponse vs 800ms–2s pour les systèmes en cascade. Fiabilité de tour : 300/300 vs 296/300 pour GPT-4o Realtime. Latence médiane : 0,864s vs 1,536s pour GPT-4o. Idéal pour les agents vocaux à latence critique.
Points forts
- ~100ms latence de réponse
- Élimine la surcharge du pipeline en cascade
- 300/300 fiabilité de tour
- 0,864s latence médiane vs 1,536s GPT-4o
- Compréhension vocale end-to-end
Limitations
- Pas de clonage vocal
- CC-BY-NC-4.0 — auto-hébergement non-commercial uniquement
- Moins contrôlable que les systèmes en cascade
- Pas de données lip-sync
Capacités vocales
No voice cloning. Fixed voice output.
Le comportement vocal est surtout guidé par le system prompt ; une voix externe peut renforcer le contrôle.
Comment : `systemPrompt`, `voice`, `temperature`, `externalVoice` et `voiceOverrides`.
À tester : La direction ne produit pas une prosodie déterministe ; documenter la réponse par test de scène.
~100ms response latency. Full-duplex capable. Eliminates ASR+LLM+TTS pipeline latency accumulation.
No native lip-sync data.
Tarification
~$0.05/min API. Self-hosted: GPU cost only.
Souveraineté & Conformité
Weights available under CC-BY-NC-4.0. Non-commercial self-hosting.
Résidence des données : Self-hosted: fully local.
Positionnement de Ultravox v0.5
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Ultravox élimine la latence du pipeline STT→LLM→TTS avec un seul LLM multimodal — open-source, auto-hébergeable, créé par l'inventeur de WebRTC. L'architecture est l'avantage concurrentiel.
A. Positionnement stratégique
Client cible : Developer / Enterprise — real-time voice agents, multimodal LLM
LLM multimodal open-source (parole+texte, sans ASR séparé) par Fixie AI — agents vocaux temps réel sans la latence du pipeline STT→LLM→TTS.
B. Avantage concurrentiel
- Architecture LLM multimodale — traite la parole directement sans étape ASR séparée
- Implication du créateur de WebRTC (Justin Uberti) — expertise en communication temps réel
- Hybride open-source + service géré — flexibilité pour le déploiement entreprise
Vulnérabilité : La nature open-source pourrait conduire à une commoditisation rapide. Petite équipe (Fixie AI) — risque de maintenance à long terme.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Entièrement auto-hébergeable sur infrastructure Suisse/UE. Licence open-source. L'architecture multimodale réduit la surface de traitement des données.
Build vs. Buy
Construire (intégrer open-source) pour la souveraineté Phase 2. Utiliser le service géré pour la rapidité Phase 1. L'architecture multimodale réduit la complexité du pipeline.
Risque de lock-in
Modèle open-source — zéro lock-in fournisseur. Le service géré crée une dépendance douce mais l'alternative auto-hébergée est toujours disponible.
Alignement roadmap
Bon pour les cas d'usage d'agents vocaux. L'approche LLM multimodale s'aligne avec le besoin de GamiWays pour une interaction temps réel naturelle.
Vérification de cette fiche
Ultravox AIEWF eval, Feb 2026
Note de mise à jour : Ultravox v0.5 released Feb 2026. MIT license. End-to-end S2S, no separate TTS. Llama 3.1 backbone. Self-hosted or Fixie.ai API. AIEWF eval: 0.864s median latency.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.