GamiWays
Open SourceCommercial API (CC-BY-NC-4.0 weights)

Ultravox v0.5

Speech-to-speech model — ~100ms latency, no ASR/TTS pipeline needed

100 ms
TTFA (meilleur cas)
300 ms
TTFA (typique)
Gratuit
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale7/10
Latence10/10
Clonage vocal1/10
Expressivité6/10
Direction de jeu7/10
Souveraineté7/10
Accessibilité prix7/10
Multilingue5/10

Architecture

ArchitectureEnd-to-end speech-to-speech (no cascading ASR+LLM+TTS)
Paramètres8B (Llama-based)
Langues10
Auto-hébergeable Oui
Streaming Oui
GamiWays
Phase 1 MVP — Architecture V2V end-to-end

Référence critique pour la décision d'architecture du MVP Phase 1 : en cascade (ASR+LLM+TTS) vs end-to-end (Ultravox). L'end-to-end élimine l'accumulation de latence mais perd en contrôlabilité. GamiWays Phase 1 devrait benchmarker les deux approches. CC-BY-NC-4.0 limite l'auto-hébergement commercial.

Analyse

Ultravox v0.5 est un modèle speech-to-speech end-to-end qui élimine le pipeline en cascade ASR+LLM+TTS. ~100ms de latence de réponse vs 800ms–2s pour les systèmes en cascade. Fiabilité de tour : 300/300 vs 296/300 pour GPT-4o Realtime. Latence médiane : 0,864s vs 1,536s pour GPT-4o. Idéal pour les agents vocaux à latence critique.

Points forts

  • ~100ms latence de réponse
  • Élimine la surcharge du pipeline en cascade
  • 300/300 fiabilité de tour
  • 0,864s latence médiane vs 1,536s GPT-4o
  • Compréhension vocale end-to-end

Limitations

  • Pas de clonage vocal
  • CC-BY-NC-4.0 — auto-hébergement non-commercial uniquement
  • Moins contrôlable que les systèmes en cascade
  • Pas de données lip-sync

Capacités vocales

Clonage vocal No

No voice cloning. Fixed voice output.

Direction émotionnelle & jeuDirection par instructions

Le comportement vocal est surtout guidé par le system prompt ; une voix externe peut renforcer le contrôle.

Comment : `systemPrompt`, `voice`, `temperature`, `externalVoice` et `voiceOverrides`.

À tester : La direction ne produit pas une prosodie déterministe ; documenter la réponse par test de scène.

Streaming Oui

~100ms response latency. Full-duplex capable. Eliminates ASR+LLM+TTS pipeline latency accumulation.

Données lip-sync No

No native lip-sync data.

Tarification

Prix / 1M chars
Gratuit
Prix / minute
à partir de $0.0500
selon l'abonnement souscrit
Offre gratuite
Limited free tier

~$0.05/min API. Self-hosted: GPU cost only.

Souveraineté & Conformité

On-premise Oui

Weights available under CC-BY-NC-4.0. Non-commercial self-hosting.

GDPR Conforme

Résidence des données : Self-hosted: fully local.

Analyse stratégique & business

Positionnement de Ultravox v0.5

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Ultravox élimine la latence du pipeline STT→LLM→TTS avec un seul LLM multimodal — open-source, auto-hébergeable, créé par l'inventeur de WebRTC. L'architecture est l'avantage concurrentiel.

Open-source / auto-hébergé
Risque lock-in :Faible
Souveraineté :Élevé
Menace open-source :Faible
Prix :Commoditisation ↓↓

A. Positionnement stratégique

Client cible : Developer / Enterprise — real-time voice agents, multimodal LLM

LLM multimodal open-source (parole+texte, sans ASR séparé) par Fixie AI — agents vocaux temps réel sans la latence du pipeline STT→LLM→TTS.

B. Avantage concurrentiel

  • Architecture LLM multimodale — traite la parole directement sans étape ASR séparée
  • Implication du créateur de WebRTC (Justin Uberti) — expertise en communication temps réel
  • Hybride open-source + service géré — flexibilité pour le déploiement entreprise

Vulnérabilité : La nature open-source pourrait conduire à une commoditisation rapide. Petite équipe (Fixie AI) — risque de maintenance à long terme.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Entièrement auto-hébergeable sur infrastructure Suisse/UE. Licence open-source. L'architecture multimodale réduit la surface de traitement des données.

Build vs. Buy

Construire (intégrer open-source) pour la souveraineté Phase 2. Utiliser le service géré pour la rapidité Phase 1. L'architecture multimodale réduit la complexité du pipeline.

Risque de lock-in

Modèle open-source — zéro lock-in fournisseur. Le service géré crée une dépendance douce mais l'alternative auto-hébergée est toujours disponible.

Alignement roadmap

Bon pour les cas d'usage d'agents vocaux. L'approche LLM multimodale s'aligne avec le besoin de GamiWays pour une interaction temps réel naturelle.

Vérification de cette fiche

Vérifiée le 30 avril 2026

Ultravox AIEWF eval, Feb 2026

Note de mise à jour : Ultravox v0.5 released Feb 2026. MIT license. End-to-end S2S, no separate TTS. Llama 3.1 backbone. Self-hosted or Fixie.ai API. AIEWF eval: 0.864s median latency.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.