Miso-TTS v1 (8B)
110ms latency — most emotive open-source TTS with RVQ architecture
Scores comparatifs
Architecture
Très pertinent pour les exigences de souveraineté GamiWays : poids open-source, déploiement on-premises, 110ms de latence. Le conditioning audio sur le ton de l'utilisateur est un différenciateur unique pour les personnages IA émotionnellement réactifs. Bloqué par : half-duplex uniquement, focalisé anglais, pas d'API cloud encore. Recommandé pour : évaluation prototype self-hosted, déploiements souveraineté-first.
Analyse
Miso-TTS v1 est un modèle TTS open-source de 8B paramètres publié le 3 juin 2026. Il atteint 110ms de latence — parmi les plus basses revendiquées sur le marché — grâce à une architecture RVQ hiérarchique (7,7B backbone + 300M depth decoder). Le modèle conditionne sur le texte ET l'audio de l'utilisateur, permettant une génération vocale émotionnellement consciente. Poids open-source sous licence MIT modifiée. API cloud à venir. Half-duplex uniquement ; le full-duplex est un travail futur.
Points forts
- 110ms latence — parmi les plus basses revendiquées
- Conditioning audio sur le ton de l'utilisateur
- Poids open-source (MIT modifié) — souveraineté totale
- Support enterprise on-premises disponible
- Architecture RVQ : 2048^32 tokens audio adressables
- Clonage vocal one-shot (clip 10s)
Limitations
- API cloud pas encore disponible (coming soon)
- Half-duplex uniquement — pas de full-duplex ni turn-taking
- Focalisé anglais (multilingue non documenté)
- Pas de score ELO (non classé sur Artificial Analysis)
- Pas de pricing pour l'API cloud
- Pas de timestamps lip-sync
Capacités vocales
One-shot voice cloning from a 10-second audio clip. Exact voice replica from first to last second of a call.
Le contexte audio peut transmettre une couleur de jeu ; aucune intention émotionnelle par API n’est isolée.
Comment : `context`, `speaker`, `temperature`, `topk` dans l’inférence open-weight.
À tester : À traiter comme piste de R&D auto-hébergée, avec références audio par état et protocole d’évaluation.
Streaming not documented. Half-duplex only — full-duplex and turn-taking are future work.
No lip-sync timestamps documented.
Tarification
Self-hosted: free (compute costs only). Cloud API: coming soon — pricing not yet announced.
Souveraineté & Conformité
Open-source weights (modified MIT). On-premises hosting + support contracts available for enterprise teams.
Résidence des données : Self-hosted: full data sovereignty. Cloud API: not yet available.
Architecture RVQ — Détail
Miso-TTS v1 utilise un Transformer RVQ hiérarchique en deux étapes : un backbone de 7,7B paramètres génère les tokens audio grossiers, puis un depth transformer de 300M paramètres affine les détails fins. L'espace audio est représenté par 2048^32 tokens adressables (RVQ depth=32, codebook size=2048), soit une expressivité théorique de 10^105 combinaisons.
Statut API
L'API cloud est annoncée mais pas encore disponible (juin 2026). Les poids open-source sont disponibles sur Hugging Face sous licence MIT modifiée. Le déploiement on-premises est possible pour les équipes enterprise.
Vérification de cette fiche
Miso Labs blog post, June 3, 2026 — internal latency comparison (ElevenLabs 700ms, Sesame 300ms, Human 160ms, Miso 110ms)
Note de mise à jour : Initial entry from misolabs.ai and blog post (June 3, 2026). No AA ELO yet — API not yet available.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.