GamiWays
Open SourceModified MIT (open-source weights on Hugging Face)

Miso-TTS v1 (8B)

110ms latency — most emotive open-source TTS with RVQ architecture

110 ms
TTFA (meilleur cas)
110 ms
TTFA (typique)
Gratuit
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale9/10
Latence9/10
Clonage vocal9/10
Expressivité10/10
Direction de jeu5/10
Souveraineté10/10
Accessibilité prix10/10
Multilingue1/10

Architecture

ArchitectureHierarchical RVQ Transformer (7.7B backbone + 300M depth decoder)
Paramètres8B (7.7B backbone + 300M depth transformer)
Langues1
Auto-hébergeable Oui
Streaming No
GamiWays
Souveraineté + Expressivité — Prototype self-hosted

Très pertinent pour les exigences de souveraineté GamiWays : poids open-source, déploiement on-premises, 110ms de latence. Le conditioning audio sur le ton de l'utilisateur est un différenciateur unique pour les personnages IA émotionnellement réactifs. Bloqué par : half-duplex uniquement, focalisé anglais, pas d'API cloud encore. Recommandé pour : évaluation prototype self-hosted, déploiements souveraineté-first.

Analyse

Miso-TTS v1 est un modèle TTS open-source de 8B paramètres publié le 3 juin 2026. Il atteint 110ms de latence — parmi les plus basses revendiquées sur le marché — grâce à une architecture RVQ hiérarchique (7,7B backbone + 300M depth decoder). Le modèle conditionne sur le texte ET l'audio de l'utilisateur, permettant une génération vocale émotionnellement consciente. Poids open-source sous licence MIT modifiée. API cloud à venir. Half-duplex uniquement ; le full-duplex est un travail futur.

Points forts

  • 110ms latence — parmi les plus basses revendiquées
  • Conditioning audio sur le ton de l'utilisateur
  • Poids open-source (MIT modifié) — souveraineté totale
  • Support enterprise on-premises disponible
  • Architecture RVQ : 2048^32 tokens audio adressables
  • Clonage vocal one-shot (clip 10s)

Limitations

  • API cloud pas encore disponible (coming soon)
  • Half-duplex uniquement — pas de full-duplex ni turn-taking
  • Focalisé anglais (multilingue non documenté)
  • Pas de score ELO (non classé sur Artificial Analysis)
  • Pas de pricing pour l'API cloud
  • Pas de timestamps lip-sync

Capacités vocales

Clonage vocal Oui

One-shot voice cloning from a 10-second audio clip. Exact voice replica from first to last second of a call.

Direction émotionnelle & jeuPilotage par contexte audio

Le contexte audio peut transmettre une couleur de jeu ; aucune intention émotionnelle par API n’est isolée.

Comment : `context`, `speaker`, `temperature`, `topk` dans l’inférence open-weight.

À tester : À traiter comme piste de R&D auto-hébergée, avec références audio par état et protocole d’évaluation.

Streaming No

Streaming not documented. Half-duplex only — full-duplex and turn-taking are future work.

Données lip-sync No

No lip-sync timestamps documented.

Tarification

Prix / 1M chars
Gratuit
Prix / minute
Gratuit
Offre gratuite
Self-hosted (open-source weights, modified MIT license)

Self-hosted: free (compute costs only). Cloud API: coming soon — pricing not yet announced.

Souveraineté & Conformité

On-premise Oui

Open-source weights (modified MIT). On-premises hosting + support contracts available for enterprise teams.

GDPR No

Résidence des données : Self-hosted: full data sovereignty. Cloud API: not yet available.

Architecture RVQ — Détail

Miso-TTS v1 utilise un Transformer RVQ hiérarchique en deux étapes : un backbone de 7,7B paramètres génère les tokens audio grossiers, puis un depth transformer de 300M paramètres affine les détails fins. L'espace audio est représenté par 2048^32 tokens adressables (RVQ depth=32, codebook size=2048), soit une expressivité théorique de 10^105 combinaisons.

Backbone
7.7B params
Génère tokens grossiers
Depth Decoder
300M params
Affine les détails fins
RVQ Codebook
2048^32
Tokens audio adressables

Statut API

L'API cloud est annoncée mais pas encore disponible (juin 2026). Les poids open-source sont disponibles sur Hugging Face sous licence MIT modifiée. Le déploiement on-premises est possible pour les équipes enterprise.

Vérification de cette fiche

Vérifiée le 5 juin 2026

Miso Labs blog post, June 3, 2026 — internal latency comparison (ElevenLabs 700ms, Sesame 300ms, Human 160ms, Miso 110ms)

Note de mise à jour : Initial entry from misolabs.ai and blog post (June 3, 2026). No AA ELO yet — API not yet available.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.