GamiWays
Open SourceCC-BY 4.0

Kyutai TTS 1.6B

Delayed streams modeling — streaming-native, timestamps, batching

100 ms
TTFA (meilleur cas)
200 ms
TTFA (typique)
Gratuit
Prix par million de chars
—
ELO Score

Scores comparatifs

Qualité vocale7/10
Latence8/10
Clonage vocal6/10
Expressivité6/10
Direction de jeu3/10
Souveraineté10/10
Accessibilité prix10/10
Multilingue2/10

Architecture

ArchitectureDelayed streams modeling (novel technique)
Paramètres1.6B
Langues2
Auto-hébergeable Oui
Streaming Oui
GamiWays
Axe 1 R&D — Architecture streaming

Intéressant pour l'Axe 1 R&D (latence). La modélisation par flux décalés est une architecture novatrice à étudier. Timestamps natifs directement utilisables pour le lip-sync avatar. CC-BY 4.0 pour déploiement souverain.

Analyse

Kyutai TTS 1.6B utilise une technique novatrice de 'modélisation par flux décalés' permettant une génération streaming-native avec timestamps et batching. Publié en juillet 2025 par Kyutai (labo IA français, créateurs de Moshi). Licence CC-BY 4.0. Lié au modèle speech full-duplex Moshi. Architecture unique à étudier pour l'Axe 1 R&D.

Points forts

  • Streaming-native via flux décalés
  • Timestamps natifs pour lip-sync
  • Support batching
  • CC-BY 4.0 — déploiement souverain
  • De Kyutai (créateurs de Moshi)

Limitations

  • Support linguistique limité
  • Contrôle émotion limité
  • Moins d'adoption communautaire que Kokoro/Chatterbox

Capacités vocales

Clonage vocal Oui

Voice conditioning from audio samples. Related to Moshi speech-to-speech model.

Direction émotionnelle & jeuContrôle limité

Le timing et les pauses sont contrôlables, mais pas l’émotion de façon explicite.

Comment : `padding_between`, `padding_bonus`, `initial_padding`, `max_padding` et `<break>`.

À tester : Bonne option souveraine pour le rythme ; associer un contexte de personnage ou un moteur plus expressif pour le jeu.

Streaming Oui

Streaming-native via delayed streams modeling. Timestamps enabled. Batching supported.

Données lip-sync Oui

Timestamps natively supported via delayed streams modeling.

Tarification

Prix / 1M chars
Gratuit
Prix / minute
Gratuit
Offre gratuite
Free (open weights)

Open weights — self-hosting cost only.

Souveraineté & Conformité

On-premise Oui

Full self-hosting under CC-BY 4.0.

GDPR Conforme

Résidence des données : Fully local when self-hosted.

Analyse stratégique & business

Positionnement de Kyutai TTS 1.6B

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Kyutai Moshi est la réponse de l'UE à l'IA vocale temps réel — parole full-duplex à 160ms de latence, soutenu par 300M€ de recherche, open-source d'un laboratoire français. La licence CC-BY-NC est le seul obstacle au déploiement commercial.

Open-source / auto-hébergé
Risque lock-in :Faible
Souveraineté :Élevé
Menace open-source :Faible
Prix :Stable →

A. Positionnement stratégique

Client cible : Researcher / Developer — real-time duplex voice, French lab

Modèle voix-à-voix temps réel open-source (CC-BY-NC 4.0) de Kyutai — parole full-duplex avec 160ms de latence, soutenu par 300M€ de financement de recherche.

B. Avantage concurrentiel

  • Modèle de parole full-duplex — gère les interruptions et la parole simultanée naturellement
  • Codec audio neuronal (Mimi) + modèle de fondation parole-texte — architecture unique
  • 300M€ de financement de recherche de Kyutai (Xavier Niel, Rodolphe Saadé) — engagement R&D à long terme

Vulnérabilité : La licence CC-BY-NC 4.0 restreint l'utilisation commerciale. Modèle de laboratoire de recherche à but non lucratif — chemin de monétisation commerciale peu clair.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Laboratoire de recherche français, valeurs alignées UE, auto-hébergeable sur infrastructure Suisse/UE. CC-BY-NC limite l'utilisation commerciale mais l'utilisation recherche/prototype est gratuite et souveraine.

Build vs. Buy

Utiliser pour la recherche/prototype (Phase 1). Pour le déploiement commercial Phase 2, négocier une licence commerciale CC-BY-NC ou basculer vers des alternatives Apache 2.0.

Risque de lock-in

Open-source avec CC-BY-NC — zéro lock-in fournisseur pour l'utilisation non-commerciale. Le déploiement commercial nécessite une négociation de licence avec Kyutai.

Alignement roadmap

Excellent pour la recherche et le prototype Phase 1. Le déploiement commercial Phase 2 nécessite une clarification de licence. Le partenariat Scaleway UE aide.

Vérification de cette fiche

Vérifiée le 3 mai 2026

Kyutai blog Jul 2025 + Artificial Analysis TTS mai 2026

Note de mise à jour : Kyutai TTS 1.6B (juil 2025) : architecture 'delayed streams modeling' unique. CC-BY 4.0. Labo français Kyutai (créateurs de Moshi full-duplex). Moshi 2 en développement (annoncé 2026). Langues : EN + FR. Timestamps natifs pour lip-sync. Batching support. ELO non encore classé sur Artificial Analysis. Clonage vocal : voice conditioning audio (partiel). Self-hosted sur GPU.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.