Kyutai TTS 1.6B
Delayed streams modeling — streaming-native, timestamps, batching
Scores comparatifs
Architecture
Intéressant pour l'Axe 1 R&D (latence). La modélisation par flux décalés est une architecture novatrice à étudier. Timestamps natifs directement utilisables pour le lip-sync avatar. CC-BY 4.0 pour déploiement souverain.
Analyse
Kyutai TTS 1.6B utilise une technique novatrice de 'modélisation par flux décalés' permettant une génération streaming-native avec timestamps et batching. Publié en juillet 2025 par Kyutai (labo IA français, créateurs de Moshi). Licence CC-BY 4.0. Lié au modèle speech full-duplex Moshi. Architecture unique à étudier pour l'Axe 1 R&D.
Points forts
- Streaming-native via flux décalés
- Timestamps natifs pour lip-sync
- Support batching
- CC-BY 4.0 — déploiement souverain
- De Kyutai (créateurs de Moshi)
Limitations
- Support linguistique limité
- Contrôle émotion limité
- Moins d'adoption communautaire que Kokoro/Chatterbox
Capacités vocales
Voice conditioning from audio samples. Related to Moshi speech-to-speech model.
Le timing et les pauses sont contrôlables, mais pas l’émotion de façon explicite.
Comment : `padding_between`, `padding_bonus`, `initial_padding`, `max_padding` et `<break>`.
À tester : Bonne option souveraine pour le rythme ; associer un contexte de personnage ou un moteur plus expressif pour le jeu.
Streaming-native via delayed streams modeling. Timestamps enabled. Batching supported.
Timestamps natively supported via delayed streams modeling.
Tarification
Open weights — self-hosting cost only.
Souveraineté & Conformité
Full self-hosting under CC-BY 4.0.
Résidence des données : Fully local when self-hosted.
Positionnement de Kyutai TTS 1.6B
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Kyutai Moshi est la réponse de l'UE à l'IA vocale temps réel — parole full-duplex à 160ms de latence, soutenu par 300M€ de recherche, open-source d'un laboratoire français. La licence CC-BY-NC est le seul obstacle au déploiement commercial.
A. Positionnement stratégique
Client cible : Researcher / Developer — real-time duplex voice, French lab
Modèle voix-à-voix temps réel open-source (CC-BY-NC 4.0) de Kyutai — parole full-duplex avec 160ms de latence, soutenu par 300M€ de financement de recherche.
B. Avantage concurrentiel
- Modèle de parole full-duplex — gère les interruptions et la parole simultanée naturellement
- Codec audio neuronal (Mimi) + modèle de fondation parole-texte — architecture unique
- 300M€ de financement de recherche de Kyutai (Xavier Niel, Rodolphe Saadé) — engagement R&D à long terme
Vulnérabilité : La licence CC-BY-NC 4.0 restreint l'utilisation commerciale. Modèle de laboratoire de recherche à but non lucratif — chemin de monétisation commerciale peu clair.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Laboratoire de recherche français, valeurs alignées UE, auto-hébergeable sur infrastructure Suisse/UE. CC-BY-NC limite l'utilisation commerciale mais l'utilisation recherche/prototype est gratuite et souveraine.
Build vs. Buy
Utiliser pour la recherche/prototype (Phase 1). Pour le déploiement commercial Phase 2, négocier une licence commerciale CC-BY-NC ou basculer vers des alternatives Apache 2.0.
Risque de lock-in
Open-source avec CC-BY-NC — zéro lock-in fournisseur pour l'utilisation non-commerciale. Le déploiement commercial nécessite une négociation de licence avec Kyutai.
Alignement roadmap
Excellent pour la recherche et le prototype Phase 1. Le déploiement commercial Phase 2 nécessite une clarification de licence. Le partenariat Scaleway UE aide.
Vérification de cette fiche
Kyutai blog Jul 2025 + Artificial Analysis TTS mai 2026
Note de mise à jour : Kyutai TTS 1.6B (juil 2025) : architecture 'delayed streams modeling' unique. CC-BY 4.0. Labo français Kyutai (créateurs de Moshi full-duplex). Moshi 2 en développement (annoncé 2026). Langues : EN + FR. Timestamps natifs pour lip-sync. Batching support. ELO non encore classé sur Artificial Analysis. Clonage vocal : voice conditioning audio (partiel). Self-hosted sur GPU.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.