Moshi (Kyutai)
Full-duplex spoken dialogue — simultaneous listening and speaking
Scores comparatifs
Architecture
Référence clé pour l'Axe 1 R&D (conversation full-duplex). La capacité full-duplex est l'objectif à long terme pour GamiWays — permet la gestion naturelle des interruptions. CC-BY 4.0 pour déploiement souverain. Non adapté au MVP Phase 1 — évaluer pour la recherche avancée Axe 1.
Analyse
Moshi est un modèle fondation speech-text full-duplex de Kyutai (labo IA français). Permet l'écoute et la parole simultanées — contrairement aux systèmes à tours. Utilise le codec audio neuronal streaming Mimi. Licence CC-BY 4.0 pour déploiement souverain. Référence pour la recherche sur la conversation full-duplex.
Points forts
- Full-duplex : écoute + parole simultanées
- CC-BY 4.0 — déploiement souverain commercial
- Codec streaming Mimi
- De Kyutai (labo IA européen)
- Référence recherche full-duplex
Limitations
- Anglais uniquement
- Nécessite A100 pour temps réel
- Pas de clonage vocal
- Stabilité niveau recherche
Capacités vocales
No voice cloning. Fixed voice output.
La parole est naturellement conversationnelle, mais aucune commande API d’émotion, style ou intention n’est exposée.
Comment : Températures `temp` et `temp_text`, choix de checkpoint uniquement.
À tester : À réserver aux recherches sur le full-duplex, pas à la mise en jeu fine d’un personnage Où est Ava ?
Full-duplex: simultaneous listening and speaking. Streaming neural audio codec (Mimi). Real-time capable on A100.
No native lip-sync data.
Tarification
Open weights — self-hosting cost only.
Souveraineté & Conformité
Full self-hosting under CC-BY 4.0. Commercial use allowed.
Résidence des données : Fully local when self-hosted.
Positionnement de Moshi (Kyutai)
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Moshi est la percée open-source de Kyutai pour l'IA vocale full-duplex temps réel — 160ms de latence, recherche soutenue par l'UE, licence CC-BY-NC. L'avenir de l'interaction vocale naturelle, disponible aujourd'hui pour la recherche.
A. Positionnement stratégique
Client cible : Researcher / Developer — real-time duplex voice, French lab
IA vocale temps réel full-duplex de Kyutai — gère les interruptions, la parole simultanée et le flux de conversation naturel à 160ms de latence.
B. Avantage concurrentiel
- Parole full-duplex — gère les interruptions et la parole simultanée sans gestion des tours
- 160ms de latence bout en bout — compétitif avec les solutions vocales temps réel commerciales
- 300M€ de soutien de recherche Kyutai — engagement open-source à long terme
Vulnérabilité : La licence CC-BY-NC 4.0 restreint l'utilisation commerciale. Modèle de recherche — disponibilité en production et support entreprise incertains.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Laboratoire français, aligné UE, auto-hébergeable. CC-BY-NC restreint l'utilisation commerciale mais l'utilisation recherche/prototype est gratuite et souveraine.
Build vs. Buy
Utiliser pour la recherche/prototype (Phase 1). Pour le commercial Phase 2, négocier la licence ou utiliser des alternatives Apache 2.0 (Ultravox, Chatterbox).
Risque de lock-in
Open-source CC-BY-NC — zéro lock-in fournisseur pour le non-commercial. Le déploiement commercial nécessite une négociation de licence.
Alignement roadmap
Excellent pour la recherche et la Phase 1. Le déploiement commercial Phase 2 nécessite la résolution de la licence CC-BY-NC.
Vérification de cette fiche
Kyutai GitHub + research blog, 2024–2025
Note de mise à jour : Moshi released Sep 2024 by Kyutai. CC-BY 4.0. Full-duplex S2S with inner monologue. 7B params. Self-hosted on GPU.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.