Kokoro 82M v1.0
Highest-ranked open-weight TTS — ELO 1059, 82M params, Apache 2.0
Scores comparatifs
Architecture
Candidat fort pour le MVP Phase 1 souverain. Fonctionne sur l'infrastructure GPU Exoscale suisse. L'absence de clonage vocal est une limitation significative pour les cas d'usage GamiWays personnalisés. Coupler avec XTTS-v2 ou Chatterbox pour les besoins de clonage vocal.
Analyse
Kokoro 82M v1.0 est le modèle TTS open-weight le mieux classé sur Artificial Analysis (ELO 1059, rang #9). Avec seulement 82M paramètres, il fonctionne efficacement sur CPU ou GPU modeste à 36× temps réel sur T4. Licence Apache 2.0 pour déploiement souverain complet. Meilleur rapport qualité/prix parmi les modèles ouverts : $0,70/1M chars en mode géré.
Points forts
- ELO 1059 — #1 modèle open-weight
- 82M params — fonctionne sur CPU
- 36× temps réel sur T4 GPU
- Apache 2.0 — souveraineté totale
- $0,70/1M chars en mode géré
Limitations
- Pas de clonage vocal
- Anglais uniquement (américain/britannique)
- Contrôle émotion limité
- Pas de données lip-sync
Capacités vocales
No zero-shot voice cloning. Pre-built voices only (American/British English).
Le choix de voix et le débit sont disponibles en auto-hébergement ; aucune émotion native n’est documentée.
Comment : `voice` et `speed` dans KPipeline.
À tester : Convient à une voix fonctionnelle souveraine, pas à la direction émotionnelle fine sans travail audio complémentaire.
Streaming-capable. 36× real-time on T4 GPU. <100ms on modern hardware.
No native lip-sync data. Can be paired with external aligner.
Tarification
$0.70/1M chars (managed inference). Self-hosted: near-zero marginal cost.
| Plan | Abonnement/mois | Inclus | Dépassement/min |
|---|---|---|---|
Auto-hébergéRecommandé Scalez en ajoutant de la capacité CPU/GPU | Gratuit | Unlimited (infra cost only) | $0.0007 |
Souveraineté & Conformité
Full self-hosting. Apache 2.0 license. Runs on CPU without GPU.
Résidence des données : Fully local — no data leaves the server.
Positionnement de Kokoro 82M v1.0
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Kokoro prouve que la qualité TTS ne nécessite plus un calcul massif : 82M paramètres, <2GB VRAM, Apache 2.0 — le choix souveraineté-first pour les déploiements GamiWays Phase 2 sur infrastructure suisse.
A. Positionnement stratégique
Client cible : Developer / Privacy-conscious SMB — self-hosted, resource-constrained deployments
TTS open-source 82M paramètres avec qualité comparable aux modèles plus grands — fonctionne sur <2GB VRAM, Apache 2.0, zéro coût de licence.
B. Avantage concurrentiel
- Architecture légère (82M params, <2GB VRAM) — fonctionne sur matériel standard
- Licence Apache 2.0 — zéro coût de licence, droits d'utilisation commerciale complets
- Développement communautaire avec un écosystème d'intégrations croissant
Vulnérabilité : Pas de support commercial. Diversité vocale limitée vs modèles plus grands. La maintenance communautaire uniquement crée un risque d'adoption entreprise.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Entièrement auto-hébergeable sur infrastructure Suisse/UE. Zéro donnée ne quitte l'environnement de déploiement. Meilleur score souveraineté parmi les options TTS.
Build vs. Buy
Construire (intégrer et personnaliser) pour la souveraineté Phase 2. Utiliser comme baseline pour le MVP Phase 1 si la qualité est suffisante — zéro coût, contrôle total.
Risque de lock-in
Open-source Apache 2.0 — zéro lock-in fournisseur. GamiWays possède la stack complète. Le seul risque est la dépendance à l'expertise interne.
Alignement roadmap
Fort pour la souveraineté Phase 2. La Phase 1 dépend des exigences de qualité — Kokoro peut être suffisant pour de nombreux cas d'usage.
Vérification de cette fiche
Artificial Analysis Speech Leaderboard, Jan 2026
Note de mise à jour : AA Speech Arena sync 2026-08-18: ELO 1059 (rank N/A — Free tier). Name: Kokoro 82M v1.0.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026