Orpheus 3B
LLM-based TTS — ultra-natural speech with emotion tags and non-verbals
Scores comparatifs
Architecture
Très pertinent pour le MVP Phase 1. Les sons non-verbaux (<laugh>, <sigh>) créent une conversation plus naturelle. Apache 2.0 pour déploiement souverain sur Exoscale. Nécessite GPU A100 — compatible avec l'infrastructure GamiWays existante.
Analyse
Orpheus 3B est un modèle TTS basé sur LLaMA 3, fine-tuné pour une synthèse vocale ultra-naturelle. Les tags émotion uniques (<laugh>, <sigh>, <cough>, <gasp>) permettent des sons non-verbaux nativement. Licence Apache 2.0. Prêt pour la production via Baseten (inférence fp8/fp16). Excellent pour la synthèse vocale expressive et humaine.
Points forts
- Basé LLaMA 3 — qualité vocale naturelle
- Sons non-verbaux : <laugh>, <cough>, <gasp>
- Apache 2.0 — souveraineté totale
- Prêt production via Baseten
- 7 langues
Limitations
- 3B params — nécessite A100 pour temps réel
- ~200ms TTFA (plus lent que Kokoro)
- Pas de données lip-sync
Capacités vocales
Robust voice cloning. Configurable size variants. Multi-lingual support.
Des tags non verbaux donnent une palette utile, mais pas un curseur d’émotion déterministe.
Comment : `voice`, tags `<laugh>`, `<sigh>`, `<gasp>`, etc., et paramètres de décodage.
À tester : Le support français, la latence et l’interprétation de chaque tag doivent être testés sur les textes Où est Ava ?
Streaming capable. ~200ms TTFA on A100. Production-ready via Baseten.
No native lip-sync data.
Tarification
Open weights — self-hosting cost only. Managed inference via Baseten.
Souveraineté & Conformité
Full self-hosting under Apache 2.0. Production deployment via Baseten at fp8/fp16.
Résidence des données : Fully local when self-hosted.
Positionnement de Orpheus 3B
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Orpheus est le pionnier open-source qui a commoditisé la parole émotionnelle — son architecture basée LLM offre une expressivité quasi-humaine à zéro coût de licence, déplaçant la valeur de la qualité du modèle vers l'infrastructure de déploiement.
A. Positionnement stratégique
Client cible : Developer / Startup — LLM-based emotional speech, self-hosted
TTS basé LLM (Apache 2.0) par Canopy Labs — qualité de parole émotionnelle quasi-humaine, déployable sur Baseten/Groq ou auto-hébergé.
B. Avantage concurrentiel
- Architecture basée LLM offre une expressivité émotionnelle quasi-humaine — surpasse les anciens modèles open-source
- Licence Apache 2.0 — utilisation commerciale complète, fork-friendly
- Inférence gérée via Baseten, Groq, Together AI — déploiement facile sans auto-hébergement
Vulnérabilité : Canopy Labs est un petit laboratoire de recherche — maintenance à long terme incertaine. L'inférence basée LLM nécessite un calcul significatif.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Entièrement auto-hébergeable sur infrastructure Suisse/UE. Licence Apache 2.0. L'inférence gérée via Baseten/Groq offre des options de déploiement UE.
Build vs. Buy
Utiliser (intégrer open-source) pour le MVP Phase 1. Auto-héberger pour la souveraineté Phase 2. La qualité basée LLM justifie l'investissement en calcul.
Risque de lock-in
Open-source Apache 2.0 — zéro lock-in fournisseur. L'inférence gérée crée une dépendance douce sur Baseten/Groq mais l'alternative auto-hébergée est toujours disponible.
Alignement roadmap
Bon pour les deux phases. Les exigences de calcul pour l'inférence basée LLM peuvent être une contrainte pour les déploiements on-premise Phase 2.
Vérification de cette fiche
Canopy AI GitHub + Modal.com TTS comparison, 2025
Note de mise à jour : Orpheus 3B released Jan 2025. Apache 2.0. 3B params. Emotion tags (laugh, sigh, etc.). Self-hosted on GPU. 7 languages.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.