MuseTalk v1.5 (open source)
Lip-sync temps réel 30fps+ sur GPU standard, self-hosted, 6k+ stars GitHub
TTFR Latency
~200ms
real-time
Cost / minute
from $0.000/min
depending on plan
Visual Quality
7/10
estimated score
Protocols
REST, WebSocket
Emotional Direction & Staging
MuseTalk is a lip-sync engine; emotion, gaze and staging come from the supplied source video and audio.
No documented expressive controlParameters and mechanism
`video_path`, `audio_path`, `bbox_shift`, `batch_size`.
Limit to keep visible
Useful for sovereignty and source-material control, not for generated visual intent per turn.
Avatar Customisation
RAG / Knowledge Base
Non intégré nativement. À implémenter dans la couche LLM.
Behavior & Personality
Comportement défini par le LLM extérieur.
Body Language & Gestures
Lip-sync uniquement (tête et lèvres).
Facial Expressions
Micro-expressions faciales générées via latent space inpainting.
Voice & Voice Cloning
Audio fourni en entrée (TTS externe requis).
Persona Fine-Tuning
Fine-tuning possible via training codes (v1.5).
Avatar Training
Best Practices
- 01.Vidéo de référence frontale, bien éclairée
- 02.GPU NVIDIA recommandé (Tesla V100 ou équivalent)
- 03.Training codes disponibles depuis v1.5
API Analysis
Protocols
SDKs
Concurrent Sessions
Dépend du GPU disponible
Rate Limits
Limité par la capacité GPU
Key Features
- 30fps+ sur NVIDIA Tesla V100
- Latent space inpainting (non-diffusion = rapide)
- Windows + Linux support (v1.5)
- Training codes disponibles
- 6k+ stars GitHub, actif
API Constraints
- GPU NVIDIA requis pour les performances temps réel
- Pas de LLM ou TTS intégré
- Intégration API à développer
Pricing Model
| Plan | Price | Included minutes | Overage |
|---|---|---|---|
| Self-hosted | $0 | Illimité | Coût GPU uniquement |
Hidden costs / watch out
- Coût GPU cloud : ~$0.01–0.05/min selon instance
- Développement d'intégration requis
Sovereignty & Hosting
Sovereignty Score
Hosting
Self-hosted (on-premise ou cloud GPU)
GDPR
YesOn-premise
YesSovereignty detail
Full self-hosted. Code source ouvert (GitHub). Total contrôle des données.
Constraints & Limits
- GPU NVIDIA requis pour 30fps temps réel
- Pas de solution clé-en-main (intégration à développer)
- Lip-sync uniquement (pas de corps entier)
GamiWays Relevance
Score
7/10
Option open source la plus viable pour Storygami/Edugami : lip-sync 30fps temps réel, coût GPU uniquement, total souveraineté. Nécessite un GPU NVIDIA et une intégration custom. Idéal pour un prototype self-hosted à faible coût.