MuseTalk v1.5 (open source)
Lip-sync temps réel 30fps+ sur GPU standard, self-hosted, 6k+ stars GitHub
Latence TTFR
~200ms
temps réel
Coût / minute
à partir de $0.000/min
selon l'abonnement souscrit
Qualité visuelle
7/10
score estimé
Protocoles
REST, WebSocket
Direction émotionnelle & mise en scène
MuseTalk est un moteur de lip-sync ; l’émotion, le regard et la mise en scène viennent de la vidéo source et de l’audio fournis.
Pas de contrôle expressif documentéParamètres et mécanisme
`video_path`, `audio_path`, `bbox_shift`, `batch_size`.
Limite à garder visible
Utile pour souveraineté et contrôle de la matière source, pas pour une intention visuelle générée par tour.
Personnalisation de l'avatar
RAG / Base de connaissances
Non intégré nativement. À implémenter dans la couche LLM.
Comportement & personnalité
Comportement défini par le LLM extérieur.
Langage corporel & gestes
Lip-sync uniquement (tête et lèvres).
Expressions faciales
Micro-expressions faciales générées via latent space inpainting.
Voix & clonage vocal
Audio fourni en entrée (TTS externe requis).
Fine-tuning du persona
Fine-tuning possible via training codes (v1.5).
Entraînement de l'avatar
Bonnes pratiques
- 01.Vidéo de référence frontale, bien éclairée
- 02.GPU NVIDIA recommandé (Tesla V100 ou équivalent)
- 03.Training codes disponibles depuis v1.5
Analyse API
Protocoles
SDKs
Sessions simultanées
Dépend du GPU disponible
Limites de débit
Limité par la capacité GPU
Fonctionnalités clés
- 30fps+ sur NVIDIA Tesla V100
- Latent space inpainting (non-diffusion = rapide)
- Windows + Linux support (v1.5)
- Training codes disponibles
- 6k+ stars GitHub, actif
Contraintes API
- GPU NVIDIA requis pour les performances temps réel
- Pas de LLM ou TTS intégré
- Intégration API à développer
Modèle tarifaire
| Plan | Prix | Minutes incluses | Dépassement |
|---|---|---|---|
| Self-hosted | $0 | Illimité | Coût GPU uniquement |
Coûts cachés / à surveiller
- Coût GPU cloud : ~$0.01–0.05/min selon instance
- Développement d'intégration requis
Souveraineté & Hébergement
Score de souveraineté
Hébergement
Self-hosted (on-premise ou cloud GPU)
GDPR
YesOn-premise
YesDétail souveraineté
Full self-hosted. Code source ouvert (GitHub). Total contrôle des données.
Contraintes & Limites
- GPU NVIDIA requis pour 30fps temps réel
- Pas de solution clé-en-main (intégration à développer)
- Lip-sync uniquement (pas de corps entier)
Pertinence pour GamiWays
Score
7/10
Option open source la plus viable pour Storygami/Edugami : lip-sync 30fps temps réel, coût GPU uniquement, total souveraineté. Nécessite un GPU NVIDIA et une intégration custom. Idéal pour un prototype self-hosted à faible coût.