GamiWays
open-sourceSouveraineté 5/5

MuseTalk v1.5 (open source)

Lip-sync temps réel 30fps+ sur GPU standard, self-hosted, 6k+ stars GitHub

Latence TTFR

~200ms

temps réel

Coût / minute

à partir de $0.000/min

selon l'abonnement souscrit

Qualité visuelle

7/10

score estimé

Protocoles

REST, WebSocket

Direction émotionnelle & mise en scène

MuseTalk est un moteur de lip-sync ; l’émotion, le regard et la mise en scène viennent de la vidéo source et de l’audio fournis.

Pas de contrôle expressif documenté

Paramètres et mécanisme

`video_path`, `audio_path`, `bbox_shift`, `batch_size`.

Limite à garder visible

Utile pour souveraineté et contrôle de la matière source, pas pour une intention visuelle générée par tour.

Personnalisation de l'avatar

RAG / Base de connaissances

Non intégré nativement. À implémenter dans la couche LLM.

Comportement & personnalité

Comportement défini par le LLM extérieur.

Langage corporel & gestes

Lip-sync uniquement (tête et lèvres).

Expressions faciales

Micro-expressions faciales générées via latent space inpainting.

Voix & clonage vocal

Audio fourni en entrée (TTS externe requis).

Fine-tuning du persona

Fine-tuning possible via training codes (v1.5).

Entraînement de l'avatar

Vidéo requise Oui
DuréeCourte vidéo de référence (quelques secondes)
RésolutionHD recommandé
FormatMP4
Consentement requis Non
Temps de traitementVariable selon GPU

Bonnes pratiques

  • 01.Vidéo de référence frontale, bien éclairée
  • 02.GPU NVIDIA recommandé (Tesla V100 ou équivalent)
  • 03.Training codes disponibles depuis v1.5

Analyse API

Protocoles

RESTWebSocketPython API

SDKs

Python
Webhooks No

Sessions simultanées

Dépend du GPU disponible

Limites de débit

Limité par la capacité GPU

Fonctionnalités clés

  • 30fps+ sur NVIDIA Tesla V100
  • Latent space inpainting (non-diffusion = rapide)
  • Windows + Linux support (v1.5)
  • Training codes disponibles
  • 6k+ stars GitHub, actif

Contraintes API

  • GPU NVIDIA requis pour les performances temps réel
  • Pas de LLM ou TTS intégré
  • Intégration API à développer

Modèle tarifaire

Modèle : Gratuit (open source) + coût GPU
PlanPrixMinutes inclusesDépassement
Self-hosted$0IllimitéCoût GPU uniquement
Offre gratuite
On-premise disponible
N/A

Coûts cachés / à surveiller

  • Coût GPU cloud : ~$0.01–0.05/min selon instance
  • Développement d'intégration requis

Souveraineté & Hébergement

Score de souveraineté

5/5

Hébergement

Self-hosted (on-premise ou cloud GPU)

GDPR

Yes

On-premise

Yes

Détail souveraineté

Full self-hosted. Code source ouvert (GitHub). Total contrôle des données.

Contraintes & Limites

  • GPU NVIDIA requis pour 30fps temps réel
  • Pas de solution clé-en-main (intégration à développer)
  • Lip-sync uniquement (pas de corps entier)

Pertinence pour GamiWays

Score

7/10

Option open source la plus viable pour Storygami/Edugami : lip-sync 30fps temps réel, coût GPU uniquement, total souveraineté. Nécessite un GPU NVIDIA et une intégration custom. Idéal pour un prototype self-hosted à faible coût.