GamiWays

Comportement Avatar & Expérience Vidéo Vivante

Structurer les enjeux pour une expérience vidéo streaming crédible — un flux vivant, pas un visage qui parle.

L'enjeu central : un flux vidéo vivant, pas un TTS avec un visage

L'objectif de GamiWays n'est pas de produire un avatar audio avec une animation faciale synchronisée — c'est de proposer une expérience vidéo continue et réactive, où l'utilisateur perçoit une présence réelle. Cela implique un Flux B capable de traduire une consigne de jeu jointe à la réplique — intention, intensité, rythme, silence, proximité — en voix et en présence cohérentes. Le TTS reste un composant du pipeline, mais l'output final est vidéo et le comment est aussi important que le texte.

Flux A : Analyse vidéo — offline, non-critiqueFlux B : Stream vidéo avatar — enjeu principal temps réelKPI : TTFA < 500ms · Fluidité 25fps+ · Sync audio/vidéo < 100ms
FLUX A — Analyse des Sources VidéoTraitement offline · Pas un enjeu R&D majeurArchives Vidéo(source material)✓ Offline · SimpleExtractionde framesJPEG · 1fpsAnalyseSémantiqueCLIP · BLIP2Tags · EmbeddingsBase deDescripteursVector DBSemantic searchPlaylist VidéoDynamiqueMise à jour en temps réelselon la conversationVidéos IllustrativesJouent en parallèle de l'avatar(stream secondaire)Avatar speaks ✓Vidéos Informatives / InterviewL'avatar se taitla vidéo délivre le contenuAvatar pauses ⏸FLUX B — Construction de l'AvatarEntraînement offline + inférence temps réel · Enjeu R&D principalVidéod'EntraînementUnique · Jamais jouéedans l'expérienceEmpreinteComportementaleMicro-expressionsGestes · RythmeProsodiqueModèleAvatar⚠ Enjeu R&D (Axe 2b)Distillation diffusionCache intelligent<500ms cibleAvatarTemps RéelParle · S'arrête pendantles vidéos informativesSORTIE — Expérience Dual-StreamSynchronisation multi-stream · <100ms · Expertise interne MemowaysStream PrincipalAvatar temps réelWebRTC · H.264 · <100msPauses during informative videosStream SecondairePlaylist vidéo dynamiqueIllustrative: insert alongside avatarInformative: full-screen, avatar pausesOrchestration intelligente : l'avatar cède la parole aux vidéos informativesLes vidéos illustratives jouent en insert sans interrompre l'avatarAxes de Recherche : Axe 2b (Avatar <500ms) · Axe 2a (TTS Expressif) · Axe 1 (Mémoire Conversationnelle)L'analyse des sources vidéo (Flux A) n'est PAS un enjeu de recherche — traitement offline standard
↔ Zoom
Click to expand

Les quatre dimensions de l'expérience vidéo vivante

Pour qu'un avatar vidéo soit perçu comme vivant et crédible, quatre dimensions doivent être adressées simultanément — et non séquentiellement.

Extraction comportementale depuis archives

Extraire des patterns comportementaux individuels depuis des vidéos existantes — sans nouvelles sessions de capture. Identifier le répertoire de micro-expressions, le vocabulaire gestuel, les relations temporelles geste-parole, les habitudes posturales.

Question clé :

Peut-on extraire automatiquement le vocabulaire gestuel d'un individu depuis des images non contrôlées ?

Langage corporel cohérent et coordonné

Aller au-delà du lip-sync. Générer un comportement corporel coordonné : synchronisé avec le contenu de la parole et le ton émotionnel, culturellement approprié, cohérent avec la personnalité définie. La plupart des systèmes actuels se concentrent sur le visage uniquement — le corps est absent ou issu d'une bibliothèque de templates.

Question clé :

Comment assurer que le langage corporel, les expressions faciales et la prosodie racontent la même histoire émotionnelle simultanément ?

Streaming vidéo vivant et crédible

L'expérience cible n'est pas un avatar audio avec un visage animé — c'est un flux vidéo continu, réactif, qui donne l'impression d'une présence réelle. Cela implique un rendu temps réel du visage et du corps, synchronisé avec la parole générée, sans latence perceptible ni artefacts visuels. Le TTFA (Time to First Audio/Frame) et la fluidité du stream sont les KPIs principaux.

Question clé :

Peut-on maintenir un flux vidéo avatar fluide à moins de 500ms de latence totale sur une connexion réseau standard ?

Performance temps réel sous contrainte de latence

Approches : base pré-rendue + lip-sync temps réel, distillation de modèle, cache intelligent, dégradation gracieuse. L'objectif est un avatar vidéo personnalisé acceptable à moins de 500ms sur hardware accessible. Simli Trinity-1 (≤202F300ms TTFA) et bitHuman Essence (CPU, sans GPU) représentent les deux extrêmes du spectre latence/coût.

Question clé :

Peut-on exploiter la quantification, le pruning ou la distillation pour rendre la génération vidéo temps réel faisable sur GPU accessible (A10G) ?

La couche émotionnelle : ce qui fait tenir l'expérience dans la durée

Un avatar vidéo conversationnel ne se réduit pas à un flux vidéo fluide. La fidélité comportementale exige une couche de conception émotionnelle explicite : définir, encoder et activer un répertoire d'états cohérents avec la personnalité du personnage, son histoire et le contexte de l'interaction.

Répertoire émotionnel

Définir un ensemble d'états émotionnels discrets et continus par personnage. Chaque état encode : expression faciale, prosodie vocale, cadence, posture, micro-comportements. Le répertoire est le fondement de toute cohérence émotionnelle dans la durée.

Transitions et cohérence temporelle

Les transitions entre états émotionnels doivent être fluides, cohérentes avec la personnalité, et ne pas créer de ruptures perceptibles. Le défi est d'éviter l'uncanny valley émotionnel — quand l'avatar change d'état abruptement ou de manière incohérente avec son historique.

Activation contextuelle en temps réel

L’état émotionnel mobilise contenu, historique et signaux entrants (ton, rythme, silence). Il faut distinguer la perception de ces signaux de la manière de répondre : Hume EVI-3 documente une perception prosodique, tandis qu’Inworld Realtime TTS-2 peut porter une direction vocale, des non-verbaux et le contexte audio des tours précédents. Aucun de ces apports ne remplace une mesure Où est Ava ? de bout en bout.

Du texte à la performance : ce qui peut réellement être piloté

La direction doit voyager avec la réplique sous une forme structurée : intention dramatique, énergie, débit, pauses, non-verbal autorisé et état visuel. Les prestataires ne reçoivent pas tous cette information de la même façon : certains exposent des paramètres API explicites, d’autres interprètent des tags ou un prompt, et d’autres ne peuvent être animés que par l’audio livré en entrée.

Pilotage explicite

Pour une régie par tour : Anam (director notes et cues), Simli (état facial) et bitHuman (gestes préparés). Côté voix : Cartesia, Hume et Flux exposent des contrôles plus directs.

Direction interprétée

Les tags et prompts de ElevenLabs, Inworld, xAI, Tavus ou LemonSlice peuvent orienter le jeu, mais doivent être évalués réplique par réplique : ils ne constituent pas une commande visuelle déterministe.

Audio-driven : repli utile

Pour Hedra, Avatario ou MuseTalk, l’émotion doit venir d’un TTS expressif ou d’un audio produit en amont. C’est une option de repli, pas un contrôle de mise en scène temps réel.

Storygami

Solutions vidéo streaming — Cinéma conversationnel

Storygami exige un flux vidéo cinématique : latence < 500ms impérative, full-duplex natif, expressivité émotionnelle contrôlable par le créateur. L'avatar incarne un personnage avec une biographie — chaque rupture de fluidité brise l'immersion.

Latence la plus basse du marché (< 300ms TTFA)
Full-duplex natif — interruptions gérées
WebSocket temps réel, streaming continu
API créateur avec contrôle émotionnel partiel
Fidélité faciale inférieure à HeyGen Avatar V
Clonage vocal limité (voix pré-définies)
Prix : $0.10/min (Pro) — coûteux à grande échelle
Streams parallèles limités selon le plan

Meilleur choix pour Storygami : latence cinématique, full-duplex, streaming continu. Compromis sur la fidélité faciale.

Latence ultra-faible (< 200ms) — CPU uniquement, sans GPU
Streaming continu, pas de génération par chunks
Déploiement on-premise possible (souveraineté)
Coût infrastructure très bas (CPU cloud)
Fidélité visuelle limitée vs solutions GPU
Expressivité émotionnelle moins riche
Moins de voix disponibles
Documentation API moins mature

Alternative économique pour Storygami si la latence prime sur la fidélité. Idéal pour les déploiements souverains.

Qualité vidéo premium — corps entier possible
Intelligence émotionnelle native (Genesis 2.0)
Full-duplex avec gestion des interruptions
Clonage d'avatar depuis vidéo existante
Latence plus élevée que Simli (< 500ms vs < 300ms)
Prix premium — non documenté publiquement
Streams parallèles limités en plan standard
Moins de contrôle créateur sur les émotions

Option haute fidélité pour Storygami si la qualité visuelle prime. Latence acceptable pour des scènes moins réactives.

Emotion API + Action API — contrôle créateur explicite
Multi-style : 1 acteur couvre plusieurs personnages
Self-Managed Pipeline disponible (A100/H100)
Streaming continu avec synchronisation audio/vidéo
Latence intermédiaire (< 400ms)
Prix élevé en plan cloud ($0.21/min)
Nécessite GPU puissant en self-hosted
Documentation moins accessible

Meilleur contrôle créateur pour Storygami. Seule plateforme avec Emotion API explicite. Coût à surveiller.

À mesurer dans Où est Ava ?
CVI vidéo : Phoenix-4.5 crée le visage depuis image ou vidéo, Raven-1 lit des signaux audio-visuels selon policy
Sparrow-2 prend en compte pauses, prosodie, interruptions, acquiescements, bruit et parole de fond
Patience, interruptibilité et relance se règlent dans le flux conversationnel
Replica personnalisée, PAL français et Echo mode permettent de tester une voix française externe dirigée
Tavus ne publie pas de latence de dialogue Où est Ava ? de bout en bout : elle doit être mesurée
Ces réglages orientent le tour de parole, pas un geste, un regard ou une expression déterminée
Hébergement US ; consentement et policy UE à vérifier si Raven-1 est mobilisé
Premier plan payé : $22/60 min et une seule session simultanée

Critères Sparrow-2 · prise de tour

Candidat de test pour les scènes où savoir attendre importe autant que répondre : silence après un événement lourd, acquiescement ou parole chevauchée. À évaluer avec la voix française, le réseau et la direction de jeu Où est Ava ? avant toute promesse de fluidité.

Edugami

Solutions vidéo streaming — Agent pédagogique

Edugami privilégie la présence bienveillante et adaptative : l'avatar détecte la frustration ou la confusion de l'apprenant. La latence < 800ms est acceptable, mais la souveraineté des données (RGPD) et le coût par session sont des contraintes fortes.

< 500ms
Intelligence émotionnelle native — détection frustration/confusion
Conçu pour les agents conversationnels pédagogiques
Prix accessible : Starter $12/mois (30 min incluses)
Body language intégré, pas seulement le visage
Contrôle émotionnel non configurable par le créateur
Streams parallèles limités (Free: 1, Starter: 3)
Multilingue limité (EN/FR principalement)
Latence < 500ms — acceptable mais pas cinématique

Meilleur choix pour Edugami : agent pédagogique natif, prix accessible, émotions adaptatives. Idéal pour le Dilemme Plastique.

Raven-1 : perception entrante à soumettre à la policy et au consentement de l’apprenant
Phoenix-4.5 : personnage créé depuis image ou vidéo, puis à valider sur un médiateur stable
Sparrow-2 : pauses, interruptions et bruit pris en compte dans le flux conversationnel
Réponses personnalisées par apprenant avec attribution de participant
Latence de dialogue totale non publiée : à mesurer avec la pile pédagogique
Premier plan payé : $22/60 min ; dépassement Builder $0.35/min
Sessions simultanées : Starter 1, Builder 3, Growth 10
Les réglages de tour ne constituent pas une régie gestuelle déterministe

Candidat d’essai pour un dialogue pédagogique attentif, sans promettre une latence cible ni une détection émotionnelle autorisée. Vérifier d’abord pauses, interruptions, consentement/policy, coût par cohorte et stabilité du médiateur avant l’usage face à une classe.

Clonage d'avatar depuis photo unique — très accessible
API bien documentée, intégration facile
Prix accessible en plan Lite ($5.9/mois)
Multilingue (40+ langues)
Latence 3–6s — incompatible avec une conversation temps réel
Pas de full-duplex, pas de streaming continu
Expressivité émotionnelle limitée
Streams parallèles non documentés publiquement

Adapté uniquement pour Edugami en mode asynchrone (vidéos pédagogiques pré-générées). Non viable pour le temps réel.

Solutions de repli audio — si la vidéo n'est pas disponible ou trop coûteuse

Dans les cas où le streaming vidéo n'est pas viable (contraintes réseau, budget, RGPD strict), ces solutions audio maintiennent une présence émotionnelle crédible via la voix seule. Elles sont classées par pertinence pour Edugami.

~$0.043/min (XS)

Option française pour précision de termes, timestamps et rythme stable : 216 ms TTFA P50 et 81 % sur des entités structurées incluant le français sont annoncés par Gradium. La résidence UE doit être activée sur un plan payant et vérifiée ; elle ne suffit pas à qualifier le déploiement de souverain. Aucun contrôle émotionnel explicite n’est documenté.

#2Eleven v4Nouveau
$0.003/min

Sound tags natifs ([rires], [soupir], [hésitation]) permettent de simuler une présence émotionnelle sans vidéo. Expressivité prosodique contrôlable par prompt. Clonage vocal depuis 1 min d'audio. Solution de repli haute qualité si la vidéo n'est pas disponible.

$0.005/min

Sonic 3.6 (27 août 2026) : 44 langues, sous 90 ms annoncé par Cartesia. Ink-2 reste anglais, donc pas le STT français du couple. L’ELO du portail est encore le snapshot du 18 août, pas un nouveau rang.

Différenciateur clé — état de l'art août 2026

L’état de l’art est plus nuancé qu’un simple « expressif / non expressif ». Anam expose aujourd’hui la régie temps réel la plus détaillée (director notes, intensité et cues synchronisés) ; Simli expose des états faciaux discrets ; bitHuman déclenche des gestes préparés. Aucun service évalué ne documente à la fois, en streaming, une commande déterministe par tour de la prosodie, du regard, des gestes, du cadrage et de l’expression. La décision Où est Ava ? est donc un test de pipeline voix + avatar + orchestrateur, et non le choix d’un avatar magique.

Comparatif — Plateformes streaming vidéo avatar

Cliquez sur un en-tête pour trier

PlateformeTTFALip-syncStreams maxPrixSouverainetéUsage cible
< 200ms✓ CPU50 (Business)$0.01/minUS — On-prem possibleStorygami ✓ / Edugami ✓
< 300ms✓ Natif10 (Pro)$0.10/minUS — AWSStorygami ✓✓
< 400ms✓ Multi-style3 (Starter)$0.21/minUS — Self-hosted A100Storygami ✓✓
< 500ms✓ + Corps3 (Starter)$0.12/minEU — RGPDEdugami ✓✓
< 500ms✓ Corps entier10 (Starter)Sur devisEU — On-prem EnterpriseStorygami ✓✓
< 500ms✓ Open-sourceSelon GPUGPU cloud ~$0.05/minSelf-hosted — souverainStorygami/Edugami self-hosted
2–5s✓ Haute fidélité20 (Essential)$0.05/secUS — AWSAsync uniquement
3–6s✓ Photo → vidéoNon documenté$5.9/moisUS — AWSEdugami async
CVI : à mesurer✓ Haute fidélité1 Starter · 3 Builder · 10 Growth$0.367/min (Starter)US — AWSOù est Ava ?/Edugami : à tester

Mise à jour : août 2026 — Nouveau = ajouté · MAJ = mis à jour · TTFA coloré : < 300ms · < 500ms · > 1s