GamiWays

Avatars Vidéo Streaming

Repères communs pour choisir entre un service commercial et un modèle ouvert, puis comprendre ce qui construit réellement une expérience vidéo conversationnelle crédible.

Cadrage stratégique : lire l’avatar streaming en situation

Ce que les chiffres disent

Une latence annoncée ou un nombre de FPS décrit une partie du rendu, pas à lui seul la présence. Testez la synchronisation audio-vidéo, le délai de reprise après un tour de parole et la stabilité lorsque le réseau varie.

À croiser dans le tableau

Lisez le temps réel avec le transport, la conversation, le corps, la direction de jeu et la souveraineté. Un visage très réaliste peut convenir à une démonstration sans permettre la régie, l’écoute ou le format de scène requis.

Rester attentif à

L’avatar n’est qu’une couche du système : STT, TTS, LLM, WebRTC et orchestration influent sur l’expérience. Vérifiez aussi droits à l’image, modération, résidence des données, streams parallèles, coût par session et plan de repli.

Méthode de lecture : fixez d’abord la scène à tenir et le degré de régie attendu ; comparez ensuite présence, latence et contrôle sur les mêmes répliques, puis validez la charge, les droits et le repli sur une session complète.

Quatre couches à ne pas confondre

Une expérience vivante associe visage, voix, tour de parole et cadre de données

Ces repères permettent d’éviter qu’un bon modèle de voix soit pris pour un avatar, ou qu’une détection de signal soit prise pour une direction de jeu. Chaque carte indique ce qui est documenté et ce qui demande encore une mesure Où est Ava ? ou Dilemme Plastique.

Identité et prise de tour vidéo

Tavus Phoenix-4.5 + Sparrow-2

Crée un personnage depuis image ou vidéo, déclare le français au PAL et règle patience, interruption et relance. À tester : voix française dirigée, consentement/policy de perception et latence de scène complète.

Voir la fiche Tavus →

Rendu vidéo découplé

HeyGen LiveAvatar LITE

Conserve avatar et transport vidéo chez HeyGen, tout en gardant STT, LLM, RAG, voix française et intention de jeu sous contrôle Où est Ava ? À tester : changement de voix, droits et compatibilité lip-sync ; pas de geste live déterministe documenté.

Voir la fiche HeyGen →

Comment la réplique est dite

Inworld Realtime TTS-2

Porte direction libre, non-verbaux, contexte audio inter-tours et modes Expressive/Balanced/Stable. C’est une couche voix à associer au renderer ; à tester : consignes françaises, scènes sensibles et reproductibilité.

Voir la fiche Inworld →

Français, précision et résidence

Gradium TTS

Vise les termes structurés, les timestamps et un rythme stable. La résidence UE est activable et vérifiable sur plan payant ; elle ne vaut pas résidence suisse ni direction émotionnelle explicite.

Voir la fiche Gradium →

Deux voies à comparer

Même expérience visée, contraintes d’exploitation différentes

Les services commerciaux accélèrent la mise en scène et le test d’un flux live. Les modèles ouverts demandent de construire la capacité mais permettent de discuter souveraineté, licences et coût d’infrastructure. Les deux voies se lisent avec les mêmes questions de présence, latence, direction et repli.

Vidéo générative guidée par le dialogue

L’enjeu pour Où est Ava ? n’est pas de classer des clips génériques : il est de produire un plan court, cohérent avec ce qui vient d’être dit — souvenir, lieu, indice ou bascule de monde — puis de l’insérer au bon moment. Une seconde piste explore des environnements visuels qui réagissent en direct, sans être des avatars.

A

Inserts contextuels — à préparer, mettre en cache ou déclencher

Ces modèles produisent un plan autonome. Ils conviennent à un montage réactif ; ils ne constituent pas un flux vidéo continu.

Seedance 2.5

ByteDance Seed

Insert
Accès
API BytePlus annoncée ; disponibilité à confirmer
Temporalité
Plans de 30 s, extensions ; génération asynchrone
Contrôle
Jusqu’à 30 images, 10 vidéos et 10 audios ; édition par timestamp

Plan de souvenir, lieu ou indice à déclencher entre deux échanges

Source officielle ↗

Gemini Omni Flash + Veo 3.1

Google

Insert
Accès
Gemini API
Temporalité
Tâche générative ; pas de flux image par image
Contrôle
Références texte, image, audio et vidéo ; édition multi-tour ; extension / dernière image avec Veo

Fabrique d’inserts versionnés à partir du contexte de dialogue

Source officielle ↗

Grok Imagine API

xAI

Insert
Accès
API et plateformes partenaires
Temporalité
Itération rapide, à mesurer sur le scénario Où est Ava ?
Contrôle
Texte / image, édition d’objets, de mouvement et de scène

Prévisualiser ou modifier un insert en conservant le plan source

Source officielle ↗
B

Flux visuels interactifs — hors avatar

Ces world models génèrent les images à mesure d’une action, d’une navigation ou d’un événement. Ils ouvrent une piste de décor ou de monde réactif, avec des coûts, droits et limites d’action propres.

Runway GWM-Worlds

Runway · Accès anticipé / à qualifier

Génération temps réel image par image

Pose caméra, actions et audio ; environnement explorable

Scène explorée ou décor réactif, distinct de l’avatar

Source officielle ↗

Google Genie 3

Google DeepMind · Prototype de recherche / Project Genie limité

720p à 20–24 fps ; quelques minutes d’interaction

Navigation et évènements de monde pilotés par prompt

Piste de recherche pour un monde réactif, pas une brique de production

Source officielle ↗

World Labs RTFM

World Labs · Aperçu de recherche

Fréquence interactive visée sur un H100

Frames interactives et persistance spatiale à partir d’images

Piste spatiale à chiffrer avant toute promesse de service

Source officielle ↗

Decart Lucy / Oasis

Decart · Accès produit à qualifier

Lucy : transformation live à 30 fps annoncée

Transformation de flux live ou monde interactif selon le produit

Tester une transformation live consentie, pas un insert narratif généré

Source officielle ↗

Business & Marché

Deux repères récents, à lire séparément : les périmètres de marché ne s’additionnent pas.

Digital humans · monde

$7.96B · 2026→ $26.04B · 203126.76% CAGR

Les avatars interactifs représentaient 58.63% du segment en 2025.

Mordor Intelligence ↗

Avatars IA · États-Unis

$287.0M · 2026→ $1.84B · 203330.4% CAGR

Le service client par avatar représentait 32.9% de ce marché en 2025.

Grand View Research ↗

Digital humans · monde

Md USD · points publiés, non interpolation annuelle

2025$6.28B2026$7.96B2031$26.04B● observé / estimé○ projection

Avatars IA · États-Unis

M USD · points publiés, non interpolation annuelle

2025$218.7M2026$287M2033$1.84B● observé / estimé○ projection

Indicateurs de structure · digital humans

Mordor Intelligence ↗
Part interactive58.63%

Digital humans · 2025

Déploiement cloud71.12%

Digital humans · 2025

Systèmes GenAI46.41%

Digital humans · 2025

Lecture pour GamiWays : l’essor du segment soutient l’exploration, mais ne préjuge pas de la faisabilité d’Où est Ava ? ou du Dilemme Plastique. Le critère de décision reste la preuve d’une expérience crédible, contrôlable et économiquement soutenable sur le terrain.

Positionnement stratégique GamiWays

GamiWays assemble conversation IA, avatar vidéo, séquençage et contrôle narratif ou pédagogique. La valeur ne vient pas d’un modèle vidéo isolé : elle dépend de l’intégration, de la souveraineté choisie et des mesures menées dans les expériences réelles.