GamiWays
← Projet GamiWays›État de l’art
Veille stratégique2024–2026

État de l’Art & Perspectives de Recherche

Les recherches qui éclairent les prochains choix de GamiWays : mémoire conversationnelle fiable, direction de jeu vocale, présence d’avatar crédible et orchestration maîtrisable.

Insight clé : chaque référence est reliée à un protocole Où est Ava ?, Storygami, Edugami ou Core pour passer d’un résultat académique à une hypothèse mesurable.

01

Décisions de recherche

Section

Intérêt direct

Ce que la recherche débloque dès maintenant

Quatre décisions de Phase B à éclairer avant de multiplier les intégrations ou les démonstrateurs.

01

Mesurer la mémoire utile

Séparer ce qui doit être retenu, résumé, contredit ou oublié sur plusieurs sessions — plutôt que d’allonger le contexte.

02

Piloter le comment, pas seulement le quoi

Évaluer intention, rythme, silence et prosodie par scène pour que les personnages ne récitent pas simplement une réponse.

03

Tester la présence vidéo

Mesurer la parole, l’écoute, la réaction non verbale et la stabilité d’identité séparément au lieu de noter l’avatar de façon globale.

04

Arbitrer coût, souveraineté et confiance

Comparer les architectures sur la latence perçue, l’infrastructure requise, les droits sur les données et la possibilité de repli audio.

02

Synthèse stratégique

Section

Matrice de décision

Prioriser ce qui doit être validé, arbitré ou sécurisé

Choisissez une dimension, puis réduisez la liste par impact ou terrain. Chaque enjeu ouvre une lecture de recherche, une action prioritaire et les pistes à poursuivre.

Mode d’emploi : sélectionnez un enjeu pour faire apparaître l’action recommandée.

Filtrer par impact

Filtrer par terrain

6 enjeux affichés

03

Corpus & protocoles

Section
Corpus navigable

Trouver une recherche selon la décision à éclairer

Filtrez les références par enjeu plutôt que de parcourir une bibliographie linéaire. Chaque fiche relie un résultat à une hypothèse, un test ou un arbitrage concret pour le Core, Storygami ou Edugami.

45 références affichées

Mots-clés : audio-avatar LLM, mouvements faciaux expressifs, architecture LoRA

Avatar vidéoPhase B
▶ Architecture : 8B paramètres + 0,16B LoRA

A²-LLM est un LLM audio-avatar end-to-end qui génère des mouvements faciaux émotionnellement riches au-delà du lip-sync, en couplant directement la génération textuelle et la synthèse faciale dans un seul modèle. L'architecture 8B + 0,16B LoRA permet une adaptation fine à différents styles expressifs sans réentraîner l'ensemble du modèle.

Mots-clés : streaming diffusion, Local-Future Sliding-Window Denoising, temps réel long-form

Avatar vidéoTemps réelPhase B
▶ Innovation : image unique + audio streaming → vidéo temps réel longue durée en 1 étape de diffusion

AvatarForcing est le papier académique le plus directement applicable à l'Axe 1 R&D (réduction de latence). Sa technique de « Local-Future Sliding-Window Denoising » permet de générer des vidéos d'avatar parlant en diffusion 1-step streaming — réduisant drastiquement le nombre d'itérations de dénoising (de 20–50 steps à 1 step), ce qui divise le temps de génération de 60 à 90 %.

Architecture : MoE 276B/12B actifs, dMel tokenization audio native, modèle dual Fast/Slow

Phase B
▶ Statut : Preview liste d'attente, mai 2026 — pas d'API publique

TML Interaction-Small est un modèle MoE à 276B paramètres totaux avec seulement 12B actifs par inférence. Il intègre une tokenisation audio native dMel et une architecture duale : le Fast Model (chunks 200ms) gère le temps réel conversationnel tandis que le Slow Model (asynchrone) réalise les appels d'outils, le RAG et le raisonnement profond. Proactivité visuelle et conscience temporelle absolue. Limitation connue : cohérence se dégradant après ~30–45 minutes.

Mots-clés : full-duplex, RAG asynchrone, Moshi, mémoire enrichie

MémoireTemps réelPhase B
▶ Latence cible : 160–260ms + enrichissement contextuel

MoshiRAG est une extension de Moshi (Kyutai) intégrant RAG asynchrone et mémoire enrichie dans un modèle full-duplex. L'architecture cible est exactement la Phase C de GamiWays : full-duplex + RAG/retrieval/raisonnement en parallèle, sans bloquer le flux audio. Le Core Engine GamiWays est architecturalement cette couche d'orchestration.

Mots-clés : cascade duplex, pipeline conversationnel, latence réduite, streaming

Phase BTemps réel

DuplexCascade propose une architecture de pipeline conversationnel en cascade duplex, permettant de réduire la latence perçue en démarrant chaque étape (TTS, génération avatar) dès les premiers tokens de l'étape précédente, sans attendre la complétion. C'est la formalisation académique de l'approche « streaming pipeline » que GamiWays cible pour Phase A+ (gain estimé : −40 % de latence totale).

Mots-clés : trilemme temps réel / synchronisation / émotion, 3DMM, GAN single-pass, 55+ FPS

Avatar vidéoTemps réel
▶ Innovation : premier framework à résoudre simultanément les 3 contraintes — 55+ FPS, sync labiale, fidélité émotionnelle sans étiquettes

RETA est le premier framework à résoudre simultanément le trilemme fondamental : performance temps réel, précision de synchronisation labiale, et fidélité émotionnelle. Il disentangle le signal audio en deux représentations : une géométrie 3DMM pour la synchronisation des lèvres, et un embedding émotionnel dynamique appris sans étiquettes via distillation cross-modale. Un générateur GAN à passage unique intègre ces représentations hiérarchiquement. 55+ FPS avec nouveau SOTA sur toutes les métriques.

Mots-clés : Local-Future Sliding-Window, 1,3B paramètres, 34 ms/frame, distillation 2 étapes

Avatar vidéoTemps réel
▶ Innovation : 34 ms/frame (≈29 FPS), 1,3B paramètres — architecture la plus légère et la plus actionnable pour production

AvatarForcing résout le biais d'exposition des modèles autoregressifs via une fenêtre glissante avec débruitages hétérogènes (Local-Future Sliding Window). Un double ancrage temporel — style anchor (re-indexation RoPE) et temporal anchor (réutilisation de blocs propres récents) — stabilise le flux sur des durées illimitées. Le modèle étudiant (1,3B paramètres) atteint 34 ms/frame tout en maintenant forte qualité visuelle sur un benchmark de 400 vidéos longue durée.

Mots-clés : diffusion forcing, réactivité non-verbale, DPO synthétique, 500ms latence, 6,8x accélération

Avatar vidéoTemps réel
▶ Innovation : avatar réactif aux signaux non-verbaux de l'interlocuteur en temps réel — préféré dans 80% des évaluations humaines

Avatar Forcing modélise les interactions utilisateur-avatar à travers le diffusion forcing, permettant à l'avatar de traiter en temps réel les entrées multimodales de l'utilisateur (audio, mouvement de tête, expressions) avec une latence d'environ 500 ms. Une méthode de direct preference optimization avec échantillons perdants synthétiques permet un apprentissage expressif sans annotations supplémentaires. Accélération de 6,8x vs baseline.

Mots-clés : write–manage–read, mémoire épisodique, gouvernance, évaluation multi-session

MémoireÉvaluationGouvernancePhase B
▶ Cadre : écrire, gérer et rappeler la mémoire sous contraintes de latence, de qualité et de gouvernance

Cette synthèse 2026 organise la mémoire agentique autour d’une boucle write–manage–read, des mémoires de travail, épisodique, sémantique et procédurale, et d’évaluations multi-sessions. Elle met au premier plan le filtrage à l’écriture, les contradictions et l’oubli contrôlé.

Mots-clés : streaming diffusion, écoute active, gestes, cohérence long-terme

Avatar vidéoTemps réelPhase B
▶ Piste : parole, écoute et gestes sont traités ensemble dans un avatar interactif en streaming

StreamAvatar adapte un modèle de diffusion vidéo vers la génération interactive en streaming. Le travail cible explicitement les comportements de parole et d’écoute, la gestuelle et la cohérence sur la durée — au-delà du lip-sync ou du visage isolé.

Mots-clés : voix contrôlable, design vocal en langage naturel, clonage de style, multilingue

Voix expressiveÉvaluationPhase B
▶ Capacités : design de voix, clonage contrôlable et continuation dans un même modèle

VoxCPM2 est un rapport technique sur un modèle vocal open source qui réunit synthèse multilingue, design vocal par description, clonage avec instruction de style et continuation. Il illustre le déplacement de l’enjeu : produire une voix ne suffit pas, il faut pouvoir piloter comment elle parle.

Très haute

Mots-clés : STM / LTM / Knowledge layers, agents IA personnalisés

MémoirePhase B
▶ Résultat clé : +37,6 % de précision vs baseline, architecture 3 couches

MemoryOS propose un « système d'exploitation » de la mémoire pour agents IA personnalisés, organisé en trois couches distinctes : mémoire de travail à court terme, mémoire épisodique à long terme, et base de connaissances structurée. Les gains de précision (+37,6 % vs baseline) valident expérimentalement que la stratification de la mémoire est supérieure à une fenêtre de contexte plate.

Mots-clés : mémoire persistante, réduction tokens, agents conversationnels

MémoirePhase B
▶ Résultats clés : +26 % précision, −91 % latence p95, −90 % tokens vs full-context ; 90 000+ développeurs, 48 000+ GitHub stars

Mem0 est une bibliothèque open-source de mémoire persistante structurée pour agents IA. Son mécanisme repose sur l'extraction automatique à chaque tour de conversation des faits saillants (préférences, événements, contexte), suivie d'une consolidation intelligente sans duplication et d'une récupération ciblée — seuls les souvenirs pertinents sont injectés dans le prompt à chaque échange.

Mots-clés : graphe de connaissances temporel, mémoire enterprise, LongMemEval

MémoirePhase B
▶ Résultats clés : +18,5 % précision, −90 % latence vs baseline sur LongMemEval ; surpasse MemGPT (94,8 % vs 93,4 %)

Zep implémente Graphiti, un graphe de connaissances temporellement conscient où chaque fait est horodaté et peut évoluer dans le temps. Le système intègre à la fois des données conversationnelles non structurées et des données métier structurées dans un même graphe relationnel — permettant des requêtes temporelles comme « qu'est-ce qui s'était passé avant la session 3 ? » ou « comment a évolué la compréhension de l'apprenant sur ce concept ? ».

Mots-clés : full-duplex, multilingue EN/FR, souveraineté EU, RGPD by design

Phase BTemps réel
▶ Financement : €60M (déc. 2025) — Latence : P50 ~258ms publiée — API accès limité mai 2026

Gradium est un spin-off de Kyutai optimisé pour la production : architecture dérivée de Moshi avec codec Mimi neural streamé et deux flux audio parallèles. Focus multilingue EN/FR dès le départ, hébergement EU, conformité RGPD by design — « The voice infrastructure company for Europe ». API en accès limité en mai 2026, WER français non encore publié officiellement.

Mots-clés : pipeline unifié texte→avatar, diffusion transformer double branche, zéro-shot 25 FPS

Avatar vidéoTemps réel
▶ Innovation : premier pipeline unifié bout-en-bout texte → parole + vidéo simultanés en zéro-shot temps réel

OmniTalker est le premier framework unifié bout-en-bout qui génère simultanément la parole et la vidéo de tête parlante à partir d'un texte et d'une vidéo de référence, en inférence zéro-shot en temps réel (25 FPS). Architecture diffusion transformer à double branche : branche audio synthétise les mel-spectrogrammes depuis le texte, branche visuelle prédit poses et dynamique faciale. Module de fusion audio-visuelle assure synchronisation et cohérence stylistique.

D16
Confiance Épistémique dans les Avatars Pédagogiques (IJLD, juin 2025)
Int. J. Learning and Development, vol. 15, n°2 — DOI:10.5296/ijld.v15i2.22988doi.org
Très haute

Mots-clés : confiance épistémique, identité apprenante, compétence/bienveillance/intégrité perçues

Avatar vidéo
▶ Résultat clé : la confiance épistémique est le médiateur central de l'efficacité pédagogique des avatars

Revue intégrative de construction théorique synthétisant la littérature sur la confiance épistémique, la formation de l'identité apprenante et la préparation organisationnelle dans les contextes d'instruction médiée par avatar dans l'enseignement supérieur. Développe un framework articulant comment les avatars IA influencent l'engagement des apprenants et reconfigurent la formation de l'identité numérique. La confiance épistémique — croyance que l'avatar est une source fiable — est identifiée comme médiateur central.

Mots-clés : talking head photorealistic, expressions nuancées, temps réel

Avatar vidéoTemps réelPhase B
▶ Résultats clés : 40 FPS online, résolution 512×512, visages parlants avec expressions faciales riches depuis une image unique

VASA-1 démontre qu'il est possible de générer des visages parlants photoréalistes à 40 FPS en temps réel depuis une image unique, avec des expressions émotionnelles nuancées allant bien au-delà du simple lip-sync. Non commercialisé à ce stade (risque de non-publication complète), ce travail établit un benchmark qualité de référence pour les avatars expressifs.

Mots-clés : TTS zero-shot, encodeur de style, prosodie individuelle, speech spontané

Voix expressivePhase B

PerTTS propose un système de synthèse vocale zero-shot personnalisé et contrôlable : un encodeur de style de parole capture l'empreinte prosodique individuelle (rythme, intonation, patterns spontanés) depuis quelques échantillons audio, et un encodeur de prosodie locale contrôle les variations phrase par phrase. L'approche ne nécessite pas de fine-tuning complet — quelques minutes d'audio suffisent.

Très haute

Mots-clés : espace latent facial disentanglé, génération 512×512 @ 40 FPS, latence négligeable

Avatar vidéoTemps réel
▶ Innovation : image statique unique + audio → vidéo 40 FPS, mouvements lèvres/expressions/regard indépendants

VASA-1 génère des avatars parlants à partir d'une seule image statique et d'un clip audio. L'espace latent facial disentanglé traite mouvements des lèvres, expressions, regard et mouvements de tête comme des variables indépendantes. Le modèle de diffusion opère dans cet espace latent, permettant une génération en ligne de vidéos 512×512 pixels à 40 FPS. Microsoft n'a pas rendu ce modèle public, reconnaissant que le système ne doit pas être utilisé pour induire en erreur.

Mots-clés : mémoire agentique, knowledge graph temporel, agents conversationnels

MémoirePhase B

Ce papier propose une architecture de mémoire agentique basée sur des graphes de connaissances temporels, où chaque nœud du graphe représente un fait mémorisé avec son timestamp, ses relations avec d'autres faits, et sa probabilité d'obsolescence. L'approche permet des requêtes temporelles sur l'évolution de l'état cognitif d'un utilisateur — crucial pour les scénarios de suivi pédagogique long terme.

Mots-clés : diffusion audio-driven, streaming long-form, coût GPU, open source

Avatar vidéoTemps réelPhase B
▶ Résultat annoncé : 45 FPS sur infrastructure multi-H800 ; les dépendances matérielles restent structurantes

LiveAvatar associe algorithme et système pour des séquences audio-driven continues. Le dépôt documente une accélération importante, mais aussi une dépendance à une infrastructure GPU lourde et une intégration TTS encore annoncée comme étape suivante.

Mots-clés : RAG, mémoire vector DB, LLM conversationnels, survey

MémoireÉvaluationPhase B

Revue systématique des architectures mémoire basées sur la récupération augmentée (RAG) pour les LLM conversationnels. L'article synthétise les approches vector database, compare les stratégies de chunking et d'indexation, et évalue les compromis entre latence de récupération et précision contextuelle.

Mots-clés : RAG, mémoire long-terme, agents agentiques, reinforcement learning

MémoirePhase B

Ce papier documente la transition des architectures RAG statiques vers des systèmes de mémoire long-terme agentiques, où l'agent apprend à gérer sa propre mémoire via du reinforcement learning. L'approche permet une sélection active des souvenirs à conserver ou oublier, plutôt qu'une simple compression mécanique.

Mots-clés : humain numérique complet, avatar 3D, parole expressive, dialogue grounded

Avatar vidéoPhase B

Hi-Reco propose une approche intégrée rare : un humain numérique complet combinant avatar 3D, parole expressive et dialogue grounded dans une architecture unifiée. Contrairement aux pipelines modulaires (TTS + avatar séparés), l'approche bout-en-bout garantit la cohérence entre expression vocale et expression faciale.

Mots-clés : talking head synthesis, survey complet, trilemme temps réel / expressivité / qualité

Avatar vidéoTemps réelÉvaluationPhase B

Revue exhaustive des techniques de synthèse talking head publiée dans ACM Computing Surveys (2025). L'article documente formellement le trilemme fondamental : aucune solution actuelle ne satisfait simultanément les trois contraintes — temps réel (<500ms), expressivité émotionnelle riche, et qualité photoréaliste. Ce trilemme structure l'espace de recherche et positionne GamiWays comme un contributeur potentiel.

Mots-clés : TTS, contrôle de style complexe, benchmark, évaluation 11Labs / Deepgram / OpenAI

Voix expressiveÉvaluationPhase B

EmergentTTS-Eval est un benchmark NeurIPS 2025 pour évaluer le contrôle de style complexe dans la synthèse vocale. Il évalue 11 dimensions expressives (émotion, intensité, rythme, caractère) sur les principaux TTS du marché (ElevenLabs, Deepgram, OpenAI 4o-mini-TTS) et établit des métriques comparatives reproductibles.

Mots-clés : modèle speech multimodal, prosodie contextuelle, backchannels naturels, RVQ

Voix expressivePhase B
▶ Licence : Apache 2.0 — 1B paramètres — auto-hébergement sur GPU (A100 recommandé)

Sesame CSM est un modèle multimodal de speech conversationnel conçu pour « franchir la vallée de l'étrange de la voix conversationnelle » : il génère des codes audio RVQ à partir de texte et d'entrées audio, avec une prosodie contextuelle, des backchannels naturels (« mm-hm », « oui ») et un comportement de prise de tour humain. Non optimisé pour le streaming en production mais référence de recherche de haute qualité.

Mots-clés : tandem architecture, mémoire agentique, knowledge graph, RAG temps réel

MémoireTemps réelPhase B

L'architecture KAME Tandem combine un graphe de connaissances dynamique avec une mémoire agentique en temps réel. Son approche « tandem » couple deux composants complémentaires : un module de récupération rapide pour les faits immédiats, et un module de raisonnement profond pour les relations sémantiques complexes. C'est le Slow component de l'architecture MoshiRAG dans la taxonomie GamiWays.

Mots-clés : Timestep-forcing Pipeline Parallelism, Rolling Sink Frame, dérive d'identité, 14B paramètres

Avatar vidéoTemps réel
▶ Innovation : 20 FPS end-to-end sur 5 GPUs H800, élimination de la dérive d'identité sur longues séquences

Live Avatar résout le goulot d'étranglement de la génération vidéo par diffusion pour les applications temps réel. Le Timestep-forcing Pipeline Parallelism (TPP) pipeline les étapes de débruitage sur plusieurs GPUs. Le Rolling Sink Frame Mechanism (RSFM) recalibre l'apparence depuis une image de référence cachée, éliminant la dérive d'identité sur les longues séquences. 20 FPS end-to-end sur 5 GPUs H800 avec 14B paramètres.

Mots-clés : Anchor-Heavy Identity Sinks, 20x réduction coût d'inférence, multi-tours, surpasse Sora2/Veo3

Avatar vidéoTemps réel
▶ Résultat clé : surpasse Sora2 et Veo3 en cohérence vidéo multi-tours, latence de 1-2 min → temps réel

LiveTalk combine un modèle de diffusion vidéo conditionné sur texte, image et audio avec des modèles de langage audio. Technique Anchor-Heavy Identity Sinks pour l'inférence longue durée. Le modèle distillé atteint une qualité comparable aux baselines bidirectionnelles avec 20x moins de coût d'inférence. En évaluation multi-tours, LiveTalk surpasse Sora2 et Veo3 en cohérence vidéo, ramenant la latence de 1-2 minutes à temps réel.

Mots-clés : survey exhaustif, GANs→diffusion transformers, benchmarks HDTF/VFHQ/LRS3, diversité ethnique

Avatar vidéoÉvaluation

Revue systématique couvrant l'évolution des techniques de génération de têtes parlantes depuis les GANs (Wav2Lip, SadTalker) jusqu'aux diffusion transformers récents. Cartographie les benchmarks standards (HDTF, VFHQ, LRS3), les métriques d'évaluation (FID, FVD, SyncNet, PSNR), et les trade-offs architecturaux. Identifie quatre axes d'amélioration prioritaires : identité sur longues séquences, expressivité au-delà des lèvres, diversité ethnique et culturelle, vitesse d'inférence sur hardware contraint.

D12
Fidélité Visuelle, Présence et Réponses Physiologiques (CHB, 2025)
Computers in Human Behavior — DOI:10.1016/j.chb.2025.108596doi.org
Haute

Mots-clés : HRV/EEG, stress sympathique, trilemme présence-anonymat, fidélité visuelle faible/moyenne/haute

Avatar vidéo
▶ Résultat clé : avatars haute fidélité → stress sympathique plus élevé lors de conversations sensibles

Étude expérimentale mesurant les réponses physiologiques (HRV, EEG) et psychologiques (stress perçu) de participants interagissant avec des avatars de fidélité visuelle faible, moyenne et haute. Les avatars haute fidélité génèrent un ratio LF/HF significativement plus élevé (stress sympathique) que les avatars basse fidélité, particulièrement lors de conversations sensibles. Confirme le trilemme présence-anonymat.

Mots-clés : interaction parasociale, attachement numérique, dépendance émotionnelle, design éthique

Avatar vidéoGouvernance

Revue systématique de deux décennies de recherche proposant un modèle théorique de l'évolution des relations émotionnelles humain-IA : de l'interaction parasociale (investissement émotionnel unilatéral) vers l'attachement numérique. Déterminants identifiés : personnalisation de l'IA, continuité mémorielle, réactivité émotionnelle perçue, anthropomorphisation. Risques de dépendance et critères de design éthique proposés.

D14
Pseudo-intimité Émotionnelle et IA (Frontiers in Psychology, sept. 2025)
Frontiers in Psychology — DOI:10.3389/fpsyg.2025.1679324doi.org
Haute

Mots-clés : pseudo-intimité, IA affective, biais d'anthropomorphisation, transparence, consentement éclairé

Avatar vidéo

Explore le risque de pseudo-intimité avec les IA affectives : les IA émotionnelles créent des relations qui imitent l'intimité sans les conditions de réciprocité, vulnérabilité partagée et histoire commune qui fondent les relations humaines authentiques. Analyse les mécanismes cognitifs (biais d'anthropomorphisation, renforcement affectif par réactivité simulée) et propose un cadre d'éthique du design affectif fondé sur transparence, limitation délibérée de l'expressivité, et consentement éclairé.

D15
Avatars dans le Métaverse Éducatif — Revue Systématique (PMC, juin 2025)
Visual Computing for Industry, Biomedicine, and Art — DOI:10.1186/s42492-025-00196-9doi.org
Haute

Mots-clés : avatars éducatifs, métaverse, NLP génératif, sécurité des données, biais algorithmiques

Avatar vidéoGouvernance

Revue systématique évaluant la contribution des avatars à l'apprentissage dans les environnements virtuels immersifs. Documente que les avatars permettent des expériences individualisées et des activités collaboratives améliorées, et que les avancées en NLP et modèles génératifs ont significativement amélioré leurs capacités. Identifie les obstacles majeurs : sécurité des données, préoccupations éthiques (biais algorithmiques, confidentialité), et infrastructure limitée.

Mots-clés : biais ethniques, dataset DH-FaceVid-1K, généralisation multilingue, équité algorithmique, représentation culturelle

Avatar vidéoGouvernance
▶ Lacune documentée : les modèles actuels de génération d'avatars sont biaisés vers les ethnies européennes et américaines — performances dégradées pour les utilisateurs non-européens

Ce Grand Challenge de l'ACM cible directement la lacune majeure des modèles de génération de têtes parlantes : leur pauvre généralisation sur les ethnies non-européennes et non-américaines. Le dataset DH-FaceVid-1K est introduit pour pallier ce manque. Les participants doivent développer des modèles intégrant les techniques diffusion et GAN pour améliorer la synchronisation labiale, la cohérence d'identité et la vitesse d'inférence sur des données multilingues et multi-ethniques. Ce challenge révèle que les benchmarks standards (HDTF, VFHQ) sont massivement biaisés vers des visages caucasiens anglophones.

Mots-clés : benchmark mémoire long-terme, assistants LLM, évaluation systématique

MémoireÉvaluationPhase B

Ce benchmark établit un cadre d'évaluation systématique des capacités mémoire long-terme des assistants LLM, couvrant la rétention de faits, la cohérence temporelle et la personnalisation progressive. Il documente les limites actuelles des approches naïves (contexte plein, truncation) et ouvre la voie vers des assistants réellement personnalisés sur le long terme.

Mots-clés : compression de contexte, inférence LLM, sessions longues, 128K tokens

MémoirePhase B

Cette recherche propose une compression de contexte stateful permettant de maintenir une fenêtre d'attention de 128K tokens sans dégradation perceptible de la qualité. Contrairement à la truncation brutale, l'approche stateful conserve une représentation compressée de l'historique — particulièrement applicable aux sessions conversationnelles longues (1h+).

Mots-clés : propriété du jumeau numérique, autonomie des données, contrat social renouvelé, droits post-mortem

Avatar vidéoGouvernance

Argumente que les personnes physiques doivent être reconnues comme propriétaires moraux et légaux de leurs jumeaux numériques IA, car ces entités sont des extensions intimes de l'individu construites depuis leurs données personnelles. Les cadres légaux actuels, qui privilégient l'infrastructure technologique sur l'autonomie des données, sont critiqués comme perpétuant des inadéquations systémiques. Propose un contrat social renouvelé centré sur la dominion individuelle et le consentement.

D11
La Vallée de l'Étrange Audio-Visuelle (ACM CHI 2022)
ACM CHI 2022 — DOI:10.1145/3491102.3517564dl.acm.org
Haute

Mots-clés : vallée de l'étrange vocale, TTS neural vs voix humaine, confiance, genre du locuteur/auditeur

Avatar vidéo
▶ Résultat clé : TTS neural → significativement moins digne de confiance que voix humaine réelle — effet modulé par le genre

Cette étude ACM CHI démontre qu'une nouvelle dimension de la vallée de l'étrange émerge dans le domaine vocal : un humain virtuel utilisant une synthèse vocale neurale (TTS neural) est perçu comme significativement moins digne de confiance qu'un humain virtuel utilisant une voix humaine réelle. L'effet est modulé par le genre du locuteur et de l'auditeur. L'étude étend le concept classique de Mori (1970) de la morphologie visuelle à la fidélité acoustique.

Mots-clés : Audio-Pose Prior Refocusing, couplage rythme-geste, attention croisée bidirectionnelle

Avatar vidéo

ApoAvatar introduit un mécanisme d'Audio-Pose Prior Refocusing qui lie le style de parole à la dynamique de mouvement : les accents forts amplifient l'amplitude des gestes, les passages silencieux suppriment les mouvements superflus. Un module d'interaction audio-vidéo frame-wise met à jour les features audio avec le contexte visuel courant via attention croisée bidirectionnelle. Gains clairs sur synchronisation labiale, expressivité des gestes et naturalité globale.

Mots-clés : gestes des mains synchronisés au discours, poses audio-driven, authenticité perçue

Avatar vidéo

EMO2 étend la génération d'avatars audio-driven au-delà du visage pour inclure les gestes des mains synchronisés au discours. Processus en deux étapes : génération des poses des mains directement depuis l'audio (forte corrélation audio-gestes), puis modèle de diffusion synthétisant les frames vidéo en intégrant ces poses. Surpasse CyberHost et Vlogger sur qualité visuelle et précision de synchronisation.

Mots-clés : EU AI Act Art. 50(2), étiquetage obligatoire, 35M€ pénalités, droits humains, reconnaissance émotionnelle interdite

Avatar vidéoGouvernance
▶ Obligation légale dès août 2026 : tout avatar vidéo généré doit être étiqueté comme contenu IA de manière claire et visible

Analyse comment l'EU AI Act (adopté 2024, entrée en vigueur complète août 2026) établit un cadre centré sur les droits pour réguler les médias synthétiques. L'Article 50(2) exige que les outputs génératifs incluant des deepfakes soient clairement et visiblement étiquetés. Pénalités : jusqu'à 35 M€ ou 7% du CA mondial. La reconnaissance émotionnelle dans les lieux d'éducation est explicitement interdite par l'Article 5 depuis février 2025.

Mots-clés : empreinte carbone inférence IA, 0,24 Wh/requête Gemini, génération vidéo 10–100× plus coûteuse, IDC 23 TWh

Avatar vidéoÉvaluationGouvernance
▶ Donnée clé : une requête Gemini médiane = 0,24 Wh / 0,03 g CO₂ ; grands modèles open-source (70B) = jusqu'à 1,7 Wh/requête

L'analyse de MIT Technology Review évalue l'empreinte énergétique de l'IA à l'échelle du secteur : IDC estime que les data centers IA consommaient 23 TWh en 2022. Google publie en 2025 une méthodologie de mesure de l'impact environnemental de l'inférence IA : une requête médiane Gemini consomme 0,24 Wh d'énergie et émet 0,03 g de CO₂. Les grands modèles open-source (70B paramètres) consomment jusqu'à 1,7 Wh par requête. La génération vidéo est significativement plus coûteuse que la génération texte — probablement 10 à 100 fois plus énergivore pour un streaming d'avatar en temps réel.

Consulter le classement détaillé par domaine

Cette vue conserve l’organisation historique du corpus. Utilisez d’abord les filtres ci-dessus pour isoler une décision, puis revenez ici si vous souhaitez lire les références selon leur domaine académique d’origine.

Domaine A — Mémoire Conversationnelle

7 publications couvrant la stratification de la mémoire, la compression de contexte, les architectures RAG et les graphes de connaissances temporels. Directement applicable à l'hypothèse H2 du Core Engine.

Très haute

Mots-clés : STM / LTM / Knowledge layers, agents IA personnalisés

▶ Résultat clé : +37,6 % de précision vs baseline, architecture 3 couches

MemoryOS propose un « système d'exploitation » de la mémoire pour agents IA personnalisés, organisé en trois couches distinctes : mémoire de travail à court terme, mémoire épisodique à long terme, et base de connaissances structurée. Les gains de précision (+37,6 % vs baseline) valident expérimentalement que la stratification de la mémoire est supérieure à une fenêtre de contexte plate.

Mots-clés : mémoire persistante, réduction tokens, agents conversationnels

▶ Résultats clés : +26 % précision, −91 % latence p95, −90 % tokens vs full-context ; 90 000+ développeurs, 48 000+ GitHub stars

Mem0 est une bibliothèque open-source de mémoire persistante structurée pour agents IA. Son mécanisme repose sur l'extraction automatique à chaque tour de conversation des faits saillants (préférences, événements, contexte), suivie d'une consolidation intelligente sans duplication et d'une récupération ciblée — seuls les souvenirs pertinents sont injectés dans le prompt à chaque échange.

Mots-clés : benchmark mémoire long-terme, assistants LLM, évaluation systématique

Ce benchmark établit un cadre d'évaluation systématique des capacités mémoire long-terme des assistants LLM, couvrant la rétention de faits, la cohérence temporelle et la personnalisation progressive. Il documente les limites actuelles des approches naïves (contexte plein, truncation) et ouvre la voie vers des assistants réellement personnalisés sur le long terme.

Mots-clés : compression de contexte, inférence LLM, sessions longues, 128K tokens

Cette recherche propose une compression de contexte stateful permettant de maintenir une fenêtre d'attention de 128K tokens sans dégradation perceptible de la qualité. Contrairement à la truncation brutale, l'approche stateful conserve une représentation compressée de l'historique — particulièrement applicable aux sessions conversationnelles longues (1h+).

Mots-clés : RAG, mémoire vector DB, LLM conversationnels, survey

Revue systématique des architectures mémoire basées sur la récupération augmentée (RAG) pour les LLM conversationnels. L'article synthétise les approches vector database, compare les stratégies de chunking et d'indexation, et évalue les compromis entre latence de récupération et précision contextuelle.

Mots-clés : RAG, mémoire long-terme, agents agentiques, reinforcement learning

Ce papier documente la transition des architectures RAG statiques vers des systèmes de mémoire long-terme agentiques, où l'agent apprend à gérer sa propre mémoire via du reinforcement learning. L'approche permet une sélection active des souvenirs à conserver ou oublier, plutôt qu'une simple compression mécanique.

Mots-clés : graphe de connaissances temporel, mémoire enterprise, LongMemEval

▶ Résultats clés : +18,5 % précision, −90 % latence vs baseline sur LongMemEval ; surpasse MemGPT (94,8 % vs 93,4 %)

Zep implémente Graphiti, un graphe de connaissances temporellement conscient où chaque fait est horodaté et peut évoluer dans le temps. Le système intègre à la fois des données conversationnelles non structurées et des données métier structurées dans un même graphe relationnel — permettant des requêtes temporelles comme « qu'est-ce qui s'était passé avant la session 3 ? » ou « comment a évolué la compréhension de l'apprenant sur ce concept ? ».

Domaine B — Avatar & Synthèse Vocale

8 publications couvrant les avatars photoréalistes, la synthèse vocale personnalisée, les benchmarks TTS et les modèles speech multimodaux. Directement applicable aux axes 1, 2a et 3 R&D.

Mots-clés : talking head photorealistic, expressions nuancées, temps réel

▶ Résultats clés : 40 FPS online, résolution 512×512, visages parlants avec expressions faciales riches depuis une image unique

VASA-1 démontre qu'il est possible de générer des visages parlants photoréalistes à 40 FPS en temps réel depuis une image unique, avec des expressions émotionnelles nuancées allant bien au-delà du simple lip-sync. Non commercialisé à ce stade (risque de non-publication complète), ce travail établit un benchmark qualité de référence pour les avatars expressifs.

Mots-clés : audio-avatar LLM, mouvements faciaux expressifs, architecture LoRA

▶ Architecture : 8B paramètres + 0,16B LoRA

A²-LLM est un LLM audio-avatar end-to-end qui génère des mouvements faciaux émotionnellement riches au-delà du lip-sync, en couplant directement la génération textuelle et la synthèse faciale dans un seul modèle. L'architecture 8B + 0,16B LoRA permet une adaptation fine à différents styles expressifs sans réentraîner l'ensemble du modèle.

Mots-clés : humain numérique complet, avatar 3D, parole expressive, dialogue grounded

Hi-Reco propose une approche intégrée rare : un humain numérique complet combinant avatar 3D, parole expressive et dialogue grounded dans une architecture unifiée. Contrairement aux pipelines modulaires (TTS + avatar séparés), l'approche bout-en-bout garantit la cohérence entre expression vocale et expression faciale.

Mots-clés : talking head synthesis, survey complet, trilemme temps réel / expressivité / qualité

Revue exhaustive des techniques de synthèse talking head publiée dans ACM Computing Surveys (2025). L'article documente formellement le trilemme fondamental : aucune solution actuelle ne satisfait simultanément les trois contraintes — temps réel (<500ms), expressivité émotionnelle riche, et qualité photoréaliste. Ce trilemme structure l'espace de recherche et positionne GamiWays comme un contributeur potentiel.

Mots-clés : streaming diffusion, Local-Future Sliding-Window Denoising, temps réel long-form

▶ Innovation : image unique + audio streaming → vidéo temps réel longue durée en 1 étape de diffusion

AvatarForcing est le papier académique le plus directement applicable à l'Axe 1 R&D (réduction de latence). Sa technique de « Local-Future Sliding-Window Denoising » permet de générer des vidéos d'avatar parlant en diffusion 1-step streaming — réduisant drastiquement le nombre d'itérations de dénoising (de 20–50 steps à 1 step), ce qui divise le temps de génération de 60 à 90 %.

Mots-clés : TTS, contrôle de style complexe, benchmark, évaluation 11Labs / Deepgram / OpenAI

EmergentTTS-Eval est un benchmark NeurIPS 2025 pour évaluer le contrôle de style complexe dans la synthèse vocale. Il évalue 11 dimensions expressives (émotion, intensité, rythme, caractère) sur les principaux TTS du marché (ElevenLabs, Deepgram, OpenAI 4o-mini-TTS) et établit des métriques comparatives reproductibles.

Mots-clés : TTS zero-shot, encodeur de style, prosodie individuelle, speech spontané

PerTTS propose un système de synthèse vocale zero-shot personnalisé et contrôlable : un encodeur de style de parole capture l'empreinte prosodique individuelle (rythme, intonation, patterns spontanés) depuis quelques échantillons audio, et un encodeur de prosodie locale contrôle les variations phrase par phrase. L'approche ne nécessite pas de fine-tuning complet — quelques minutes d'audio suffisent.

Mots-clés : modèle speech multimodal, prosodie contextuelle, backchannels naturels, RVQ

▶ Licence : Apache 2.0 — 1B paramètres — auto-hébergement sur GPU (A100 recommandé)

Sesame CSM est un modèle multimodal de speech conversationnel conçu pour « franchir la vallée de l'étrange de la voix conversationnelle » : il génère des codes audio RVQ à partir de texte et d'entrées audio, avec une prosodie contextuelle, des backchannels naturels (« mm-hm », « oui ») et un comportement de prise de tour humain. Non optimisé pour le streaming en production mais référence de recherche de haute qualité.

Perspectives Futures 2026–2028 — Architecture Full-Duplex & Mémoire Agentique

6 travaux récents (2025–2026) documentant les modèles d'interaction full-duplex, les architectures mémoire agentique et les solutions de souveraineté européenne. Ces travaux informent les choix architecturaux Phase B/C de GamiWays.

Architecture : MoE 276B/12B actifs, dMel tokenization audio native, modèle dual Fast/Slow

▶ Statut : Preview liste d'attente, mai 2026 — pas d'API publique

TML Interaction-Small est un modèle MoE à 276B paramètres totaux avec seulement 12B actifs par inférence. Il intègre une tokenisation audio native dMel et une architecture duale : le Fast Model (chunks 200ms) gère le temps réel conversationnel tandis que le Slow Model (asynchrone) réalise les appels d'outils, le RAG et le raisonnement profond. Proactivité visuelle et conscience temporelle absolue. Limitation connue : cohérence se dégradant après ~30–45 minutes.

Mots-clés : full-duplex, RAG asynchrone, Moshi, mémoire enrichie

▶ Latence cible : 160–260ms + enrichissement contextuel

MoshiRAG est une extension de Moshi (Kyutai) intégrant RAG asynchrone et mémoire enrichie dans un modèle full-duplex. L'architecture cible est exactement la Phase C de GamiWays : full-duplex + RAG/retrieval/raisonnement en parallèle, sans bloquer le flux audio. Le Core Engine GamiWays est architecturalement cette couche d'orchestration.

Mots-clés : tandem architecture, mémoire agentique, knowledge graph, RAG temps réel

L'architecture KAME Tandem combine un graphe de connaissances dynamique avec une mémoire agentique en temps réel. Son approche « tandem » couple deux composants complémentaires : un module de récupération rapide pour les faits immédiats, et un module de raisonnement profond pour les relations sémantiques complexes. C'est le Slow component de l'architecture MoshiRAG dans la taxonomie GamiWays.

Mots-clés : cascade duplex, pipeline conversationnel, latence réduite, streaming

DuplexCascade propose une architecture de pipeline conversationnel en cascade duplex, permettant de réduire la latence perçue en démarrant chaque étape (TTS, génération avatar) dès les premiers tokens de l'étape précédente, sans attendre la complétion. C'est la formalisation académique de l'approche « streaming pipeline » que GamiWays cible pour Phase A+ (gain estimé : −40 % de latence totale).

Mots-clés : mémoire agentique, knowledge graph temporel, agents conversationnels

Ce papier propose une architecture de mémoire agentique basée sur des graphes de connaissances temporels, où chaque nœud du graphe représente un fait mémorisé avec son timestamp, ses relations avec d'autres faits, et sa probabilité d'obsolescence. L'approche permet des requêtes temporelles sur l'évolution de l'état cognitif d'un utilisateur — crucial pour les scénarios de suivi pédagogique long terme.

Mots-clés : full-duplex, multilingue EN/FR, souveraineté EU, RGPD by design

▶ Financement : €60M (déc. 2025) — Latence : P50 ~258ms publiée — API accès limité mai 2026

Gradium est un spin-off de Kyutai optimisé pour la production : architecture dérivée de Moshi avec codec Mimi neural streamé et deux flux audio parallèles. Focus multilingue EN/FR dès le départ, hébergement EU, conformité RGPD by design — « The voice infrastructure company for Europe ». API en accès limité en mai 2026, WER français non encore publié officiellement.

Domaine D — Avatars Vidéo Streaming : Technique, Psychologie, Droit & Éthique

20 références couvrant 6 dimensions : fondements techniques (VASA-1, RETA, AvatarForcing), psychologie (vallée de l'étrange, attachement, confiance épistémique), implications sociales et pédagogiques, droit et régulation (EU AI Act, données biométriques, propriété des avatars), impact environnemental et durabilité, et perspectives critiques transversales (biais ethniques).

Partie I — Fondements Techniques
Très haute

Mots-clés : espace latent facial disentanglé, génération 512×512 @ 40 FPS, latence négligeable

▶ Innovation : image statique unique + audio → vidéo 40 FPS, mouvements lèvres/expressions/regard indépendants

VASA-1 génère des avatars parlants à partir d'une seule image statique et d'un clip audio. L'espace latent facial disentanglé traite mouvements des lèvres, expressions, regard et mouvements de tête comme des variables indépendantes. Le modèle de diffusion opère dans cet espace latent, permettant une génération en ligne de vidéos 512×512 pixels à 40 FPS. Microsoft n'a pas rendu ce modèle public, reconnaissant que le système ne doit pas être utilisé pour induire en erreur.

Mots-clés : trilemme temps réel / synchronisation / émotion, 3DMM, GAN single-pass, 55+ FPS

▶ Innovation : premier framework à résoudre simultanément les 3 contraintes — 55+ FPS, sync labiale, fidélité émotionnelle sans étiquettes

RETA est le premier framework à résoudre simultanément le trilemme fondamental : performance temps réel, précision de synchronisation labiale, et fidélité émotionnelle. Il disentangle le signal audio en deux représentations : une géométrie 3DMM pour la synchronisation des lèvres, et un embedding émotionnel dynamique appris sans étiquettes via distillation cross-modale. Un générateur GAN à passage unique intègre ces représentations hiérarchiquement. 55+ FPS avec nouveau SOTA sur toutes les métriques.

Mots-clés : Timestep-forcing Pipeline Parallelism, Rolling Sink Frame, dérive d'identité, 14B paramètres

▶ Innovation : 20 FPS end-to-end sur 5 GPUs H800, élimination de la dérive d'identité sur longues séquences

Live Avatar résout le goulot d'étranglement de la génération vidéo par diffusion pour les applications temps réel. Le Timestep-forcing Pipeline Parallelism (TPP) pipeline les étapes de débruitage sur plusieurs GPUs. Le Rolling Sink Frame Mechanism (RSFM) recalibre l'apparence depuis une image de référence cachée, éliminant la dérive d'identité sur les longues séquences. 20 FPS end-to-end sur 5 GPUs H800 avec 14B paramètres.

Mots-clés : Local-Future Sliding-Window, 1,3B paramètres, 34 ms/frame, distillation 2 étapes

▶ Innovation : 34 ms/frame (≈29 FPS), 1,3B paramètres — architecture la plus légère et la plus actionnable pour production

AvatarForcing résout le biais d'exposition des modèles autoregressifs via une fenêtre glissante avec débruitages hétérogènes (Local-Future Sliding Window). Un double ancrage temporel — style anchor (re-indexation RoPE) et temporal anchor (réutilisation de blocs propres récents) — stabilise le flux sur des durées illimitées. Le modèle étudiant (1,3B paramètres) atteint 34 ms/frame tout en maintenant forte qualité visuelle sur un benchmark de 400 vidéos longue durée.

Mots-clés : diffusion forcing, réactivité non-verbale, DPO synthétique, 500ms latence, 6,8x accélération

▶ Innovation : avatar réactif aux signaux non-verbaux de l'interlocuteur en temps réel — préféré dans 80% des évaluations humaines

Avatar Forcing modélise les interactions utilisateur-avatar à travers le diffusion forcing, permettant à l'avatar de traiter en temps réel les entrées multimodales de l'utilisateur (audio, mouvement de tête, expressions) avec une latence d'environ 500 ms. Une méthode de direct preference optimization avec échantillons perdants synthétiques permet un apprentissage expressif sans annotations supplémentaires. Accélération de 6,8x vs baseline.

Mots-clés : pipeline unifié texte→avatar, diffusion transformer double branche, zéro-shot 25 FPS

▶ Innovation : premier pipeline unifié bout-en-bout texte → parole + vidéo simultanés en zéro-shot temps réel

OmniTalker est le premier framework unifié bout-en-bout qui génère simultanément la parole et la vidéo de tête parlante à partir d'un texte et d'une vidéo de référence, en inférence zéro-shot en temps réel (25 FPS). Architecture diffusion transformer à double branche : branche audio synthétise les mel-spectrogrammes depuis le texte, branche visuelle prédit poses et dynamique faciale. Module de fusion audio-visuelle assure synchronisation et cohérence stylistique.

Mots-clés : gestes des mains synchronisés au discours, poses audio-driven, authenticité perçue

EMO2 étend la génération d'avatars audio-driven au-delà du visage pour inclure les gestes des mains synchronisés au discours. Processus en deux étapes : génération des poses des mains directement depuis l'audio (forte corrélation audio-gestes), puis modèle de diffusion synthétisant les frames vidéo en intégrant ces poses. Surpasse CyberHost et Vlogger sur qualité visuelle et précision de synchronisation.

Mots-clés : Audio-Pose Prior Refocusing, couplage rythme-geste, attention croisée bidirectionnelle

ApoAvatar introduit un mécanisme d'Audio-Pose Prior Refocusing qui lie le style de parole à la dynamique de mouvement : les accents forts amplifient l'amplitude des gestes, les passages silencieux suppriment les mouvements superflus. Un module d'interaction audio-vidéo frame-wise met à jour les features audio avec le contexte visuel courant via attention croisée bidirectionnelle. Gains clairs sur synchronisation labiale, expressivité des gestes et naturalité globale.

Mots-clés : Anchor-Heavy Identity Sinks, 20x réduction coût d'inférence, multi-tours, surpasse Sora2/Veo3

▶ Résultat clé : surpasse Sora2 et Veo3 en cohérence vidéo multi-tours, latence de 1-2 min → temps réel

LiveTalk combine un modèle de diffusion vidéo conditionné sur texte, image et audio avec des modèles de langage audio. Technique Anchor-Heavy Identity Sinks pour l'inférence longue durée. Le modèle distillé atteint une qualité comparable aux baselines bidirectionnelles avec 20x moins de coût d'inférence. En évaluation multi-tours, LiveTalk surpasse Sora2 et Veo3 en cohérence vidéo, ramenant la latence de 1-2 minutes à temps réel.

Mots-clés : survey exhaustif, GANs→diffusion transformers, benchmarks HDTF/VFHQ/LRS3, diversité ethnique

Revue systématique couvrant l'évolution des techniques de génération de têtes parlantes depuis les GANs (Wav2Lip, SadTalker) jusqu'aux diffusion transformers récents. Cartographie les benchmarks standards (HDTF, VFHQ, LRS3), les métriques d'évaluation (FID, FVD, SyncNet, PSNR), et les trade-offs architecturaux. Identifie quatre axes d'amélioration prioritaires : identité sur longues séquences, expressivité au-delà des lèvres, diversité ethnique et culturelle, vitesse d'inférence sur hardware contraint.

Partie II — Psychologie et Comportement
D11
La Vallée de l'Étrange Audio-Visuelle (ACM CHI 2022)
ACM CHI 2022 — DOI:10.1145/3491102.3517564dl.acm.org
Haute

Mots-clés : vallée de l'étrange vocale, TTS neural vs voix humaine, confiance, genre du locuteur/auditeur

▶ Résultat clé : TTS neural → significativement moins digne de confiance que voix humaine réelle — effet modulé par le genre

Cette étude ACM CHI démontre qu'une nouvelle dimension de la vallée de l'étrange émerge dans le domaine vocal : un humain virtuel utilisant une synthèse vocale neurale (TTS neural) est perçu comme significativement moins digne de confiance qu'un humain virtuel utilisant une voix humaine réelle. L'effet est modulé par le genre du locuteur et de l'auditeur. L'étude étend le concept classique de Mori (1970) de la morphologie visuelle à la fidélité acoustique.

D12
Fidélité Visuelle, Présence et Réponses Physiologiques (CHB, 2025)
Computers in Human Behavior — DOI:10.1016/j.chb.2025.108596doi.org
Haute

Mots-clés : HRV/EEG, stress sympathique, trilemme présence-anonymat, fidélité visuelle faible/moyenne/haute

▶ Résultat clé : avatars haute fidélité → stress sympathique plus élevé lors de conversations sensibles

Étude expérimentale mesurant les réponses physiologiques (HRV, EEG) et psychologiques (stress perçu) de participants interagissant avec des avatars de fidélité visuelle faible, moyenne et haute. Les avatars haute fidélité génèrent un ratio LF/HF significativement plus élevé (stress sympathique) que les avatars basse fidélité, particulièrement lors de conversations sensibles. Confirme le trilemme présence-anonymat.

Mots-clés : interaction parasociale, attachement numérique, dépendance émotionnelle, design éthique

Revue systématique de deux décennies de recherche proposant un modèle théorique de l'évolution des relations émotionnelles humain-IA : de l'interaction parasociale (investissement émotionnel unilatéral) vers l'attachement numérique. Déterminants identifiés : personnalisation de l'IA, continuité mémorielle, réactivité émotionnelle perçue, anthropomorphisation. Risques de dépendance et critères de design éthique proposés.

D14
Pseudo-intimité Émotionnelle et IA (Frontiers in Psychology, sept. 2025)
Frontiers in Psychology — DOI:10.3389/fpsyg.2025.1679324doi.org
Haute

Mots-clés : pseudo-intimité, IA affective, biais d'anthropomorphisation, transparence, consentement éclairé

Explore le risque de pseudo-intimité avec les IA affectives : les IA émotionnelles créent des relations qui imitent l'intimité sans les conditions de réciprocité, vulnérabilité partagée et histoire commune qui fondent les relations humaines authentiques. Analyse les mécanismes cognitifs (biais d'anthropomorphisation, renforcement affectif par réactivité simulée) et propose un cadre d'éthique du design affectif fondé sur transparence, limitation délibérée de l'expressivité, et consentement éclairé.

Partie III — Implications Sociales et Pédagogiques
D15
Avatars dans le Métaverse Éducatif — Revue Systématique (PMC, juin 2025)
Visual Computing for Industry, Biomedicine, and Art — DOI:10.1186/s42492-025-00196-9doi.org
Haute

Mots-clés : avatars éducatifs, métaverse, NLP génératif, sécurité des données, biais algorithmiques

Revue systématique évaluant la contribution des avatars à l'apprentissage dans les environnements virtuels immersifs. Documente que les avatars permettent des expériences individualisées et des activités collaboratives améliorées, et que les avancées en NLP et modèles génératifs ont significativement amélioré leurs capacités. Identifie les obstacles majeurs : sécurité des données, préoccupations éthiques (biais algorithmiques, confidentialité), et infrastructure limitée.

D16
Confiance Épistémique dans les Avatars Pédagogiques (IJLD, juin 2025)
Int. J. Learning and Development, vol. 15, n°2 — DOI:10.5296/ijld.v15i2.22988doi.org
Très haute

Mots-clés : confiance épistémique, identité apprenante, compétence/bienveillance/intégrité perçues

▶ Résultat clé : la confiance épistémique est le médiateur central de l'efficacité pédagogique des avatars

Revue intégrative de construction théorique synthétisant la littérature sur la confiance épistémique, la formation de l'identité apprenante et la préparation organisationnelle dans les contextes d'instruction médiée par avatar dans l'enseignement supérieur. Développe un framework articulant comment les avatars IA influencent l'engagement des apprenants et reconfigurent la formation de l'identité numérique. La confiance épistémique — croyance que l'avatar est une source fiable — est identifiée comme médiateur central.

Partie IV — Droit, Données et Régulation

Mots-clés : EU AI Act Art. 50(2), étiquetage obligatoire, 35M€ pénalités, droits humains, reconnaissance émotionnelle interdite

▶ Obligation légale dès août 2026 : tout avatar vidéo généré doit être étiqueté comme contenu IA de manière claire et visible

Analyse comment l'EU AI Act (adopté 2024, entrée en vigueur complète août 2026) établit un cadre centré sur les droits pour réguler les médias synthétiques. L'Article 50(2) exige que les outputs génératifs incluant des deepfakes soient clairement et visiblement étiquetés. Pénalités : jusqu'à 35 M€ ou 7% du CA mondial. La reconnaissance émotionnelle dans les lieux d'éducation est explicitement interdite par l'Article 5 depuis février 2025.

Mots-clés : propriété du jumeau numérique, autonomie des données, contrat social renouvelé, droits post-mortem

Argumente que les personnes physiques doivent être reconnues comme propriétaires moraux et légaux de leurs jumeaux numériques IA, car ces entités sont des extensions intimes de l'individu construites depuis leurs données personnelles. Les cadres légaux actuels, qui privilégient l'infrastructure technologique sur l'autonomie des données, sont critiqués comme perpétuant des inadéquations systémiques. Propose un contrat social renouvelé centré sur la dominion individuelle et le consentement.

Partie V — Impact Environnemental et Durabilité

Mots-clés : empreinte carbone inférence IA, 0,24 Wh/requête Gemini, génération vidéo 10–100× plus coûteuse, IDC 23 TWh

▶ Donnée clé : une requête Gemini médiane = 0,24 Wh / 0,03 g CO₂ ; grands modèles open-source (70B) = jusqu'à 1,7 Wh/requête

L'analyse de MIT Technology Review évalue l'empreinte énergétique de l'IA à l'échelle du secteur : IDC estime que les data centers IA consommaient 23 TWh en 2022. Google publie en 2025 une méthodologie de mesure de l'impact environnemental de l'inférence IA : une requête médiane Gemini consomme 0,24 Wh d'énergie et émet 0,03 g de CO₂. Les grands modèles open-source (70B paramètres) consomment jusqu'à 1,7 Wh par requête. La génération vidéo est significativement plus coûteuse que la génération texte — probablement 10 à 100 fois plus énergivore pour un streaming d'avatar en temps réel.

Partie VI — Perspectives Critiques Transversales

Mots-clés : biais ethniques, dataset DH-FaceVid-1K, généralisation multilingue, équité algorithmique, représentation culturelle

▶ Lacune documentée : les modèles actuels de génération d'avatars sont biaisés vers les ethnies européennes et américaines — performances dégradées pour les utilisateurs non-européens

Ce Grand Challenge de l'ACM cible directement la lacune majeure des modèles de génération de têtes parlantes : leur pauvre généralisation sur les ethnies non-européennes et non-américaines. Le dataset DH-FaceVid-1K est introduit pour pallier ce manque. Les participants doivent développer des modèles intégrant les techniques diffusion et GAN pour améliorer la synchronisation labiale, la cohérence d'identité et la vitesse d'inférence sur des données multilingues et multi-ethniques. Ce challenge révèle que les benchmarks standards (HDTF, VFHQ) sont massivement biaisés vers des visages caucasiens anglophones.

Synthèse — Niveaux de maturité par domaine

Source : gamiways-recherches-2026.md — mai 2026

DomaineMaturité académiqueDisponibilité commercialeGap GamiWays
Mémoire conversationnelleHaute (Mem0, MemoryOS)Partielle (Mem0 API)Architecture 3 couches + distillation SLM avatar-spécifique
Intégration avatar multi-sessionsHaute (VASA-1, A²-LLM)Partielle (HeyGen, Tavus)Latence <500ms + corps complet
TTS expressif personnaliséHaute (PerTTS, EmergentTTS)Bonne (ElevenLabs, Cartesia)Empreinte prosodique individuelle
Orchestration conversationnelleÉmergente (MoshiRAG, KAME)FaibleFreedom spectrum configurable + Game Master agentique

Questions de Recherche Ouvertes

Ces questions non résolues structurent le programme R&D GamiWays 2026–2028.