GamiWays
commercialSouveraineté 1/5

Tavus (Phoenix-4.5 + Raven-1 + Sparrow-2)

Conversational Video Interface — création de personnage Phoenix-4.5, perception Raven-1 et flux conversationnel Sparrow-2

Latence TTFR

~450ms

temps réel

Coût / minute

à partir de $0.367/min

selon l'abonnement souscrit

Qualité visuelle

10/10

score estimé

Protocoles

WebRTC, REST, Daily SDK

Direction émotionnelle & mise en scène

Phoenix-4.5 et Raven adaptent le comportement à l’image/à l’audio perçus, mais la régie créateur reste indirecte via persona, system prompt et policy.

Direction par instructions

Paramètres et mécanisme

`system_prompt`, perception Raven, paramètres LLM et policy de PAL ; Sparrow-2 règle le tour de parole. Ces couches sont séparées de la création du visage Phoenix-4.5.

Limite à garder visible

Il n’existe pas de commande explicite par tour pour un geste, un regard ou une expression déterminée. Vérifier la policy UE, le consentement et l’effet réel de la perception avant de l’utiliser dans Où est Ava ?/Dilemme.

Personnalisation de l'avatar

RAG / Base de connaissances

Native RAG via Persona: provide document_ids or document_tags. Avatar queries knowledge base in real-time during conversation.

Comportement & personnalité

Persona system_prompt + Objectives + Guardrails, complétés par Sparrow-2 : turn_taking_patience, pal_interruptibility et idle_engagement règlent les biais d’écoute et de reprise. Une policy EU peut contraindre la perception Raven ; ces paramètres orientent le comportement, sans être des règles déterministes de jeu visuel.

Langage corporel & gestes

Phoenix-4.5 : création de visage depuis image ou vidéo et meilleure stabilité des accessoires/mouvements sous le cou. Le rendu génère tête, cheveux, yeux, pose et expression image par image ; écoute active (hochements, inclinaisons, microexpressions) réactive, non programmée par geste.

Expressions faciales

Phoenix-4.5 : transitions émotionnelles et microexpressions émergentes, sans API d’expression précise par tour. Raven-1 peut alimenter un contexte de perception ; la disponibilité de cette couche dépend de la policy et doit être contrôlée en contexte UE.

Voix & clonage vocal

Voix et accents personnalisables ; PAL `languages: ["fr"]` et `tavus-auto` annoncent le français parmi 42 langues. Echo mode peut synchroniser une piste audio externe : utile pour tester une voix française dirigée, sans prouver une direction émotionnelle native Tavus.

Fine-tuning du persona

Objectives + Guardrails permettent de définir la persona ; Text Respond couvre les interactions scriptées et participant_id/name facilitent la lecture multi-participants. Sparrow-2 ajoute un réglage de prise de tour par PAL, distinct de la direction émotionnelle ou des gestes.

Entraînement de l'avatar

Vidéo requise Oui
Durée2 minutes (1 min speech + 1 min neutral listening)
Résolution1080p minimum, 4K recommended
FormatMP4 (H.264/AAC) or WebM, 25fps min
Consentement requis Oui (obligatoire)
Temps de traitement4–5 hours

Bonnes pratiques

  • 01.1 min continuous speech (clear articulation, teeth visible)
  • 02.1 min neutral listening (closed mouth, no expression)
  • 03.Waist-up, seated, ~1m from camera
  • 04.Diffuse lighting, static background
  • 05.Verbal consent declaration required

Analyse API

Protocoles

RESTWebRTC (Daily)WebSocket

SDKs

JavaScript/ReactPython
Webhooks Yes

Sessions simultanées

1 (Free / Starter) → 3 (Builder) → 10 (Growth) → 15 (Business) → limite sur mesure (Enterprise)

Limites de débit

S3 pre-signed URLs requis pour les médias d’entraînement. Chaque conversation est facturée avec un minimum de 30 secondes puis par incréments de 6 secondes ; les paramètres de flux constituent des biais et non des garanties de latence.

Fonctionnalités clés

  • Raven-1 (2026): multimodal perception — audio-visual fusion, tone + expression + gaze + posture → natural language output for LLMs. Context < 300ms stale. Audio perception < 100ms.
  • Phoenix-4.5 : création de visage depuis image/vidéo, accessoires et mouvements sous le cou améliorés ; écoute active et transitions émotionnelles émergentes, non dirigées image par image.
  • Sparrow-2 : compréhension conjointe du contenu, de la prosodie, du locuteur, des backchannels, interruptions, bruits et parole de fond ; opt-in via layers.conversational_flow.turn_detection_model
  • Sparrow-2 : trames audio de 10 ms, état actualisé jusqu’à 100 fois/s ; Tavus annonce ~7 ms pour traiter 80 ms d’audio (vs ~30 ms pour Sparrow-1)
  • Réglages de flux : turn_taking_patience (low / medium / high), pal_interruptibility et idle_engagement ; Sparrow-2 n’utilise pas voice_isolation
  • Raven-1 tool calling : schéma compatible OpenAI, callbacks sur rire, seuils émotionnels et attention ; vérifier policy EU et informations de consentement avant exploitation
  • Echo mode: lip-sync on external audio stream
  • Text Respond: generate response from text input
  • Cerebras chip integration for ultra-fast LLM inference
  • Webhooks for training completion and conversation state

Contraintes API

  • Dependency on Daily for WebRTC layer
  • S3 pre-signed URLs required for media upload
  • 4–5h training time for custom replicas
  • Valider Phoenix-4.5 avec un personnage Où est Ava ? image/vidéo, français strict, pauses lourdes, chevauchements et bruit réel avant de conclure sur cohérence et présence
  • Les réglages de prise de tour sont des biais de conversation ; ils ne pilotent ni gestes précis ni mise en scène image par image

Modèle tarifaire

Modèle : Monthly subscription + pay-as-you-go
PlanPrixMinutes inclusesDépassement
Free$0/mo20 min · 1 session · 5 min/sessionN/A
Starter$22/mo60 min · 1 session · 5 min/sessionPay-as-you-go disponible ; tarif non affiché sur la grille
Builder$59/mo175 min · 3 sessions · 15 min/session$0.35/min
Growth$397/mo1 300 min · 10 sessions · durée maximale$0.31/min
Business$975/mo4 000 min · 15 sessions · durée maximale$0.26/min
EnterpriseCustomCustom · concurrence sur mesureScaling discounts
Offre gratuite
Cloud uniquement
Tarif Enterprise

Coûts cachés / à surveiller

  • Replica training : $40–$65 par entraînement additionnel selon le plan
  • Vidéo générative, enregistrements et intégrations métier se chiffrent séparément
  • CVI : minimum 30 s par conversation, puis incréments de 6 s

Souveraineté & Hébergement

Score de souveraineté

1/5

Hébergement

AWS US

GDPR

Yes

On-premise

No

Détail souveraineté

AWS US. SOC2 Type II + HIPAA (Growth+). No EU hosting.

Contraintes & Limites

  • No manual control of specific hand/arm gestures
  • 4–5h training time for custom replicas
  • High-quality video required (1080p min, 4K recommended)
  • US hosting only
  • SOC2/HIPAA only on Growth+ plans
  • Mandatory verbal consent for personal replicas
  • French PAL, voix personnalisées et éventuelle perception Raven-1 nécessitent une vérification de configuration, de policy et de consentement
  • Sparrow-2 améliore la prise de tour ; il ne remplace ni un test de latence bout en bout ni une direction de jeu visuelle contrôlable

Pertinence pour GamiWays

Score

9/10

Phoenix-4.5 et Sparrow-2 renforcent Tavus comme référence commerciale à tester pour Où est Ava ? : le premier accélère la création d’un visage de personnage, le second aide à régler le rythme d’écoute, d’interruption et de reprise. Une voix française dirigée peut passer par Echo mode, mais Tavus ne donne toujours pas une régie déterministe d’un geste ou d’une émotion précise. Le test doit comparer image/vidéo de personnage, français strict, pauses sensibles, parole de fond, participant multiple, consentement/policy et coût à une intégration Où est Ava ? avec voix externe. Pour le Dilemme, l’hébergement US et la couche de perception UE restent des limites de gouvernance.