GamiWays
commercialSovereignty 1/5

Tavus (Phoenix-4.5 + Raven-1 + Sparrow-2)

Conversational Video Interface — création de personnage Phoenix-4.5, perception Raven-1 et flux conversationnel Sparrow-2

TTFR Latency

~450ms

real-time

Cost / minute

from $0.367/min

depending on plan

Visual Quality

10/10

estimated score

Protocols

WebRTC, REST, Daily SDK

Emotional Direction & Staging

Phoenix-4.5 and Raven adapt behaviour to perceived image/audio, but creator direction remains indirect through persona, system prompt and policy.

Instruction-based direction

Parameters and mechanism

`system_prompt`, Raven perception, LLM parameters and PAL policy; Sparrow-2 steers turn-taking. These layers are separate from Phoenix-4.5 face creation.

Limit to keep visible

There is no explicit per-turn command for a determined gesture, gaze or expression. Verify EU policy, consent and actual perception effect before using it in Où est Ava ?/Plastic Dilemma.

Avatar Customisation

RAG / Knowledge Base

Native RAG via Persona: provide document_ids or document_tags. Avatar queries knowledge base in real-time during conversation.

Behavior & Personality

Persona system_prompt + Objectives + Guardrails, complétés par Sparrow-2 : turn_taking_patience, pal_interruptibility et idle_engagement règlent les biais d’écoute et de reprise. Une policy EU peut contraindre la perception Raven ; ces paramètres orientent le comportement, sans être des règles déterministes de jeu visuel.

Body Language & Gestures

Phoenix-4.5 : création de visage depuis image ou vidéo et meilleure stabilité des accessoires/mouvements sous le cou. Le rendu génère tête, cheveux, yeux, pose et expression image par image ; écoute active (hochements, inclinaisons, microexpressions) réactive, non programmée par geste.

Facial Expressions

Phoenix-4.5 : transitions émotionnelles et microexpressions émergentes, sans API d’expression précise par tour. Raven-1 peut alimenter un contexte de perception ; la disponibilité de cette couche dépend de la policy et doit être contrôlée en contexte UE.

Voice & Voice Cloning

Voix et accents personnalisables ; PAL `languages: ["fr"]` et `tavus-auto` annoncent le français parmi 42 langues. Echo mode peut synchroniser une piste audio externe : utile pour tester une voix française dirigée, sans prouver une direction émotionnelle native Tavus.

Persona Fine-Tuning

Objectives + Guardrails permettent de définir la persona ; Text Respond couvre les interactions scriptées et participant_id/name facilitent la lecture multi-participants. Sparrow-2 ajoute un réglage de prise de tour par PAL, distinct de la direction émotionnelle ou des gestes.

Avatar Training

Video required Yes
Duration2 minutes (1 min speech + 1 min neutral listening)
Resolution1080p minimum, 4K recommended
FormatMP4 (H.264/AAC) or WebM, 25fps min
Consent required Yes (mandatory)
Processing time4–5 hours

Best Practices

  • 01.1 min continuous speech (clear articulation, teeth visible)
  • 02.1 min neutral listening (closed mouth, no expression)
  • 03.Waist-up, seated, ~1m from camera
  • 04.Diffuse lighting, static background
  • 05.Verbal consent declaration required

API Analysis

Protocols

RESTWebRTC (Daily)WebSocket

SDKs

JavaScript/ReactPython
Webhooks Yes

Concurrent Sessions

1 (Free / Starter) → 3 (Builder) → 10 (Growth) → 15 (Business) → limite sur mesure (Enterprise)

Rate Limits

S3 pre-signed URLs requis pour les médias d’entraînement. Chaque conversation est facturée avec un minimum de 30 secondes puis par incréments de 6 secondes ; les paramètres de flux constituent des biais et non des garanties de latence.

Key Features

  • Raven-1 (2026): multimodal perception — audio-visual fusion, tone + expression + gaze + posture → natural language output for LLMs. Context < 300ms stale. Audio perception < 100ms.
  • Phoenix-4.5 : création de visage depuis image/vidéo, accessoires et mouvements sous le cou améliorés ; écoute active et transitions émotionnelles émergentes, non dirigées image par image.
  • Sparrow-2 : compréhension conjointe du contenu, de la prosodie, du locuteur, des backchannels, interruptions, bruits et parole de fond ; opt-in via layers.conversational_flow.turn_detection_model
  • Sparrow-2 : trames audio de 10 ms, état actualisé jusqu’à 100 fois/s ; Tavus annonce ~7 ms pour traiter 80 ms d’audio (vs ~30 ms pour Sparrow-1)
  • Réglages de flux : turn_taking_patience (low / medium / high), pal_interruptibility et idle_engagement ; Sparrow-2 n’utilise pas voice_isolation
  • Raven-1 tool calling : schéma compatible OpenAI, callbacks sur rire, seuils émotionnels et attention ; vérifier policy EU et informations de consentement avant exploitation
  • Echo mode: lip-sync on external audio stream
  • Text Respond: generate response from text input
  • Cerebras chip integration for ultra-fast LLM inference
  • Webhooks for training completion and conversation state

API Constraints

  • Dependency on Daily for WebRTC layer
  • S3 pre-signed URLs required for media upload
  • 4–5h training time for custom replicas
  • Valider Phoenix-4.5 avec un personnage Où est Ava ? image/vidéo, français strict, pauses lourdes, chevauchements et bruit réel avant de conclure sur cohérence et présence
  • Les réglages de prise de tour sont des biais de conversation ; ils ne pilotent ni gestes précis ni mise en scène image par image

Pricing Model

Model: Monthly subscription + pay-as-you-go
PlanPriceIncluded minutesOverage
Free$0/mo20 min · 1 session · 5 min/sessionN/A
Starter$22/mo60 min · 1 session · 5 min/sessionPay-as-you-go disponible ; tarif non affiché sur la grille
Builder$59/mo175 min · 3 sessions · 15 min/session$0.35/min
Growth$397/mo1 300 min · 10 sessions · durée maximale$0.31/min
Business$975/mo4 000 min · 15 sessions · durée maximale$0.26/min
EnterpriseCustomCustom · concurrence sur mesureScaling discounts
Free tier
Cloud only
Enterprise pricing

Hidden costs / watch out

  • Replica training : $40–$65 par entraînement additionnel selon le plan
  • Vidéo générative, enregistrements et intégrations métier se chiffrent séparément
  • CVI : minimum 30 s par conversation, puis incréments de 6 s

Sovereignty & Hosting

Sovereignty Score

1/5

Hosting

AWS US

GDPR

Yes

On-premise

No

Sovereignty detail

AWS US. SOC2 Type II + HIPAA (Growth+). No EU hosting.

Constraints & Limits

  • No manual control of specific hand/arm gestures
  • 4–5h training time for custom replicas
  • High-quality video required (1080p min, 4K recommended)
  • US hosting only
  • SOC2/HIPAA only on Growth+ plans
  • Mandatory verbal consent for personal replicas
  • French PAL, voix personnalisées et éventuelle perception Raven-1 nécessitent une vérification de configuration, de policy et de consentement
  • Sparrow-2 améliore la prise de tour ; il ne remplace ni un test de latence bout en bout ni une direction de jeu visuelle contrôlable

GamiWays Relevance

Score

9/10

Phoenix-4.5 et Sparrow-2 renforcent Tavus comme référence commerciale à tester pour Où est Ava ? : le premier accélère la création d’un visage de personnage, le second aide à régler le rythme d’écoute, d’interruption et de reprise. Une voix française dirigée peut passer par Echo mode, mais Tavus ne donne toujours pas une régie déterministe d’un geste ou d’une émotion précise. Le test doit comparer image/vidéo de personnage, français strict, pauses sensibles, parole de fond, participant multiple, consentement/policy et coût à une intégration Où est Ava ? avec voix externe. Pour le Dilemme, l’hébergement US et la couche de perception UE restent des limites de gouvernance.