Tavus (Phoenix-4.5 + Raven-1 + Sparrow-2)
Conversational Video Interface — création de personnage Phoenix-4.5, perception Raven-1 et flux conversationnel Sparrow-2
TTFR Latency
~450ms
real-time
Cost / minute
from $0.367/min
depending on plan
Visual Quality
10/10
estimated score
Protocols
WebRTC, REST, Daily SDK
Emotional Direction & Staging
Phoenix-4.5 and Raven adapt behaviour to perceived image/audio, but creator direction remains indirect through persona, system prompt and policy.
Instruction-based directionParameters and mechanism
`system_prompt`, Raven perception, LLM parameters and PAL policy; Sparrow-2 steers turn-taking. These layers are separate from Phoenix-4.5 face creation.
Limit to keep visible
There is no explicit per-turn command for a determined gesture, gaze or expression. Verify EU policy, consent and actual perception effect before using it in Où est Ava ?/Plastic Dilemma.
Avatar Customisation
RAG / Knowledge Base
Native RAG via Persona: provide document_ids or document_tags. Avatar queries knowledge base in real-time during conversation.
Behavior & Personality
Persona system_prompt + Objectives + Guardrails, complétés par Sparrow-2 : turn_taking_patience, pal_interruptibility et idle_engagement règlent les biais d’écoute et de reprise. Une policy EU peut contraindre la perception Raven ; ces paramètres orientent le comportement, sans être des règles déterministes de jeu visuel.
Body Language & Gestures
Phoenix-4.5 : création de visage depuis image ou vidéo et meilleure stabilité des accessoires/mouvements sous le cou. Le rendu génère tête, cheveux, yeux, pose et expression image par image ; écoute active (hochements, inclinaisons, microexpressions) réactive, non programmée par geste.
Facial Expressions
Phoenix-4.5 : transitions émotionnelles et microexpressions émergentes, sans API d’expression précise par tour. Raven-1 peut alimenter un contexte de perception ; la disponibilité de cette couche dépend de la policy et doit être contrôlée en contexte UE.
Voice & Voice Cloning
Voix et accents personnalisables ; PAL `languages: ["fr"]` et `tavus-auto` annoncent le français parmi 42 langues. Echo mode peut synchroniser une piste audio externe : utile pour tester une voix française dirigée, sans prouver une direction émotionnelle native Tavus.
Persona Fine-Tuning
Objectives + Guardrails permettent de définir la persona ; Text Respond couvre les interactions scriptées et participant_id/name facilitent la lecture multi-participants. Sparrow-2 ajoute un réglage de prise de tour par PAL, distinct de la direction émotionnelle ou des gestes.
Avatar Training
Best Practices
- 01.1 min continuous speech (clear articulation, teeth visible)
- 02.1 min neutral listening (closed mouth, no expression)
- 03.Waist-up, seated, ~1m from camera
- 04.Diffuse lighting, static background
- 05.Verbal consent declaration required
API Analysis
Protocols
SDKs
Concurrent Sessions
1 (Free / Starter) → 3 (Builder) → 10 (Growth) → 15 (Business) → limite sur mesure (Enterprise)
Rate Limits
S3 pre-signed URLs requis pour les médias d’entraînement. Chaque conversation est facturée avec un minimum de 30 secondes puis par incréments de 6 secondes ; les paramètres de flux constituent des biais et non des garanties de latence.
Key Features
- Raven-1 (2026): multimodal perception — audio-visual fusion, tone + expression + gaze + posture → natural language output for LLMs. Context < 300ms stale. Audio perception < 100ms.
- Phoenix-4.5 : création de visage depuis image/vidéo, accessoires et mouvements sous le cou améliorés ; écoute active et transitions émotionnelles émergentes, non dirigées image par image.
- Sparrow-2 : compréhension conjointe du contenu, de la prosodie, du locuteur, des backchannels, interruptions, bruits et parole de fond ; opt-in via layers.conversational_flow.turn_detection_model
- Sparrow-2 : trames audio de 10 ms, état actualisé jusqu’à 100 fois/s ; Tavus annonce ~7 ms pour traiter 80 ms d’audio (vs ~30 ms pour Sparrow-1)
- Réglages de flux : turn_taking_patience (low / medium / high), pal_interruptibility et idle_engagement ; Sparrow-2 n’utilise pas voice_isolation
- Raven-1 tool calling : schéma compatible OpenAI, callbacks sur rire, seuils émotionnels et attention ; vérifier policy EU et informations de consentement avant exploitation
- Echo mode: lip-sync on external audio stream
- Text Respond: generate response from text input
- Cerebras chip integration for ultra-fast LLM inference
- Webhooks for training completion and conversation state
API Constraints
- Dependency on Daily for WebRTC layer
- S3 pre-signed URLs required for media upload
- 4–5h training time for custom replicas
- Valider Phoenix-4.5 avec un personnage Où est Ava ? image/vidéo, français strict, pauses lourdes, chevauchements et bruit réel avant de conclure sur cohérence et présence
- Les réglages de prise de tour sont des biais de conversation ; ils ne pilotent ni gestes précis ni mise en scène image par image
Pricing Model
| Plan | Price | Included minutes | Overage |
|---|---|---|---|
| Free | $0/mo | 20 min · 1 session · 5 min/session | N/A |
| Starter | $22/mo | 60 min · 1 session · 5 min/session | Pay-as-you-go disponible ; tarif non affiché sur la grille |
| Builder | $59/mo | 175 min · 3 sessions · 15 min/session | $0.35/min |
| Growth | $397/mo | 1 300 min · 10 sessions · durée maximale | $0.31/min |
| Business | $975/mo | 4 000 min · 15 sessions · durée maximale | $0.26/min |
| Enterprise | Custom | Custom · concurrence sur mesure | Scaling discounts |
Hidden costs / watch out
- Replica training : $40–$65 par entraînement additionnel selon le plan
- Vidéo générative, enregistrements et intégrations métier se chiffrent séparément
- CVI : minimum 30 s par conversation, puis incréments de 6 s
Sovereignty & Hosting
Sovereignty Score
Hosting
AWS US
GDPR
YesOn-premise
NoSovereignty detail
AWS US. SOC2 Type II + HIPAA (Growth+). No EU hosting.
Constraints & Limits
- No manual control of specific hand/arm gestures
- 4–5h training time for custom replicas
- High-quality video required (1080p min, 4K recommended)
- US hosting only
- SOC2/HIPAA only on Growth+ plans
- Mandatory verbal consent for personal replicas
- French PAL, voix personnalisées et éventuelle perception Raven-1 nécessitent une vérification de configuration, de policy et de consentement
- Sparrow-2 améliore la prise de tour ; il ne remplace ni un test de latence bout en bout ni une direction de jeu visuelle contrôlable
GamiWays Relevance
Score
9/10
Phoenix-4.5 et Sparrow-2 renforcent Tavus comme référence commerciale à tester pour Où est Ava ? : le premier accélère la création d’un visage de personnage, le second aide à régler le rythme d’écoute, d’interruption et de reprise. Une voix française dirigée peut passer par Echo mode, mais Tavus ne donne toujours pas une régie déterministe d’un geste ou d’une émotion précise. Le test doit comparer image/vidéo de personnage, français strict, pauses sensibles, parole de fond, participant multiple, consentement/policy et coût à une intégration Où est Ava ? avec voix externe. Pour le Dilemme, l’hébergement US et la couche de perception UE restent des limites de gouvernance.