Tavus (Phoenix-4.5 + Raven-1 + Sparrow-2)
Conversational Video Interface — création de personnage Phoenix-4.5, perception Raven-1 et flux conversationnel Sparrow-2
Latence TTFR
~450ms
temps réel
Coût / minute
à partir de $0.367/min
selon l'abonnement souscrit
Qualité visuelle
10/10
score estimé
Protocoles
WebRTC, REST, Daily SDK
Direction émotionnelle & mise en scène
Phoenix-4.5 et Raven adaptent le comportement à l’image/à l’audio perçus, mais la régie créateur reste indirecte via persona, system prompt et policy.
Direction par instructionsParamètres et mécanisme
`system_prompt`, perception Raven, paramètres LLM et policy de PAL ; Sparrow-2 règle le tour de parole. Ces couches sont séparées de la création du visage Phoenix-4.5.
Limite à garder visible
Il n’existe pas de commande explicite par tour pour un geste, un regard ou une expression déterminée. Vérifier la policy UE, le consentement et l’effet réel de la perception avant de l’utiliser dans Où est Ava ?/Dilemme.
Personnalisation de l'avatar
RAG / Base de connaissances
Native RAG via Persona: provide document_ids or document_tags. Avatar queries knowledge base in real-time during conversation.
Comportement & personnalité
Persona system_prompt + Objectives + Guardrails, complétés par Sparrow-2 : turn_taking_patience, pal_interruptibility et idle_engagement règlent les biais d’écoute et de reprise. Une policy EU peut contraindre la perception Raven ; ces paramètres orientent le comportement, sans être des règles déterministes de jeu visuel.
Langage corporel & gestes
Phoenix-4.5 : création de visage depuis image ou vidéo et meilleure stabilité des accessoires/mouvements sous le cou. Le rendu génère tête, cheveux, yeux, pose et expression image par image ; écoute active (hochements, inclinaisons, microexpressions) réactive, non programmée par geste.
Expressions faciales
Phoenix-4.5 : transitions émotionnelles et microexpressions émergentes, sans API d’expression précise par tour. Raven-1 peut alimenter un contexte de perception ; la disponibilité de cette couche dépend de la policy et doit être contrôlée en contexte UE.
Voix & clonage vocal
Voix et accents personnalisables ; PAL `languages: ["fr"]` et `tavus-auto` annoncent le français parmi 42 langues. Echo mode peut synchroniser une piste audio externe : utile pour tester une voix française dirigée, sans prouver une direction émotionnelle native Tavus.
Fine-tuning du persona
Objectives + Guardrails permettent de définir la persona ; Text Respond couvre les interactions scriptées et participant_id/name facilitent la lecture multi-participants. Sparrow-2 ajoute un réglage de prise de tour par PAL, distinct de la direction émotionnelle ou des gestes.
Entraînement de l'avatar
Bonnes pratiques
- 01.1 min continuous speech (clear articulation, teeth visible)
- 02.1 min neutral listening (closed mouth, no expression)
- 03.Waist-up, seated, ~1m from camera
- 04.Diffuse lighting, static background
- 05.Verbal consent declaration required
Analyse API
Protocoles
SDKs
Sessions simultanées
1 (Free / Starter) → 3 (Builder) → 10 (Growth) → 15 (Business) → limite sur mesure (Enterprise)
Limites de débit
S3 pre-signed URLs requis pour les médias d’entraînement. Chaque conversation est facturée avec un minimum de 30 secondes puis par incréments de 6 secondes ; les paramètres de flux constituent des biais et non des garanties de latence.
Fonctionnalités clés
- Raven-1 (2026): multimodal perception — audio-visual fusion, tone + expression + gaze + posture → natural language output for LLMs. Context < 300ms stale. Audio perception < 100ms.
- Phoenix-4.5 : création de visage depuis image/vidéo, accessoires et mouvements sous le cou améliorés ; écoute active et transitions émotionnelles émergentes, non dirigées image par image.
- Sparrow-2 : compréhension conjointe du contenu, de la prosodie, du locuteur, des backchannels, interruptions, bruits et parole de fond ; opt-in via layers.conversational_flow.turn_detection_model
- Sparrow-2 : trames audio de 10 ms, état actualisé jusqu’à 100 fois/s ; Tavus annonce ~7 ms pour traiter 80 ms d’audio (vs ~30 ms pour Sparrow-1)
- Réglages de flux : turn_taking_patience (low / medium / high), pal_interruptibility et idle_engagement ; Sparrow-2 n’utilise pas voice_isolation
- Raven-1 tool calling : schéma compatible OpenAI, callbacks sur rire, seuils émotionnels et attention ; vérifier policy EU et informations de consentement avant exploitation
- Echo mode: lip-sync on external audio stream
- Text Respond: generate response from text input
- Cerebras chip integration for ultra-fast LLM inference
- Webhooks for training completion and conversation state
Contraintes API
- Dependency on Daily for WebRTC layer
- S3 pre-signed URLs required for media upload
- 4–5h training time for custom replicas
- Valider Phoenix-4.5 avec un personnage Où est Ava ? image/vidéo, français strict, pauses lourdes, chevauchements et bruit réel avant de conclure sur cohérence et présence
- Les réglages de prise de tour sont des biais de conversation ; ils ne pilotent ni gestes précis ni mise en scène image par image
Modèle tarifaire
| Plan | Prix | Minutes incluses | Dépassement |
|---|---|---|---|
| Free | $0/mo | 20 min · 1 session · 5 min/session | N/A |
| Starter | $22/mo | 60 min · 1 session · 5 min/session | Pay-as-you-go disponible ; tarif non affiché sur la grille |
| Builder | $59/mo | 175 min · 3 sessions · 15 min/session | $0.35/min |
| Growth | $397/mo | 1 300 min · 10 sessions · durée maximale | $0.31/min |
| Business | $975/mo | 4 000 min · 15 sessions · durée maximale | $0.26/min |
| Enterprise | Custom | Custom · concurrence sur mesure | Scaling discounts |
Coûts cachés / à surveiller
- Replica training : $40–$65 par entraînement additionnel selon le plan
- Vidéo générative, enregistrements et intégrations métier se chiffrent séparément
- CVI : minimum 30 s par conversation, puis incréments de 6 s
Souveraineté & Hébergement
Score de souveraineté
Hébergement
AWS US
GDPR
YesOn-premise
NoDétail souveraineté
AWS US. SOC2 Type II + HIPAA (Growth+). No EU hosting.
Contraintes & Limites
- No manual control of specific hand/arm gestures
- 4–5h training time for custom replicas
- High-quality video required (1080p min, 4K recommended)
- US hosting only
- SOC2/HIPAA only on Growth+ plans
- Mandatory verbal consent for personal replicas
- French PAL, voix personnalisées et éventuelle perception Raven-1 nécessitent une vérification de configuration, de policy et de consentement
- Sparrow-2 améliore la prise de tour ; il ne remplace ni un test de latence bout en bout ni une direction de jeu visuelle contrôlable
Pertinence pour GamiWays
Score
9/10
Phoenix-4.5 et Sparrow-2 renforcent Tavus comme référence commerciale à tester pour Où est Ava ? : le premier accélère la création d’un visage de personnage, le second aide à régler le rythme d’écoute, d’interruption et de reprise. Une voix française dirigée peut passer par Echo mode, mais Tavus ne donne toujours pas une régie déterministe d’un geste ou d’une émotion précise. Le test doit comparer image/vidéo de personnage, français strict, pauses sensibles, parole de fond, participant multiple, consentement/policy et coût à une intégration Où est Ava ? avec voix externe. Pour le Dilemme, l’hébergement US et la couche de perception UE restent des limites de gouvernance.