Realtime TTS-2 et sa variante Flash sont disponibles. Voice Direction, non-verbaux et contexte audio peuvent guider le rendu vocal ; le respect des consignes françaises, la reproductibilité et la latence Où est Ava ? complète restent à mesurer.
Inworld Realtime TTS-2 + Flash
TTS conversationnel disponible : direction libre, contexte audio, non-verbaux et variante Flash à faible délai serveur
Scores comparatifs
Architecture
Candidat à tester pour la couche voix d’Où est Ava ?, non pour la couche avatar vidéo. Voice Direction, non-verbaux et contexte audio inter-tours offrent une voie directe pour le « comment » d’une réplique. Tester les consignes françaises, les scènes sensibles, le lip-sync avec le renderer retenu et la latence de bout en bout. Pour le Dilemme Plastique, traiter la résidence UE/Inde comme une option Enterprise contractuelle, non comme un déploiement souverain automatique.
Analyse
Inworld Realtime TTS-2 est désormais disponible avec une variante Flash. Il associe Voice Direction en langage naturel, non-verbaux, contexte audio inter-tours, Voice Design et une identité vocale sur 200+ langues. TTS-2 publie 100 ms TTFB P90 côté serveur et Flash 20 ms ; aucun de ces chiffres n’est une latence Où est Ava ? de bout en bout. La plateforme propose aussi STT, Realtime API et LLM Router. Le respect des consignes françaises, la compatibilité visèmes et les conditions Enterprise de souveraineté restent à valider.
Points forts
- Realtime TTS-2 disponible : direction libre et non-verbaux
- Contexte audio inter-tours et modes Expressive/Balanced/Stable
- TTS-2 Flash : 20 ms TTFB P90 annoncé côté serveur
- 200+ langues et une identité vocale crosslingue annoncées
- Clonage instantané et Voice Design selon le plan
- Plateforme : TTS + STT + Realtime S2S + LLM Router
- Timestamps utiles au lip-sync
- Résidence UE/Inde et SLA/DPA à contractualiser sur Enterprise
Limitations
- TTFB serveur hors réseau, LLM et vidéo
- Direction libre et non-verbaux en français à tester scène par scène
- Résidence UE/Inde et conditions on-premise limitées aux termes Enterprise
- Modèles et limites du Router évoluent fréquemment
Capacités vocales
Instant voice cloning (free). Professional voice cloning (Growth/Enterprise add-on). Advanced Voice Design: create a voice from a prose description — no reference audio needed. Up to 5 custom voices (On-Demand), 100 (Creator), 1,000 (Developer), 3,000 (Growth). ElevenLabs migration tool available.
Realtime TTS-2 disponible interprète des indications de jeu libres, des non-verbaux et le contexte audio des tours précédents en rendu vocal conversationnel.
Comment : Direction en langage naturel, marqueurs non verbaux, contexte audio inter-tours et modes `Expressive`, `Balanced` ou `Stable`, avec voix/design vocal selon le plan.
À tester : La direction est une interprétation générative : mesurer le respect des consignes françaises, la reproductibilité et le lip-sync avant un choix Où est Ava ? TTFB publié côté serveur uniquement.
Streaming-native via WebSocket and REST. TTS-2 annonce 100 ms TTFB P90 côté serveur et Flash 20 ms P90 ; ces chiffres excluent le réseau, le LLM et la vidéo. Realtime API : WebSocket full-duplex S2S, détection de tour, tool calling et routage LLM. Les backchannels peuvent être diffusés pendant le raisonnement.
Word, character, phoneme, and viseme-level timestamps. Unity/Unreal SDKs with lipsync templates.
Tarification
Realtime TTS-2 : $25/1M chars On-Demand, $20 Creator, $17.50 Builder, $15 Developer et $12.50 Growth. TTS-2 Flash : $15 → $7/1M chars aux mêmes paliers. L’estimateur Inworld emploie ~1 000 caractères/min ; les crédits mensuels sont inclus dans les plans payants.
| Plan | Abonnement/mois | Inclus | Dépassement/min | Topup |
|---|---|---|---|---|
On-Demand (gratuit) PAYG au-delà de 40 min à $25/1M chars | Gratuit | 70 min | $0.0250 | Oui |
Creator Crédits reportables. Dépassement à $20/1M caractères (TTS-2) | $25/mo | $25/mo credits | $0.0200 | Oui |
GrowthRecommandé Meilleur tarif : $12.50/1M chars (TTS-2) | $1500/mo | $1,500/mo credits | $0.0125 | Oui |
Souveraineté & Conformité
Résidence UE/Inde, SLA et DPA sont des options Enterprise. ZDR, HIPAA et BAA sont proposés en option Growth ; vérifier contractualisation, conservation des voix et éventuelles conditions on-premise séparément.
Résidence des données : US, EU, India
Certifications & conformité
HIPAA, ZDR (Zero Data Retention) et BAA relèvent des options Growth/Enterprise. La résidence UE ou Inde et les éventuelles conditions on-premise doivent être contractualisées séparément ; aucune ne vaut déploiement souverain automatique.
Positionnement de Inworld Realtime TTS-2 + Flash
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Inworld Realtime TTS-2 est désormais disponible : Voice Direction et contexte inter-tours en font une voie crédible pour tester comment Où est Ava ? parle. Les 100/20 ms TTFB serveur annoncés et le résultat émotionnel français exigent encore un test de scène de bout en bout.
A. Positionnement stratégique
Client cible : Enterprise / Developer — regulated industries, gaming, real-time agents
Realtime TTS-2 disponible pour la conversation : Voice Direction libre, Conversational Awareness, non-verbaux, Voice Design et variante Flash. Les conditions Enterprise gouvernent résidence UE/Inde et on-premise.
B. Avantage concurrentiel
- TTS 1.5 #1 Artificial Analysis Speech Arena (devant Google et ElevenLabs)
- TTS-2 : Voice Direction — instructions de livraison en langage naturel inline (unique sur le marché)
- TTS-2 : Conversational Awareness — le modèle entend les tours audio précédents, ton et rythme portés
- TTS-2 : 200+ langues/locales annoncées, une identité vocale et usage crosslingue
- Plateforme complète : TTS + STT + Realtime API (WebSocket S2S) + LLM Router (220+ modèles)
Vulnérabilité : Les 100/20 ms TTFB publiés sont côté serveur, non une latence de dialogue complète. Le respect des directions françaises, la synchronisation vidéo et les conditions Enterprise/on-premise restent à mesurer ou contractualiser.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Les conditions Enterprise sont nécessaires pour résidence UE/Inde, SLA/DPA et toute discussion on-premise. Traiter ZDR, HIPAA et BAA comme attributs contractés séparément ; ne pas classer l’accès standard comme souverain.
Build vs. Buy
Option buy/test prioritaire pour la direction vocale Où est Ava ?, non pour l’achat d’un avatar vidéo. Comparer TTS-2 et Flash sur les mêmes scènes françaises ; la souveraineté nécessite une revue contractuelle Enterprise.
Risque de lock-in
Les modèles propriétaires et la plateforme full-stack créent un certain lock-in. La compatibilité drop-in avec l'API Realtime OpenAI réduit le coût de migration. Les prix compétitifs réduisent le risque de dépendance.
Alignement roadmap
Fort alignement avec la couche voix Où est Ava ? : le contexte inter-tours peut soutenir la continuité et Voice Direction peut modifier une interprétation sans réenregistrement. Valider consignes françaises, non-verbaux, visèmes et timing vidéo de bout en bout avant adoption.
Vérification de cette fiche
Inworld Realtime TTS-2 announcement and documentation, 31 Aug–6 Sep 2026. Published TTFB is server-side P90; no score or Où est Ava ? latency is inferred from it.
Note de mise à jour : Realtime TTS-2 et Flash vérifiés le 6 septembre 2026 : disponibilité, TTFB P90 serveur (100/20 ms), direction libre, non-verbaux, contexte audio, 200+ langues et tarifs de $25/$15 On-Demand à $12.50/$7 Growth. Les tests français et Où est Ava ? restent à réaliser.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026