GamiWays
Disponible

Realtime TTS-2 et sa variante Flash sont disponibles. Voice Direction, non-verbaux et contexte audio peuvent guider le rendu vocal ; le respect des consignes françaises, la reproductibilité et la latence Où est Ava ? complète restent à mesurer.

API Cloud#6 Artificial AnalysisCommercial (training framework open-sourced)

Inworld Realtime TTS-2 + Flash

TTS conversationnel disponible : direction libre, contexte audio, non-verbaux et variante Flash à faible délai serveur

100 ms
TTFA (meilleur cas)
100 ms
TTFA (typique)
$12.5/1M
Prix par million de chars
1198
ELO Score

Scores comparatifs

Qualité vocale9/10
Latence8/10
Clonage vocal9/10
Expressivité10/10
Direction de jeu7/10
Souveraineté6/10
Accessibilité prix7/10
Multilingue10/10

Architecture

ArchitectureSpeechLM (streaming-native, quantization-aware) — TTS-2 rebuilt for realtime conversation
ParamètresN/A (cloud)
Langues200
Auto-hébergeable Oui
Streaming Oui
GamiWays
Phase 1 MVP — Qualité + Pipeline conversationnel complet + 100+ langues

Candidat à tester pour la couche voix d’Où est Ava ?, non pour la couche avatar vidéo. Voice Direction, non-verbaux et contexte audio inter-tours offrent une voie directe pour le « comment » d’une réplique. Tester les consignes françaises, les scènes sensibles, le lip-sync avec le renderer retenu et la latence de bout en bout. Pour le Dilemme Plastique, traiter la résidence UE/Inde comme une option Enterprise contractuelle, non comme un déploiement souverain automatique.

Analyse

Inworld Realtime TTS-2 est désormais disponible avec une variante Flash. Il associe Voice Direction en langage naturel, non-verbaux, contexte audio inter-tours, Voice Design et une identité vocale sur 200+ langues. TTS-2 publie 100 ms TTFB P90 côté serveur et Flash 20 ms ; aucun de ces chiffres n’est une latence Où est Ava ? de bout en bout. La plateforme propose aussi STT, Realtime API et LLM Router. Le respect des consignes françaises, la compatibilité visèmes et les conditions Enterprise de souveraineté restent à valider.

Points forts

  • Realtime TTS-2 disponible : direction libre et non-verbaux
  • Contexte audio inter-tours et modes Expressive/Balanced/Stable
  • TTS-2 Flash : 20 ms TTFB P90 annoncé côté serveur
  • 200+ langues et une identité vocale crosslingue annoncées
  • Clonage instantané et Voice Design selon le plan
  • Plateforme : TTS + STT + Realtime S2S + LLM Router
  • Timestamps utiles au lip-sync
  • Résidence UE/Inde et SLA/DPA à contractualiser sur Enterprise

Limitations

  • TTFB serveur hors réseau, LLM et vidéo
  • Direction libre et non-verbaux en français à tester scène par scène
  • Résidence UE/Inde et conditions on-premise limitées aux termes Enterprise
  • Modèles et limites du Router évoluent fréquemment

Capacités vocales

Clonage vocal Oui

Instant voice cloning (free). Professional voice cloning (Growth/Enterprise add-on). Advanced Voice Design: create a voice from a prose description — no reference audio needed. Up to 5 custom voices (On-Demand), 100 (Creator), 1,000 (Developer), 3,000 (Growth). ElevenLabs migration tool available.

Direction émotionnelle & jeuDirection par instructions

Realtime TTS-2 disponible interprète des indications de jeu libres, des non-verbaux et le contexte audio des tours précédents en rendu vocal conversationnel.

Comment : Direction en langage naturel, marqueurs non verbaux, contexte audio inter-tours et modes `Expressive`, `Balanced` ou `Stable`, avec voix/design vocal selon le plan.

À tester : La direction est une interprétation générative : mesurer le respect des consignes françaises, la reproductibilité et le lip-sync avant un choix Où est Ava ? TTFB publié côté serveur uniquement.

Streaming Oui

Streaming-native via WebSocket and REST. TTS-2 annonce 100 ms TTFB P90 côté serveur et Flash 20 ms P90 ; ces chiffres excluent le réseau, le LLM et la vidéo. Realtime API : WebSocket full-duplex S2S, détection de tour, tool calling et routage LLM. Les backchannels peuvent être diffusés pendant le raisonnement.

Données lip-sync Oui

Word, character, phoneme, and viseme-level timestamps. Unity/Unreal SDKs with lipsync templates.

Tarification

Prix / 1M chars
à partir de $12.5
selon l'abonnement souscrit
Prix / minute
à partir de $0.0125
selon l'abonnement souscrit
Offre gratuite
Up to 70 min TTS included on On-Demand (free)

Realtime TTS-2 : $25/1M chars On-Demand, $20 Creator, $17.50 Builder, $15 Developer et $12.50 Growth. TTS-2 Flash : $15 → $7/1M chars aux mêmes paliers. L’estimateur Inworld emploie ~1 000 caractères/min ; les crédits mensuels sont inclus dans les plans payants.

Hybride (PAYG + Abonnement)
Page tarification officielle
PlanAbonnement/moisInclusDépassement/minTopup
On-Demand (gratuit)

PAYG au-delà de 40 min à $25/1M chars

Gratuit70 min$0.0250Oui
Creator

Crédits reportables. Dépassement à $20/1M caractères (TTS-2)

$25/mo$25/mo credits$0.0200Oui
GrowthRecommandé

Meilleur tarif : $12.50/1M chars (TTS-2)

$1500/mo$1,500/mo credits$0.0125Oui
Topup disponible : Certains plans permettent d'acheter des minutes supplémentaires (topup) sans changer de plan. Utile pour les pics d'utilisation ponctuels.

Souveraineté & Conformité

On-premise Oui

Résidence UE/Inde, SLA et DPA sont des options Enterprise. ZDR, HIPAA et BAA sont proposés en option Growth ; vérifier contractualisation, conservation des voix et éventuelles conditions on-premise séparément.

GDPR Conforme

Résidence des données : US, EU, India

Certifications & conformité

SOC 2 Type II GDPR HIPAA ZDR BAA

HIPAA, ZDR (Zero Data Retention) et BAA relèvent des options Growth/Enterprise. La résidence UE ou Inde et les éventuelles conditions on-premise doivent être contractualisées séparément ; aucune ne vaut déploiement souverain automatique.

Analyse stratégique & business

Positionnement de Inworld Realtime TTS-2 + Flash

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Inworld Realtime TTS-2 est désormais disponible : Voice Direction et contexte inter-tours en font une voie crédible pour tester comment Où est Ava ? parle. Les 100/20 ms TTFB serveur annoncés et le résultat émotionnel français exigent encore un test de scène de bout en bout.

Cloud + On-premise
Risque lock-in :Moyen
Souveraineté :Moyen
Menace open-source :Moyen
Prix :Stable →

A. Positionnement stratégique

Client cible : Enterprise / Developer — regulated industries, gaming, real-time agents

Realtime TTS-2 disponible pour la conversation : Voice Direction libre, Conversational Awareness, non-verbaux, Voice Design et variante Flash. Les conditions Enterprise gouvernent résidence UE/Inde et on-premise.

B. Avantage concurrentiel

  • TTS 1.5 #1 Artificial Analysis Speech Arena (devant Google et ElevenLabs)
  • TTS-2 : Voice Direction — instructions de livraison en langage naturel inline (unique sur le marché)
  • TTS-2 : Conversational Awareness — le modèle entend les tours audio précédents, ton et rythme portés
  • TTS-2 : 200+ langues/locales annoncées, une identité vocale et usage crosslingue
  • Plateforme complète : TTS + STT + Realtime API (WebSocket S2S) + LLM Router (220+ modèles)

Vulnérabilité : Les 100/20 ms TTFB publiés sont côté serveur, non une latence de dialogue complète. Le respect des directions françaises, la synchronisation vidéo et les conditions Enterprise/on-premise restent à mesurer ou contractualiser.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Les conditions Enterprise sont nécessaires pour résidence UE/Inde, SLA/DPA et toute discussion on-premise. Traiter ZDR, HIPAA et BAA comme attributs contractés séparément ; ne pas classer l’accès standard comme souverain.

Build vs. Buy

Option buy/test prioritaire pour la direction vocale Où est Ava ?, non pour l’achat d’un avatar vidéo. Comparer TTS-2 et Flash sur les mêmes scènes françaises ; la souveraineté nécessite une revue contractuelle Enterprise.

Risque de lock-in

Les modèles propriétaires et la plateforme full-stack créent un certain lock-in. La compatibilité drop-in avec l'API Realtime OpenAI réduit le coût de migration. Les prix compétitifs réduisent le risque de dépendance.

Alignement roadmap

Fort alignement avec la couche voix Où est Ava ? : le contexte inter-tours peut soutenir la continuité et Voice Direction peut modifier une interprétation sans réenregistrement. Valider consignes françaises, non-verbaux, visèmes et timing vidéo de bout en bout avant adoption.

Vérification de cette fiche

Vérifiée le 6 septembre 2026

Inworld Realtime TTS-2 announcement and documentation, 31 Aug–6 Sep 2026. Published TTFB is server-side P90; no score or Où est Ava ? latency is inferred from it.

Note de mise à jour : Realtime TTS-2 et Flash vérifiés le 6 septembre 2026 : disponibilité, TTFB P90 serveur (100/20 ms), direction libre, non-verbaux, contexte audio, 200+ langues et tarifs de $25/$15 On-Demand à $12.50/$7 Growth. Les tests français et Où est Ava ? restent à réaliser.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026