StepAudio 2.5 TTS
Contextual TTS — ELO 1187, dual-level context control, zero-shot voice cloning in 3 sec
Scores comparatifs
Architecture
Qualité exceptionnelle pour le storytelling et le contenu émotionnel (ELO #3). Le contrôle dual-level est un différenciateur unique pour la performance de personnages GamiWays. Cependant, la juridiction chinoise et l'absence de conformité RGPD sont des facteurs bloquants pour les clients suisses/EU. Recommandé pour le benchmarking qualité et les cas d'usage non-sensibles uniquement.
Analyse
StepAudio 2.5 TTS (lancé le 16 avril 2026) est classé #3 mondial sur l'Artificial Analysis Speech Arena (ELO 1187). Premier modèle à intégrer la compréhension contextuelle dans toute la pipeline de génération vocale. Contrôle dual-level : Global Context définit le ton global d'un passage ; Inline Context utilise des parenthèses pour un contrôle fin par phrase (émotion, pauses, respiration). Clonage vocal zero-shot à partir de 3 secondes d'audio de référence. 100+ langues. Prix : $0,85/10K chars ($0,064/min). step-tts-2 (standard) : $0,40/10K chars ($0,030/min). Entreprise chinoise (StepFun, Shanghai) — pas de RGPD/souveraineté.
Points forts
- ELO 1187 — rang #3 mondial (Artificial Analysis)
- Contrôle dual-level (Global + Inline Context)
- Clonage vocal zero-shot à partir de 3 sec
- 100+ langues avec identité crosslinguale
- step-tts-2 à $0,030/min — prix compétitif
Limitations
- Entreprise chinoise — pas de RGPD, pas de résidence EU
- Pas d'option on-premise
- $85/1M chars (flagship) — cher vs Inworld ($42/1M)
- Pas de timestamps lip-sync
- Max 1000 chars par requête
Capacités vocales
Zero-shot voice cloning from just 3 seconds of reference audio. Full Global/Inline context control inherited by cloned voice. $1.50/voice.
Une instruction globale et des parenthèses par phrase séparent l’intention de jeu du texte prononcé.
Comment : `instruction`, `voice`, `input` et contexte inline comme `(voix basse, retenue)`.
À tester : Vérifier le support linguistique, la conformité et la constance avant une utilisation sensible dans Où est Ava ?
WebSocket streaming via /v1/realtime/audio. Non-streaming POST /v1/audio/speech also available.
No native lip-sync timestamps. External aligner required.
Tarification
$0.85/10K chars ($85/1M chars). Voice cloning: $1.50/voice. step-tts-2 (standard): $0.40/10K chars ($40/1M chars).
Souveraineté & Conformité
Cloud-only. StepFun is a Shanghai-based company (Chinese jurisdiction).
Résidence des données : China (StepFun servers, Shanghai). No EU data residency option.
Vérification de cette fiche
Artificial Analysis Speech Arena, May 2026
Note de mise à jour : AA Speech Arena sync 2026-08-18: ELO 1205 (rank N/A — Free tier). Name: StepAudio 2.5 TTS.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026