GamiWays
API Cloud#5 Artificial AnalysisProprietary (StepFun / 阶跃星辰)

StepAudio 2.5 TTS

Contextual TTS — ELO 1187, dual-level context control, zero-shot voice cloning in 3 sec

200 ms
TTFA (meilleur cas)
400 ms
TTFA (typique)
$85/1M
Prix par million de chars
1205
ELO Score

Scores comparatifs

Qualité vocale9/10
Latence6/10
Clonage vocal9/10
Expressivité10/10
Direction de jeu7/10
Souveraineté1/10
Accessibilité prix5/10
Multilingue9/10

Architecture

ArchitectureEnd-to-end contextual TTS (NTP-based, no speaker/emotion embeddings)
ParamètresUndisclosed
Langues100
Auto-hébergeable No
Streaming Oui
GamiWays
Benchmarking qualité — non recommandé pour production EU

Qualité exceptionnelle pour le storytelling et le contenu émotionnel (ELO #3). Le contrôle dual-level est un différenciateur unique pour la performance de personnages GamiWays. Cependant, la juridiction chinoise et l'absence de conformité RGPD sont des facteurs bloquants pour les clients suisses/EU. Recommandé pour le benchmarking qualité et les cas d'usage non-sensibles uniquement.

Analyse

StepAudio 2.5 TTS (lancé le 16 avril 2026) est classé #3 mondial sur l'Artificial Analysis Speech Arena (ELO 1187). Premier modèle à intégrer la compréhension contextuelle dans toute la pipeline de génération vocale. Contrôle dual-level : Global Context définit le ton global d'un passage ; Inline Context utilise des parenthèses pour un contrôle fin par phrase (émotion, pauses, respiration). Clonage vocal zero-shot à partir de 3 secondes d'audio de référence. 100+ langues. Prix : $0,85/10K chars ($0,064/min). step-tts-2 (standard) : $0,40/10K chars ($0,030/min). Entreprise chinoise (StepFun, Shanghai) — pas de RGPD/souveraineté.

Points forts

  • ELO 1187 — rang #3 mondial (Artificial Analysis)
  • Contrôle dual-level (Global + Inline Context)
  • Clonage vocal zero-shot à partir de 3 sec
  • 100+ langues avec identité crosslinguale
  • step-tts-2 à $0,030/min — prix compétitif

Limitations

  • Entreprise chinoise — pas de RGPD, pas de résidence EU
  • Pas d'option on-premise
  • $85/1M chars (flagship) — cher vs Inworld ($42/1M)
  • Pas de timestamps lip-sync
  • Max 1000 chars par requête

Capacités vocales

Clonage vocal Oui

Zero-shot voice cloning from just 3 seconds of reference audio. Full Global/Inline context control inherited by cloned voice. $1.50/voice.

Direction émotionnelle & jeuDirection par instructions

Une instruction globale et des parenthèses par phrase séparent l’intention de jeu du texte prononcé.

Comment : `instruction`, `voice`, `input` et contexte inline comme `(voix basse, retenue)`.

À tester : Vérifier le support linguistique, la conformité et la constance avant une utilisation sensible dans Où est Ava ?

Streaming Oui

WebSocket streaming via /v1/realtime/audio. Non-streaming POST /v1/audio/speech also available.

Données lip-sync No

No native lip-sync timestamps. External aligner required.

Tarification

Prix / 1M chars
à partir de $85
selon l'abonnement souscrit
Prix / minute
à partir de $0.0640
selon l'abonnement souscrit
Offre gratuite
No public free tier. API key required.

$0.85/10K chars ($85/1M chars). Voice cloning: $1.50/voice. step-tts-2 (standard): $0.40/10K chars ($40/1M chars).

Souveraineté & Conformité

On-premise No

Cloud-only. StepFun is a Shanghai-based company (Chinese jurisdiction).

GDPR No

Résidence des données : China (StepFun servers, Shanghai). No EU data residency option.

Vérification de cette fiche

Vérifiée le 18 août 2026

Artificial Analysis Speech Arena, May 2026

Note de mise à jour : AA Speech Arena sync 2026-08-18: ELO 1205 (rank N/A — Free tier). Name: StepAudio 2.5 TTS.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026