GamiWays
Cloud API#8 Artificial AnalysisCommercial

OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1

2.1 : interruptions et bruit annoncés améliorés. GPT-Live-1 (10 sept.) : full-duplex à 0,05 $/min, plus le modèle derrière.

300 ms
TTFA (best case)
700 ms
TTFA (typical)
Free
Price per million chars
1070
ELO Score

Comparative Scores

Voice quality4/10
Latency6/10
Voice cloning1/10
Expressiveness8/10
Performance direction7/10
Sovereignty2/10
Price accessibility3/10
Multilingual9/10

Architecture

ArchitectureGPT-5-class multimodal (speech-to-speech, integrated LLM) — GPT-Realtime-2
ParametersN/A (cloud, GPT-5 scale)
Languages70
Self-hostable No
Streaming Yes
GamiWays
Phase 1 MVP — Référence benchmark + Traduction multilingue

gpt-realtime-2.1 and GPT-Live-1 are architecture comparisons for turn-taking, not a production stack for Où est Ava ? until full session cost and residency are remeasured in French. The May models remain the dated baseline.

Analysis

Au 30 septembre 2026, gpt-realtime-2.1 améliore interruptions, bruit et alphanumériques selon OpenAI, et GPT-Live-1 (10 septembre) est un front vocal full-duplex à 0,05 $/min qui délègue le raisonnement. Ces ajouts ne remplacent pas le repère de mai. OpenAI a lancé 3 modèles audio le 7 mai 2026 : GPT-Realtime-2 (premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, parallel tool calls, recovery behavior amélioré), GPT-Realtime-Translate (traduction live 70+ langues input → 13 output, $0.034/min), GPT-Realtime-Whisper (STT streaming temps réel, $0.017/min). GPT-Realtime-2 (high) score 15.2% plus haut sur Big Bench Audio vs GPT-Realtime-1.5. GPT-Realtime-2 (xhigh) score 13.8% plus haut sur Audio MultiChallenge. Le rang ELO 1208 annoncé en mai 2026 n’est pas l’ELO de la fiche, qui reste 1070 depuis la synchro du 18 août. 1.536s median latency vs 0.864s Ultravox. EU Data Residency disponible.

Strengths

  • GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5
  • Contexte 128K (vs 32K pour GPT-Realtime-1.5)
  • 5 niveaux de raisonnement : minimal, low, medium, high, xhigh
  • Preambles : phrases de remplissage pendant le raisonnement
  • Parallel tool calls audibles ("checking your calendar")
  • GPT-Realtime-Translate : 70+ langues input → 13 output, $0.034/min
  • GPT-Realtime-Whisper : STT streaming temps réel, $0.017/min
  • ELO fiche 1070 (synchro du 18 août) — le rang 1208 de mai n’est pas repris
  • EU Data Residency disponible
  • +15.2% Big Bench Audio vs GPT-Realtime-1.5 (high)

Weaknesses

  • Pas de clonage vocal
  • Pas de souveraineté (cloud US par défaut)
  • GPT-Realtime-2 : $32/1M input + $64/1M output audio tokens (coûteux à l'échelle)
  • 1.536s median latency (vs 0.864s Ultravox)
  • Pas d'on-premise

Voice Capabilities

Voice Cloning No

No voice cloning. Pre-built voices uniquement.

Emotion & performance directionInstruction-based direction

Tone is steered through session instructions, with voice and speed selection.

How: `instructions`, `voice` and `speed` (0.25–1.5) on the Realtime session.

Validate: Tone instructions remain general: test a scene matrix rather than assume stable emotion.

Streaming Yes

WebSocket streaming. Full-duplex. Contexte 128K (vs 32K pour GPT-Realtime-1.5). Preambles (phrases de remplissage pendant le raisonnement). Parallel tool calls audibles. 5 niveaux de raisonnement : minimal, low (défaut), medium, high, xhigh. 1.536s median latency (vs 0.864s Ultravox).

Lip-sync Data No

No native lip-sync data.

Pricing

Price / 1M chars
Free
Price / minute
from $0.1000
depending on plan
Free tier
API credits on signup

gpt-realtime-2.1 : $32/1M tokens audio entrée et $64/1M sortie, comme le palier 2 déjà noté. 2.1-mini : $10 / $20. GPT-Live-1 : $0,05/min pour la couche voix, plus le modèle de raisonnement derrière. Translate $0,034/min et Whisper $0,017/min restent les tarifs de mai.

Sovereignty & Compliance

On-premise No

Cloud only. EU Data Residency disponible pour applications EU (Realtime API).

GDPR Compliant

Data residency: US (default). EU Data Residency disponible (Realtime API).

Strategic & Business Analysis

OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1 — Strategic Positioning

Beyond technical specs: where does this tool sit in the ecosystem, what are the risks and strategic implications for GamiWays?

7 mai 2026 : OpenAI lance GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15.2% Big Bench Audio), GPT-Realtime-Translate (70+ langues → 13 output, $0.034/min) et GPT-Realtime-Whisper (STT streaming, $0.017/min). Référence qualité Phase 1 MVP, non adapté à la production Phase 2 (pas de souveraineté, pas de clonage vocal).

Cloud SaaS only
Lock-in risk:High
Sovereignty fit:Low
Open-source threat:High
Pricing:Falling ↓

A. Strategic Positioning

Target customer: Developer / Enterprise — GPT-5 reasoning voice agents, traduction live, STT streaming

7 mai 2026 : 3 nouveaux modèles audio. GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15.2% Big Bench Audio). GPT-Realtime-Translate (70+ langues → 13 output, $0.034/min). GPT-Realtime-Whisper (STT streaming, $0.017/min).

B. Competitive Moat

  • GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement
  • Preambles : phrases de remplissage audibles pendant le raisonnement pour maintenir l'immersion
  • GPT-Realtime-Translate : traduction live 70+ langues → 13 output, $0.034/min
  • OpenAI brand and ecosystem — massive developer adoption and trust

Vulnerability: Cloud-only — no on-premise option. High cost. EU data sovereignty concerns. OpenAI's legal/regulatory exposure.

E. Strategic Questions for GamiWays

Sovereignty fit

Cloud-only with limited EU data residency. OpenAI's US jurisdiction creates sovereignty risk for Swiss/EU regulated deployments.

Build vs. Buy

Buy for Phase 1 if GPT-4o reasoning is required. For Phase 2 sovereignty, switch to open-source stack (Ultravox + Kokoro/Chatterbox).

Lock-in risk

Deep GPT-4o integration creates strong ecosystem lock-in. Switching costs are high if LLM reasoning is core to the voice agent design.

Roadmap alignment

Good for Phase 1 prototyping with GPT-4o. Incompatible with Phase 2 sovereignty requirements without major architectural changes.

This sheet's verification

Verified 30 September 2026

OpenAI announcement 7 mai 2026 + Artificial Analysis TTS Arena

Update note: 30 septembre 2026 : gpt-realtime-2.1 et GPT-Live-1 ajoutés. ELO 1070 du 18 août conservé. Le +30 points Full Duplex Bench est un chiffre OpenAI.

This date covers provider-specific prices, capabilities and notes. Comparative benchmarks follow the synchronization and methodology shown above.

ELO benchmarks / indices: Artificial Analysis · Last API sync : 18 August 2026