OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1
2.1 : interruptions et bruit annoncés améliorés. GPT-Live-1 (10 sept.) : full-duplex à 0,05 $/min, plus le modèle derrière.
Comparative Scores
Architecture
gpt-realtime-2.1 and GPT-Live-1 are architecture comparisons for turn-taking, not a production stack for Où est Ava ? until full session cost and residency are remeasured in French. The May models remain the dated baseline.
Analysis
Au 30 septembre 2026, gpt-realtime-2.1 améliore interruptions, bruit et alphanumériques selon OpenAI, et GPT-Live-1 (10 septembre) est un front vocal full-duplex à 0,05 $/min qui délègue le raisonnement. Ces ajouts ne remplacent pas le repère de mai. OpenAI a lancé 3 modèles audio le 7 mai 2026 : GPT-Realtime-2 (premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, parallel tool calls, recovery behavior amélioré), GPT-Realtime-Translate (traduction live 70+ langues input → 13 output, $0.034/min), GPT-Realtime-Whisper (STT streaming temps réel, $0.017/min). GPT-Realtime-2 (high) score 15.2% plus haut sur Big Bench Audio vs GPT-Realtime-1.5. GPT-Realtime-2 (xhigh) score 13.8% plus haut sur Audio MultiChallenge. Le rang ELO 1208 annoncé en mai 2026 n’est pas l’ELO de la fiche, qui reste 1070 depuis la synchro du 18 août. 1.536s median latency vs 0.864s Ultravox. EU Data Residency disponible.
Strengths
- GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5
- Contexte 128K (vs 32K pour GPT-Realtime-1.5)
- 5 niveaux de raisonnement : minimal, low, medium, high, xhigh
- Preambles : phrases de remplissage pendant le raisonnement
- Parallel tool calls audibles ("checking your calendar")
- GPT-Realtime-Translate : 70+ langues input → 13 output, $0.034/min
- GPT-Realtime-Whisper : STT streaming temps réel, $0.017/min
- ELO fiche 1070 (synchro du 18 août) — le rang 1208 de mai n’est pas repris
- EU Data Residency disponible
- +15.2% Big Bench Audio vs GPT-Realtime-1.5 (high)
Weaknesses
- Pas de clonage vocal
- Pas de souveraineté (cloud US par défaut)
- GPT-Realtime-2 : $32/1M input + $64/1M output audio tokens (coûteux à l'échelle)
- 1.536s median latency (vs 0.864s Ultravox)
- Pas d'on-premise
Voice Capabilities
No voice cloning. Pre-built voices uniquement.
Tone is steered through session instructions, with voice and speed selection.
How: `instructions`, `voice` and `speed` (0.25–1.5) on the Realtime session.
Validate: Tone instructions remain general: test a scene matrix rather than assume stable emotion.
WebSocket streaming. Full-duplex. Contexte 128K (vs 32K pour GPT-Realtime-1.5). Preambles (phrases de remplissage pendant le raisonnement). Parallel tool calls audibles. 5 niveaux de raisonnement : minimal, low (défaut), medium, high, xhigh. 1.536s median latency (vs 0.864s Ultravox).
No native lip-sync data.
Pricing
gpt-realtime-2.1 : $32/1M tokens audio entrée et $64/1M sortie, comme le palier 2 déjà noté. 2.1-mini : $10 / $20. GPT-Live-1 : $0,05/min pour la couche voix, plus le modèle de raisonnement derrière. Translate $0,034/min et Whisper $0,017/min restent les tarifs de mai.
Sovereignty & Compliance
Cloud only. EU Data Residency disponible pour applications EU (Realtime API).
Data residency: US (default). EU Data Residency disponible (Realtime API).
OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1 — Strategic Positioning
Beyond technical specs: where does this tool sit in the ecosystem, what are the risks and strategic implications for GamiWays?
7 mai 2026 : OpenAI lance GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15.2% Big Bench Audio), GPT-Realtime-Translate (70+ langues → 13 output, $0.034/min) et GPT-Realtime-Whisper (STT streaming, $0.017/min). Référence qualité Phase 1 MVP, non adapté à la production Phase 2 (pas de souveraineté, pas de clonage vocal).
A. Strategic Positioning
Target customer: Developer / Enterprise — GPT-5 reasoning voice agents, traduction live, STT streaming
7 mai 2026 : 3 nouveaux modèles audio. GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15.2% Big Bench Audio). GPT-Realtime-Translate (70+ langues → 13 output, $0.034/min). GPT-Realtime-Whisper (STT streaming, $0.017/min).
B. Competitive Moat
- GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement
- Preambles : phrases de remplissage audibles pendant le raisonnement pour maintenir l'immersion
- GPT-Realtime-Translate : traduction live 70+ langues → 13 output, $0.034/min
- OpenAI brand and ecosystem — massive developer adoption and trust
Vulnerability: Cloud-only — no on-premise option. High cost. EU data sovereignty concerns. OpenAI's legal/regulatory exposure.
E. Strategic Questions for GamiWays
Sovereignty fit
Cloud-only with limited EU data residency. OpenAI's US jurisdiction creates sovereignty risk for Swiss/EU regulated deployments.
Build vs. Buy
Buy for Phase 1 if GPT-4o reasoning is required. For Phase 2 sovereignty, switch to open-source stack (Ultravox + Kokoro/Chatterbox).
Lock-in risk
Deep GPT-4o integration creates strong ecosystem lock-in. Switching costs are high if LLM reasoning is core to the voice agent design.
Roadmap alignment
Good for Phase 1 prototyping with GPT-4o. Incompatible with Phase 2 sovereignty requirements without major architectural changes.
This sheet's verification
OpenAI announcement 7 mai 2026 + Artificial Analysis TTS Arena
Update note: 30 septembre 2026 : gpt-realtime-2.1 et GPT-Live-1 ajoutés. ELO 1070 du 18 août conservé. Le +30 points Full Duplex Bench est un chiffre OpenAI.
This date covers provider-specific prices, capabilities and notes. Comparative benchmarks follow the synchronization and methodology shown above.
ELO benchmarks / indices: Artificial Analysis · Last API sync : 18 August 2026