OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1
2.1 : interruptions et bruit annoncés améliorés. GPT-Live-1 (10 sept.) : full-duplex à 0,05 $/min, plus le modèle derrière.
Scores comparatifs
Architecture
gpt-realtime-2.1 et GPT-Live-1 servent à comparer une architecture de tour, pas comme stack de production d’Où est Ava ? tant que le coût de session et la résidence ne sont pas rejoués en français. Les modèles de mai restent la baseline datée.
Analyse
Au 30 septembre 2026, gpt-realtime-2.1 améliore interruptions, bruit et alphanumériques selon OpenAI, et GPT-Live-1 (10 septembre) est un front vocal full-duplex à 0,05 $/min qui délègue le raisonnement. Ces ajouts ne remplacent pas le repère de mai. OpenAI a lancé 3 modèles audio le 7 mai 2026 : GPT-Realtime-2 (premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, parallel tool calls, recovery behavior amélioré), GPT-Realtime-Translate (traduction live 70+ langues → 13 sorties, 0,034$/min), GPT-Realtime-Whisper (STT streaming temps réel, 0,017$/min). GPT-Realtime-2 (high) score 15,2% plus haut sur Big Bench Audio vs GPT-Realtime-1.5. Le rang ELO 1208 annoncé en mai 2026 n’est pas l’ELO de la fiche, qui reste 1070 depuis la synchro du 18 août. Latence médiane 1,536s vs 0,864s Ultravox. EU Data Residency disponible.
Points forts
- GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5
- Contexte 128K (vs 32K pour GPT-Realtime-1.5)
- 5 niveaux de raisonnement : minimal, low, medium, high, xhigh
- Preambles : phrases de remplissage pendant le raisonnement
- Parallel tool calls audibles
- GPT-Realtime-Translate : 70+ langues → 13 sorties, 0,034$/min
- GPT-Realtime-Whisper : STT streaming temps réel, 0,017$/min
- ELO fiche 1070 (synchro du 18 août) — le rang 1208 de mai n’est pas repris
- EU Data Residency disponible
- +15,2% Big Bench Audio vs GPT-Realtime-1.5 (high)
Limitations
- Pas de clonage vocal
- Pas de souveraineté (cloud US par défaut)
- GPT-Realtime-2 : 32$/1M input + 64$/1M output audio tokens (coûteux à l'échelle)
- 1,536s latence médiane (vs 0,864s Ultravox)
- Pas d'on-premise
Capacités vocales
No voice cloning. Pre-built voices uniquement.
Le ton est piloté par les instructions de session, avec choix de voix et de vitesse.
Comment : `instructions`, `voice` et `speed` (0,25–1,5) sur la session Realtime.
À tester : Les instructions de ton restent générales : tester une matrice de scènes plutôt que supposer une émotion stable.
WebSocket streaming. Full-duplex. Contexte 128K (vs 32K pour GPT-Realtime-1.5). Preambles (phrases de remplissage pendant le raisonnement). Parallel tool calls audibles. 5 niveaux de raisonnement : minimal, low (défaut), medium, high, xhigh. 1.536s median latency (vs 0.864s Ultravox).
No native lip-sync data.
Tarification
gpt-realtime-2.1 : $32/1M tokens audio entrée et $64/1M sortie, comme le palier 2 déjà noté. 2.1-mini : $10 / $20. GPT-Live-1 : $0,05/min pour la couche voix, plus le modèle de raisonnement derrière. Translate $0,034/min et Whisper $0,017/min restent les tarifs de mai.
Souveraineté & Conformité
Cloud only. EU Data Residency disponible pour applications EU (Realtime API).
Résidence des données : US (default). EU Data Residency disponible (Realtime API).
Positionnement de OpenAI Realtime (gpt-realtime-2.1) + GPT-Live-1
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
7 mai 2026 : OpenAI lance GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15,2% Big Bench Audio), GPT-Realtime-Translate (70+ langues → 13 sorties, 0,034$/min) et GPT-Realtime-Whisper (STT streaming, 0,017$/min). Référence qualité Phase 1 MVP, non adapté à la production Phase 2 (pas de souveraineté, pas de clonage vocal).
A. Positionnement stratégique
Client cible : Developer / Enterprise — GPT-5 reasoning voice agents, traduction live, STT streaming
7 mai 2026 : 3 nouveaux modèles audio. GPT-Realtime-2 (raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement, preambles, +15,2% Big Bench Audio). GPT-Realtime-Translate (70+ langues → 13 sorties, 0,034$/min). GPT-Realtime-Whisper (STT streaming, 0,017$/min).
B. Avantage concurrentiel
- GPT-Realtime-2 : premier modèle vocal avec raisonnement GPT-5, contexte 128K, 5 niveaux de raisonnement
- Preambles : phrases de remplissage audibles pendant le raisonnement pour maintenir l'immersion
- GPT-Realtime-Translate : traduction live 70+ langues → 13 sorties, 0,034$/min
- Marque et écosystème OpenAI — adoption massive des développeurs et confiance
Vulnérabilité : Cloud uniquement — pas d'option on-premise. Coût élevé. Préoccupations de souveraineté des données UE. Exposition légale/réglementaire d'OpenAI.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Cloud uniquement avec résidence des données UE limitée. La juridiction américaine d'OpenAI crée un risque souveraineté pour les déploiements réglementés Suisse/UE.
Build vs. Buy
Acheter pour la Phase 1 si le raisonnement GPT-4o est requis. Pour la souveraineté Phase 2, basculer vers une stack open-source (Ultravox + Kokoro/Chatterbox).
Risque de lock-in
L'intégration profonde GPT-4o crée un fort lock-in d'écosystème. Les coûts de migration sont élevés si le raisonnement LLM est central dans la conception de l'agent vocal.
Alignement roadmap
Bon pour le prototypage Phase 1 avec GPT-4o. Incompatible avec les exigences de souveraineté Phase 2 sans changements architecturaux majeurs.
Vérification de cette fiche
OpenAI announcement 7 mai 2026 + Artificial Analysis TTS Arena
Note de mise à jour : 30 septembre 2026 : gpt-realtime-2.1 et GPT-Live-1 ajoutés. ELO 1070 du 18 août conservé. Le +30 points Full Duplex Bench est un chiffre OpenAI.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026