GamiWays

Voice-to-Voice & Temps Réel

Comparer les architectures vocales globales : cascade modulaire, plateformes intégrées et modèles speech-to-speech. Les comparatifs détaillés de reconnaissance et de synthèse restent sur leurs pages dédiées.

Cadrage stratégique : lire le Voice-to-Voice en situation

La métrique qui compte

Mesurez fin de parole → premier audio, puis regardez médiane, P95 et jitter. Une latence éditeur ou un premier audio isolé ne décrivent pas les silences, reprises et variations ressentis.

La couche infrastructure

WebRTC, détection de tour, barge-in, routage audio, reconnexion et mémoire de session déterminent la continuité. Un modèle S2S ne remplace ni cette régie ni son observabilité.

Rester attentif à

Testez streams parallèles, backpressure, coût par session, résidence des données et repli vers une cascade contrôlée. L’enjeu est une conversation stable, pas seulement une démo rapide.

Méthode de lecture : choisissez d’abord le niveau de contrôle requis, comparez ensuite la latence complète dans le même réseau, puis validez interruptions, charge et repli avant d’arrêter une architecture.

Deux architectures à mettre en regard

01

Pipeline Cascade

ASR → LLM → TTS — modulaire, contrôlable, prêt pour la production

505–1150ms

Ce que cela apporte

  • Contrôle total sur chaque composant
  • Remplacement indépendant de chaque bloc
  • Clonage vocal via la couche TTS

À arbitrer

  • Latence cumulative (3 étapes séquentielles)
  • Prosodie perdue entre LLM et TTS
  • Nécessite une couche d'orchestration
02

Voix-à-Voix End-to-End

Audio direct entrée → sortie — latence minimale, prosodie naturelle

150–350ms

Ce que cela apporte

  • Latence minimale possible (150–350ms)
  • Prosodie naturelle préservée de bout en bout
  • Pas de goulot d'étranglement texte

À arbitrer

  • Pas de clonage vocal (critique pour GamiWays)
  • Contrôle limité sur le contenu/persona
  • Modèles encore en maturation (2025–2026)

Les valeurs sont des repères de conception : chaque expérience doit mesurer sa latence réelle, de la fin de parole au premier audio reçu.

Voies Voice-to-Voice à évaluer

Repères issus des fiches voix existantes. Ouvrez une ligne pour lire les avantages, limites et conditions de test.

Hume EVI 3

Speech-to-speech

< 300 ms annoncé

Boucle conversationnelle audio avec une force particulière sur l’intention émotionnelle. À tester lorsque la manière de dire prime sur la composition modulaire.

Contrôle
Fort — émotion en langage naturel
Souveraineté
Faible — cloud US
Moshi (Kyutai)

Full-duplex · R&D

200–400 ms signalés

Référence de recherche pour parler et écouter simultanément, surtout utile pour explorer interruptions, backchannels et tour de parole naturel.

Contrôle
Limité — recherche full-duplex
Souveraineté
Forte — poids ouverts
Inworld Realtime API

Plateforme unifiée

≈ 490 ms meilleur cas*

Unifie STT, routage LLM et TTS-2 en streaming. Ce n’est pas un modèle audio-à-audio pur, mais une voie de pile intégrée qui limite les sauts réseau entre composants.

Contrôle
Fort — Voice Direction + outils
Souveraineté
Partielle — on-premise Enterprise
≈ 0,70 s premier audio

Pile speech-to-speech WebSocket qui rassemble transcription, raisonnement et réponse audio. Pertinente pour mesurer les gains d’une voie intégrée face à une cascade modulaire.

Contrôle
Partiel — tags TTS à qualifier en S2S
Souveraineté
Faible — cloud US
Ultravox v0.5

Speech-to-speech open weights

0,864 s médiane référencée

Voie open weights à tester pour la souveraineté et la réduction de la sérialisation, sans lui attribuer les garanties de contrôle d’une cascade.

Contrôle
Limité — sortie moins décomposable
Souveraineté
Forte — auto-hébergeable
OpenAI gpt-realtime-2.1

Speech-to-speech

1,536 s médiane référencée

gpt-realtime-2.1 reprend la voie speech-to-speech avec, selon OpenAI, de meilleures interruptions, un meilleur bruit et les alphanumériques. Les tokens audio restent à 32 $ / 64 $ par million. La variante mini est moins chère. TurnBench ci-dessous mesure encore les VAD de la génération documentée, pas Live-1.

Contrôle
Partiel — outils + raisonnement
Souveraineté
Partielle — résidence UE
Millisecondes non publiées

Front vocal full-duplex : il écoute et parle en même temps, et délègue outils et raisonnement à un modèle arrière. 0,05 $/min pour cette couche, plus le modèle derrière. Le gain de tour annoncé contre gpt-realtime-2.1 est un chiffre OpenAI. Utile pour comparer une architecture, pas pour remplacer la cascade française.

Contrôle
Ton par prompt ; le raisonnement est délégué
Souveraineté
Faible — cloud, résidence à rejouer

Le lien décisif : l’infrastructure temps réel

Un modèle Voice-to-Voice ne remplace ni WebRTC, ni la gestion des interruptions, ni l’observabilité. Les mesures à suivre restent la fin de parole → premier audio, le barge-in, le jitter, les streams parallèles et le repli contrôlé si un service devient lent.

Comparer les réponses de l’infrastructure temps réel

Décider par scénario, puis mesurer

Pour Où est Ava ?, la cascade reste la référence lorsqu’il faut contrôler persona, texte et voix. Les voies S2S servent d’expériences comparatives sur la fluidité et l’émotion. La décision se prend sur des tests end-to-end, pas sur une seule latence éditeur.

Configurer une stack et estimer sa latence