GamiWays
API CloudCommercial

Google Gemini 3.5 Transcribe

Live API STT — streaming bidirectionnel, 85+ locales, VAD hybride et vocabulaire personnalisé

—
Latence (meilleur cas)
—
Latence (typique)
—
WER (audio général)
$0.0090/min
Prix par minute

Scores comparatifs

Précision (WER)à mesurer
Latence streamingà mesurer
Multilingue9/10
Souveraineté1/10
Accessibilité prix7/10
Qualité streaming8/10

Architecture

ArchitectureGemini 3.5 Transcribe Live via Live API (WebSocket) ; Gemini 3.5 Transcribe fichiers via Interactions API
ParamètresN/A (cloud)
Langues85+
Auto-hébergeable No
Streaming Oui
WER audio propre 0%
GamiWays
Live STT + recorded-audio analysis — benchmark candidate

Candidat à une comparaison STT streaming contrôlée pour Où est Ava ?, lorsque VAD hybride, vocabulaire français personnalisé et texte intermédiaire peuvent améliorer le timing des tours. Tester la limite de 10 minutes, la latence de finalisation, les interruptions et les noms de personnages français avant un usage dans une expérience live. Pour les enregistrements du Dilemme Plastique, comparer diarisation/timestamps de la voie fichiers avec une transcription verbatim, sans supposer que le modèle live couvre les mêmes fonctions.

Analyse

Google Gemini 3.5 Transcribe sépare la reconnaissance en direct de la transcription des enregistrements. Gemini 3.5 Transcribe Live diffuse des textes intermédiaires et finalisés via la Live API, avec VAD automatique, hybride ou manuelle et vocabulaire personnalisé. Le modèle fichiers ajoute diarisation et timestamps mot-à-mot, indisponibles dans le flux live. Google annonce des WER propres au modèle, mais sur un protocole différent des benchmarks du portail ; précision comparative et latence de bout en bout restent à mesurer. Les deux voies sont des services cloud Gemini Developer API, et non Google Cloud Speech-to-Text v2/Chirp.

Points forts

  • STT Live API bidirectionnelle dédiée avec textes intermédiaires et finalisés
  • 85+ locales, détection automatique et alternance de langues
  • VAD hybride : le client peut finaliser un tour sur son signal de silence
  • Jusqu’à 1 000 termes de vocabulaire personnalisé
  • La voie fichiers ajoute diarisation et timestamps mot-à-mot
  • Intégrations Live API : LiveKit, Pipecat, Agora et Vercel

Limitations

  • Pas de TTFA P50/P95 ni de latence de dialogue bout-à-bout publiée
  • Sessions live limitées à 10 minutes
  • Pas de diarisation ni timestamps mot-à-mot en live
  • Le mode smart est incompatible avec diarisation et timestamps mot-à-mot
  • Cloud uniquement : résidence et rétention Gemini API à évaluer séparément
  • WER Google non comparable au benchmark commun du portail

Capacités STT

Streaming Oui

Live API WebSocket : textes intermédiaires et finalisés, détection automatique ou indice BCP-47, vocabulaire personnalisé et VAD automatique/hybride/manuelle. Session continue limitée à 10 min ; aucune TTFA P50/P95 traçable n’est publiée.

Diarisation No
Vocabulaire personnalisé Oui
Timestamps mot-à-mot No
Ponctuation auto Oui
Multilingue Oui

85+ langues

Tarification

Prix / minute
à partir de $0.0090
selon l'abonnement souscrit
Prix / heure
à partir de $0.540
selon l'abonnement souscrit
Offre gratuite
Free tier available; limits vary by API and account

Gemini 3.5 Transcribe Live : ~0,009$/min, soit ~0,54$/h à partir des taux audio+texte estimés par Google. Fichiers (Interactions API) : ~0,005$/min, soit ~0,30$/h. Les deux tarifs Developer API sont des estimations basées sur les tokens ; ils ne sont pas les tarifs Cloud STT v2/Chirp.

Souveraineté & Conformité

On-premise No

Cloud API only. Operator must assess the Google data path, retention and compliance terms for the chosen account and region.

GDPR No

Résidence des données : No regional residency claim is carried over from Cloud STT v2; verify the Gemini API terms and deployment path for the intended use.

On-premise No

Gemini Developer API cloud only. No on-premise option documented for these models.

Analyse stratégique & business

Positionnement de Google Gemini 3.5 Transcribe

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

Gemini 3.5 Transcribe apporte une piste de comparaison STT Live API crédible, notamment lorsque VAD hybride et vocabulaire personnalisé influencent le timing des tours — mais le WER Google et la latence de dialogue totale ne sont pas des preuves sur benchmark commun, et le service reste cloud-only.

Cloud SaaS uniquement
Risque lock-in :Élevé
Souveraineté :Faible
Menace open-source :Élevé
Prix :En baisse ↓

A. Positionnement stratégique

Client cible : Developers building real-time and recorded-audio workflows in the Gemini API ecosystem

Gemini 3.5 Transcribe sépare la transcription live de l’audio enregistré, avec VAD hybride, vocabulaire personnalisé, diarisation et timestamps selon la voie choisie.

B. Avantage concurrentiel

  • STT Live API dédiée, avec texte intermédiaire et final dans une connexion bidirectionnelle
  • VAD hybride et vocabulaire personnalisé offrent des points de contrôle conversationnels
  • La voie audio enregistré ajoute diarisation et timestamps mot-à-mot

Vulnérabilité : Risque de lock-in fournisseur avec Google Cloud. Les modèles open-source rattrapent. Pas d'option on-premise en dehors de partenariats spécifiques.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Frontière continentale UE disponible mais cloud uniquement. La dépendance à Google Cloud crée un risque souveraineté pour les déploiements réglementés Suisse/UE.

Build vs. Buy

Acheter pour les exigences multilingues Phase 1. Pour la souveraineté Phase 2, basculer vers Whisper/Voxtral auto-hébergé pour éliminer la dépendance Google.

Risque de lock-in

L'intégration profonde dans l'écosystème Google Cloud crée un fort lock-in. Les coûts de migration sont élevés si Vertex AI ou Gemini sont également utilisés.

Alignement roadmap

Bon pour la transcription multilingue Phase 1. Incompatible avec les exigences de souveraineté Phase 2 sans changements architecturaux majeurs.

Vérification de cette fiche

Vérifiée le 31 août 2026

Google Gemini 3.5 Transcribe announcement and API documentation — common-protocol benchmark pending

Note de mise à jour : Vérifié le 31 août 2026 : Gemini 3.5 Transcribe Live ($0,005/min audio + $0,004/min texte, ~0,009$/min) et Gemini 3.5 Transcribe fichiers ($0,003 + $0,002/min, ~0,005$/min). Les WER Google 4,0% live / 2,6% fichiers sont cités dans la fiche mais exclus du score comparatif, faute de protocole commun. Limites live : 10 min, sans diarisation ni timestamps mot-à-mot.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis