Google Gemini 3.5 Transcribe
Live API STT — streaming bidirectionnel, 85+ locales, VAD hybride et vocabulaire personnalisé
Scores comparatifs
Architecture
Candidat à une comparaison STT streaming contrôlée pour Où est Ava ?, lorsque VAD hybride, vocabulaire français personnalisé et texte intermédiaire peuvent améliorer le timing des tours. Tester la limite de 10 minutes, la latence de finalisation, les interruptions et les noms de personnages français avant un usage dans une expérience live. Pour les enregistrements du Dilemme Plastique, comparer diarisation/timestamps de la voie fichiers avec une transcription verbatim, sans supposer que le modèle live couvre les mêmes fonctions.
Analyse
Google Gemini 3.5 Transcribe sépare la reconnaissance en direct de la transcription des enregistrements. Gemini 3.5 Transcribe Live diffuse des textes intermédiaires et finalisés via la Live API, avec VAD automatique, hybride ou manuelle et vocabulaire personnalisé. Le modèle fichiers ajoute diarisation et timestamps mot-à-mot, indisponibles dans le flux live. Google annonce des WER propres au modèle, mais sur un protocole différent des benchmarks du portail ; précision comparative et latence de bout en bout restent à mesurer. Les deux voies sont des services cloud Gemini Developer API, et non Google Cloud Speech-to-Text v2/Chirp.
Points forts
- STT Live API bidirectionnelle dédiée avec textes intermédiaires et finalisés
- 85+ locales, détection automatique et alternance de langues
- VAD hybride : le client peut finaliser un tour sur son signal de silence
- Jusqu’à 1 000 termes de vocabulaire personnalisé
- La voie fichiers ajoute diarisation et timestamps mot-à-mot
- Intégrations Live API : LiveKit, Pipecat, Agora et Vercel
Limitations
- Pas de TTFA P50/P95 ni de latence de dialogue bout-à-bout publiée
- Sessions live limitées à 10 minutes
- Pas de diarisation ni timestamps mot-à-mot en live
- Le mode smart est incompatible avec diarisation et timestamps mot-à-mot
- Cloud uniquement : résidence et rétention Gemini API à évaluer séparément
- WER Google non comparable au benchmark commun du portail
Capacités STT
Live API WebSocket : textes intermédiaires et finalisés, détection automatique ou indice BCP-47, vocabulaire personnalisé et VAD automatique/hybride/manuelle. Session continue limitée à 10 min ; aucune TTFA P50/P95 traçable n’est publiée.
85+ langues
Tarification
Gemini 3.5 Transcribe Live : ~0,009$/min, soit ~0,54$/h à partir des taux audio+texte estimés par Google. Fichiers (Interactions API) : ~0,005$/min, soit ~0,30$/h. Les deux tarifs Developer API sont des estimations basées sur les tokens ; ils ne sont pas les tarifs Cloud STT v2/Chirp.
Souveraineté & Conformité
Cloud API only. Operator must assess the Google data path, retention and compliance terms for the chosen account and region.
Résidence des données : No regional residency claim is carried over from Cloud STT v2; verify the Gemini API terms and deployment path for the intended use.
Gemini Developer API cloud only. No on-premise option documented for these models.
Positionnement de Google Gemini 3.5 Transcribe
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Gemini 3.5 Transcribe apporte une piste de comparaison STT Live API crédible, notamment lorsque VAD hybride et vocabulaire personnalisé influencent le timing des tours — mais le WER Google et la latence de dialogue totale ne sont pas des preuves sur benchmark commun, et le service reste cloud-only.
A. Positionnement stratégique
Client cible : Developers building real-time and recorded-audio workflows in the Gemini API ecosystem
Gemini 3.5 Transcribe sépare la transcription live de l’audio enregistré, avec VAD hybride, vocabulaire personnalisé, diarisation et timestamps selon la voie choisie.
B. Avantage concurrentiel
- STT Live API dédiée, avec texte intermédiaire et final dans une connexion bidirectionnelle
- VAD hybride et vocabulaire personnalisé offrent des points de contrôle conversationnels
- La voie audio enregistré ajoute diarisation et timestamps mot-à-mot
Vulnérabilité : Risque de lock-in fournisseur avec Google Cloud. Les modèles open-source rattrapent. Pas d'option on-premise en dehors de partenariats spécifiques.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Frontière continentale UE disponible mais cloud uniquement. La dépendance à Google Cloud crée un risque souveraineté pour les déploiements réglementés Suisse/UE.
Build vs. Buy
Acheter pour les exigences multilingues Phase 1. Pour la souveraineté Phase 2, basculer vers Whisper/Voxtral auto-hébergé pour éliminer la dépendance Google.
Risque de lock-in
L'intégration profonde dans l'écosystème Google Cloud crée un fort lock-in. Les coûts de migration sont élevés si Vertex AI ou Gemini sont également utilisés.
Alignement roadmap
Bon pour la transcription multilingue Phase 1. Incompatible avec les exigences de souveraineté Phase 2 sans changements architecturaux majeurs.
Vérification de cette fiche
Google Gemini 3.5 Transcribe announcement and API documentation — common-protocol benchmark pending
Note de mise à jour : Vérifié le 31 août 2026 : Gemini 3.5 Transcribe Live ($0,005/min audio + $0,004/min texte, ~0,009$/min) et Gemini 3.5 Transcribe fichiers ($0,003 + $0,002/min, ~0,005$/min). Les WER Google 4,0% live / 2,6% fichiers sont cités dans la fiche mais exclus du score comparatif, faute de protocole commun. Limites live : 10 min, sans diarisation ni timestamps mot-à-mot.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis