GamiWays
API CloudCommercial

AssemblyAI Universal-3.6 Pro Realtime

universal-3-6-pro (29 sept. 2026) — 32 langues, 0,45 $/h, endpointing d’entités. WER fiche inchangé.

150ms
Latence (meilleur cas)
300ms
Latence (typique)
3.1%
WER (audio général)
$0.0075/min
Prix par minute

Scores comparatifs

Précision (WER)10/10
Latence streaming7/10
Multilingue10/10
Souveraineté1/10
Accessibilité prix5/10
Qualité streaming9/10

Architecture

ArchitectureUniversal-3 Pro (prompt-based transformer, domain customization sans retraining). Universal-3 Pro Streaming (u3-rt-pro) pour voice agents temps réel. Voice Agent API = WebSocket unique STT+LLM+TTS.
ParamètresN/A (cloud)
Langues32+
Auto-hébergeable No
Streaming Oui
WER audio propre 1.1%
GamiWays
Voice Agent Pipeline — Accuracy reference

Voice Agent API très pertinent pour GamiWays Phase 1 : pipeline complet en 1 WebSocket simplifie l'architecture. Tool calling permet d'intégrer un RAG sur la base de connaissances GamiWays. Pas de clonage vocal natif : intégrer ElevenLabs ou Cartesia via TTS externe. Référence précision WER pour benchmarking.

Analyse

Le 29 septembre 2026, AssemblyAI a sorti Universal-3.6 Pro Realtime (`universal-3-6-pro`) : 32 langues, 0,45 $/h, endpointing sensible aux entités. Le WER anglais de 5,19 % est un protocole éditeur et n’est pas le WER comparatif de la fiche. Contexte antérieur : AssemblyAI a lancé sa Voice Agent API le 29 avril 2026 : pipeline complet STT+LLM+TTS en une seule connexion WebSocket à 4,50$/h forfait. Universal-3 Pro Streaming est le modèle STT temps réel avec détection de tour sémantique+acoustique, barge-in natif et reprise de session. Le tool calling (JSON Schema) permet d'intégrer un RAG custom (Pinecone, LlamaIndex, etc.) via function calling — pas de RAG natif mais intégration externe complète. Pas de clonage vocal natif : les voix sont prédéfinies (18+ voix EN/multilingue), mais il est possible d'intégrer un TTS externe (ElevenLabs, Cartesia) pour un clone vocal custom. Fonctionnalités LeMUR (résumé, Q&R, sentiment) disponibles sur les transcriptions.

Points forts

  • Voice Agent API : pipeline complet en 1 WebSocket, 4,50$/h forfait
  • Universal-3 Pro Streaming : détection de tour sémantique+acoustique, barge-in natif
  • Tool calling → RAG custom intégrable (Pinecone, LlamaIndex, etc.)
  • Reprise de session 30s, mise à jour config en direct mid-conversation
  • 4,9% WER Universal-2 — meilleure précision cloud
  • 99 langues, diarisation, LeMUR AI (résumé, Q&R, sentiment)
  • GDPR, SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS

Limitations

  • Pas de clonage vocal natif — voix prédéfinies (TTS externe intégrable)
  • Pas de RAG natif — tool calling + infrastructure RAG externe requis
  • Cloud uniquement — pas d'option on-premise
  • LLM du Voice Agent API non personnalisable nativement
  • 4,50$/h Voice Agent API — coût élevé pour usage intensif

Capacités STT

Streaming Oui

universal-3-6-pro : même endpoint streaming, nom de modèle à changer. Endpointing qui garde le tour ouvert sur une entité. Latence médiane d’endpoint 537 ms, chiffre AssemblyAI, identique à 3.5 Pro.

Diarisation Oui
Vocabulaire personnalisé Oui
Timestamps mot-à-mot Oui
Ponctuation auto Oui
Multilingue Oui

32+ langues

Tarification

Prix / minute
à partir de $0.0075
selon l'abonnement souscrit
Prix / heure
à partir de $0.450
selon l'abonnement souscrit
Offre gratuite
$50 credit on signup — no credit card required

universal-3-6-pro : 0,45 $/h selon AssemblyAI le 29 septembre 2026. Le 0,57 $/h Pipecat de juin et le Voice Agent à 4,50 $/h restent des repères antérieurs.

PlanAbonnement/moisInclusDépassement/minTopup
Gratuit

Limite de 5 nouveaux streams/min sur le tier gratuit

Gratuit$50 free credit$0.0025—
Pay As You GoRecommandé

Concurrence illimitée — pas de limite de streams documentée

GratuitNone$0.0025Oui
Topup disponible : Certains plans permettent d'acheter des minutes supplémentaires (topup) sans changer de plan. Utile pour les pics d'utilisation ponctuels.

Souveraineté & Conformité

On-premise No

Cloud only. No on-premise. EU data residency available (GDPR, SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS).

GDPR Conforme

Résidence des données : US (default). EU data residency disponible. SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS.

On-premise No

Cloud only. No on-premise option. EU data residency available.

Analyse stratégique & business

Positionnement de AssemblyAI Universal-3.6 Pro Realtime

Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?

AssemblyAI est le leader de l'intelligence audio — précision #1 sur le leaderboard Hugging Face, 30% moins d'hallucinations, suite complète PII/diarisation. Résidence des données UE Dublin disponible mais l'absence de on-premise limite la souveraineté Phase 2.

Cloud + VPC
Risque lock-in :Moyen
Souveraineté :Moyen
Menace open-source :Moyen
Prix :Commoditisation ↓↓

A. Positionnement stratégique

Client cible : Developer / Enterprise — audio intelligence, voice agents, Fortune 500

Classé #1 sur le Hugging Face Open ASR Leaderboard avec Universal-3 Pro — 30% moins d'hallucinations que les concurrents, suite complète d'intelligence audio.

B. Avantage concurrentiel

  • #1 sur le Hugging Face Open ASR Leaderboard — Universal-3 Pro avec 30% moins d'hallucinations
  • Suite complète d'intelligence audio : diarisation, rédaction PII, modération de contenu
  • SOC 2 Type 2, PCI-DSS 4.0 Level 1, ISO 27001 en cours — conformité entreprise

Vulnérabilité : Whisper open-source rattrape en qualité. Coûts de migration élevés si profondément intégré. Pas d'option on-premise complète.

E. Questions stratégiques pour GamiWays

Fit souveraineté

Résidence des données UE à Dublin disponible. Pas de on-premise complet. Les certifications de conformité solides réduisent le risque réglementaire.

Build vs. Buy

Acheter pour la Phase 1 (meilleure précision, suite d'intelligence audio). Pour la souveraineté Phase 2, évaluer Whisper auto-hébergé pour la transcription de base.

Risque de lock-in

L'API orientée développeur crée une dépendance d'intégration. Les fonctionnalités de la suite d'intelligence audio augmentent les coûts de migration.

Alignement roadmap

Bon pour les agents vocaux et l'intelligence audio Phase 1. La souveraineté Phase 2 nécessite des alternatives auto-hébergées pour le contrôle total des données.

Vérification de cette fiche

Vérifiée le 30 septembre 2026

AssemblyAI Voice Agent API launch (Apr 29, 2026) + pricing page

Note de mise à jour : Universal-3.6 Pro Realtime vérifié le 30 septembre 2026 : modèle universal-3-6-pro, 32 langues, 0,45 $/h, endpoint 537 ms (éditeur). Le WER AA/Pipecat de la fiche n’est pas écrasé.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis