AssemblyAI Universal-3.6 Pro Realtime
universal-3-6-pro (29 sept. 2026) — 32 langues, 0,45 $/h, endpointing d’entités. WER fiche inchangé.
Scores comparatifs
Architecture
Voice Agent API très pertinent pour GamiWays Phase 1 : pipeline complet en 1 WebSocket simplifie l'architecture. Tool calling permet d'intégrer un RAG sur la base de connaissances GamiWays. Pas de clonage vocal natif : intégrer ElevenLabs ou Cartesia via TTS externe. Référence précision WER pour benchmarking.
Analyse
Le 29 septembre 2026, AssemblyAI a sorti Universal-3.6 Pro Realtime (`universal-3-6-pro`) : 32 langues, 0,45 $/h, endpointing sensible aux entités. Le WER anglais de 5,19 % est un protocole éditeur et n’est pas le WER comparatif de la fiche. Contexte antérieur : AssemblyAI a lancé sa Voice Agent API le 29 avril 2026 : pipeline complet STT+LLM+TTS en une seule connexion WebSocket à 4,50$/h forfait. Universal-3 Pro Streaming est le modèle STT temps réel avec détection de tour sémantique+acoustique, barge-in natif et reprise de session. Le tool calling (JSON Schema) permet d'intégrer un RAG custom (Pinecone, LlamaIndex, etc.) via function calling — pas de RAG natif mais intégration externe complète. Pas de clonage vocal natif : les voix sont prédéfinies (18+ voix EN/multilingue), mais il est possible d'intégrer un TTS externe (ElevenLabs, Cartesia) pour un clone vocal custom. Fonctionnalités LeMUR (résumé, Q&R, sentiment) disponibles sur les transcriptions.
Points forts
- Voice Agent API : pipeline complet en 1 WebSocket, 4,50$/h forfait
- Universal-3 Pro Streaming : détection de tour sémantique+acoustique, barge-in natif
- Tool calling → RAG custom intégrable (Pinecone, LlamaIndex, etc.)
- Reprise de session 30s, mise à jour config en direct mid-conversation
- 4,9% WER Universal-2 — meilleure précision cloud
- 99 langues, diarisation, LeMUR AI (résumé, Q&R, sentiment)
- GDPR, SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS
Limitations
- Pas de clonage vocal natif — voix prédéfinies (TTS externe intégrable)
- Pas de RAG natif — tool calling + infrastructure RAG externe requis
- Cloud uniquement — pas d'option on-premise
- LLM du Voice Agent API non personnalisable nativement
- 4,50$/h Voice Agent API — coût élevé pour usage intensif
Capacités STT
universal-3-6-pro : même endpoint streaming, nom de modèle à changer. Endpointing qui garde le tour ouvert sur une entité. Latence médiane d’endpoint 537 ms, chiffre AssemblyAI, identique à 3.5 Pro.
32+ langues
Tarification
universal-3-6-pro : 0,45 $/h selon AssemblyAI le 29 septembre 2026. Le 0,57 $/h Pipecat de juin et le Voice Agent à 4,50 $/h restent des repères antérieurs.
| Plan | Abonnement/mois | Inclus | Dépassement/min | Topup |
|---|---|---|---|---|
Gratuit Limite de 5 nouveaux streams/min sur le tier gratuit | Gratuit | $50 free credit | $0.0025 | — |
Pay As You GoRecommandé Concurrence illimitée — pas de limite de streams documentée | Gratuit | None | $0.0025 | Oui |
Souveraineté & Conformité
Cloud only. No on-premise. EU data residency available (GDPR, SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS).
Résidence des données : US (default). EU data residency disponible. SOC 2 Type 2, ISO 27001, HIPAA, PCI DSS.
Cloud only. No on-premise option. EU data residency available.
Positionnement de AssemblyAI Universal-3.6 Pro Realtime
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
AssemblyAI est le leader de l'intelligence audio — précision #1 sur le leaderboard Hugging Face, 30% moins d'hallucinations, suite complète PII/diarisation. Résidence des données UE Dublin disponible mais l'absence de on-premise limite la souveraineté Phase 2.
A. Positionnement stratégique
Client cible : Developer / Enterprise — audio intelligence, voice agents, Fortune 500
Classé #1 sur le Hugging Face Open ASR Leaderboard avec Universal-3 Pro — 30% moins d'hallucinations que les concurrents, suite complète d'intelligence audio.
B. Avantage concurrentiel
- #1 sur le Hugging Face Open ASR Leaderboard — Universal-3 Pro avec 30% moins d'hallucinations
- Suite complète d'intelligence audio : diarisation, rédaction PII, modération de contenu
- SOC 2 Type 2, PCI-DSS 4.0 Level 1, ISO 27001 en cours — conformité entreprise
Vulnérabilité : Whisper open-source rattrape en qualité. Coûts de migration élevés si profondément intégré. Pas d'option on-premise complète.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Résidence des données UE à Dublin disponible. Pas de on-premise complet. Les certifications de conformité solides réduisent le risque réglementaire.
Build vs. Buy
Acheter pour la Phase 1 (meilleure précision, suite d'intelligence audio). Pour la souveraineté Phase 2, évaluer Whisper auto-hébergé pour la transcription de base.
Risque de lock-in
L'API orientée développeur crée une dépendance d'intégration. Les fonctionnalités de la suite d'intelligence audio augmentent les coûts de migration.
Alignement roadmap
Bon pour les agents vocaux et l'intelligence audio Phase 1. La souveraineté Phase 2 nécessite des alternatives auto-hébergées pour le contrôle total des données.
Vérification de cette fiche
AssemblyAI Voice Agent API launch (Apr 29, 2026) + pricing page
Note de mise à jour : Universal-3.6 Pro Realtime vérifié le 30 septembre 2026 : modèle universal-3-6-pro, 32 langues, 0,45 $/h, endpoint 537 ms (éditeur). Le WER AA/Pipecat de la fiche n’est pas écrasé.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis