Gradium.ai
NouveauTTS, STT, Voice Cloning & S2S Translation — ultra-basse latence, fondateurs académiques
01Présentation
Gradium développe des modèles de langage audio conçus pour des interactions vocales naturelles, expressives et ultra-basse latence à grande échelle. Ses fondateurs ont collectivement inventé et publié les méthodes et algorithmes derrière la plupart des modèles vocaux existants aujourd'hui — des codecs audio neuronaux aux modèles de langage audio.
L'entreprise traduit plus d'une décennie de recherche ouverte en systèmes prêts pour la production. Gradium propose TTS, STT, Voice Cloning et une fonctionnalité unique de Speech-to-Speech Translation temps réel. En juillet 2026, Gradium a levé $100M (investisseur NVIDIA) et ouvert un bureau à San Francisco, tout en lançant Phonon Multilingual — un modèle on-device de 100M paramètres couvrant 5 langues (FR/EN/DE/ES/PT), fonctionnant hors ligne sur CPU.
02Produits & capacités
- ·Streaming et timestamps mot par mot pour lip-sync avatar
- ·TTFA P50 216 ms et IQR 30 ms annoncés sur Coval
- ·81 % sur entités structurées dans cinq langues dont français (benchmark éditeur)
- ·Clonage vocal selon plan, consentement et zone à vérifier
- ·Code-switching multilingue mid-sentence
- ·Phonon on-device est une voie distincte de l’API cloud
- ·Meilleure précision du marché (revendiqué)
- ·VAD sémantique — turn detection intelligent
- ·Robustesse au bruit
- ·Latence contrôlable selon le cas d'usage
- ·Diarisation des locuteurs
- ·Timestamps mot par mot
- ·Speech-to-Speech Translation temps réel
- ·Speech-to-Text Translation
- ·5 langues : EN, FR, ES, DE, PT
- ·Meilleur BLEU/MetricX vs Gemini et GPT-Realtime (pareto)
- ·API WebSocket bidirectionnel
- ·Détection automatique de la langue source
Langues supportées : Anglais, Français, Espagnol, Allemand, Portugais (Brésil) — code-switching multilingue mid-sentence sans latence supplémentaire.
02bRepères produits 2026
Financement $100M + NVIDIA
Extension de la levée seed à $100M total. NVIDIA parmi les investisseurs. Ouverture d’un bureau à San Francisco Bay Area.
Phonon Multilingual
Modèle on-device 100M params, 5 langues (FR/EN/DE/ES/PT). WER : FR 2.18%, DE 0.50%, ES 0.53%, PT 1.31%. Bat NVIDIA Magpie (357M) à 3.6× moins de paramètres. Fonctionne sur CPU, ~200 MB, offline.
Nouveau modèle TTS
Gradium annonce 216 ms TTFA P50 et IQR 30 ms sur Coval, ainsi que 81 % sur 500 phrases d’entités structurées dans cinq langues dont le français. Ces mesures éditeur n’évaluent ni émotion, ni réseau, ni avatar vidéo.
Semantic VAD + GradBot
Turn detection sémantique (prédictions toutes les 80 ms). GradBot : framework open-source pour agents vocaux en 50 lignes de code (Rust core).
03Différenciateurs clés
Fondateurs académiques
Inventeurs des neural audio codecs et audio language models. Plus d'une décennie de recherche ouverte → production.
VAD sémantique
Turn detection intelligent basé sur le sens, pas juste la détection de silence. Critique pour les agents conversationnels naturels.
S2S Translation unique
Speech-to-Speech Translation temps réel avec meilleur BLEU/MetricX vs Gemini et GPT-Realtime à faible latence.
Intégration native LiveKit & Pipecat
Plug-and-play dans les frameworks d'agents vocaux les plus utilisés. Aucune intégration custom nécessaire.
Résidence et voie on-device
Résidence UE ou US à activer puis vérifier sur plan payant ; Phonon on-device est une voie distincte. Une entreprise française ne garantit pas un hébergement Paris ni une souveraineté automatique.
Pricing à l'usage
Système de crédits flexible. Free tier sans carte bancaire. Plan XS à $13/mois suffisant pour le prototypage.
04Pricing
Taux de crédits par service
TTS
1 crédit / caractère
1h TTS ≈ 45k crédits
STT
3 crédits / seconde
1h STT = 10,800 crédits
STT Translation
4 crédits / seconde
1h = 14,400 crédits
S2S Translation
30 crédits / seconde
1h = 108,000 crédits
Plans mensuels
| Plan | Prix/mois | Crédits | TTS heures | STT heures | Conc. TTS | Conc. STT |
|---|---|---|---|---|---|---|
| FreeSans CB | $0 | 45k | ~1h | 4h | 2 | 3 |
| XS | $13 | 225k | ~5h | 21h | 5 | 20 |
| S | $43 | 900k | ~20h | 83h | 5 | 20 |
| M | $340 | 9M | ~200h | 833h | 10 | 40 |
| L | $1,615 | 45M | ~1,000h | 4,167h | 15 | 60 |
| Enterprise | Sur devis | ∞ | ∞ | ∞ | Custom | Custom |
Crédits supplémentaires : $3.8–$6.9 / 100k crédits selon le plan. Concurrence TTS : 2/5/5/10/15/Custom. Concurrence STT : 3/20/20/40/60/Custom. Source : gradium.ai/pricing (juillet 2026).
05Intégrations & stack technique
Frameworks d'agents vocaux
SDKs & API
Déploiement
Souveraineté & RGPD
· Résidence UE ou US : plan payant, activation et signal de réponse à vérifier
· Phonon on-device : voie séparée ; ne pas déduire ses garanties de l’API cloud
· ZDR, voix clonées et éventuels termes on-premise : périmètre contractuel distinct
· Entreprise française ≠ hébergement Paris ou souveraineté suisse automatique
06Pertinence pour Storygami & Edugami
STT pour Storygami & Edugami
VAD sémantique → turn detection naturel pour les personnages IA. Langues FR/EN/DE/ES/PT couverts. Robustesse bruit en classe ou en salle de cinéma.
TTS précis + lip-sync
Timestamps mot par mot et prononciation d’entités structurées servent le lip-sync avatar et le vocabulaire français. La prosodie émotionnelle des protagonistes Où est Ava ? et du mentor reste à tester, sans contrôle explicite documenté.
S2S Translation multilingue
Cas d'usage unique : élève francophone parle, avatar répond en anglais (ou inversement). Pertinent pour Edugami dans des contextes scolaires multilingues.
Intégration Infrastructure Temps Réel
Compatible LiveKit et Pipecat nativement. Aligné avec la roadmap Infrastructure Temps Réel du portail. Évaluation possible en Phase B de GamiWays Core.
Résidence & Edugami
Activer l’endpoint UE sur plan payant puis vérifier son signal. La résidence UE ne vaut ni résidence suisse, ni garantie automatique sur les actifs de clonage ; à évaluer selon le cadre scolaire visé.
07Questions ouvertes
- ?Quelle est la latence TTFA réelle de Gradium TTS depuis la Suisse ? (benchmark à réaliser)
- ?Le WER du STT Gradium est-il validé indépendamment (Pipecat benchmark, Artificial Analysis) ?
- ?La résidence UE est-elle activée sur le plan retenu, et le signal de réponse confirme-t-il réellement la zone ?
- ?Les pauses et la prosodie de l’API sont-elles suffisamment crédibles pour Où est Ava ?, malgré l’absence de direction émotionnelle explicite ?
- ?Le S2S Translation est-il stable en production (latence, précision) pour un usage scolaire en FR→EN ?
Pages liées
Sources
Données vérifiées : juillet 2026.