GamiWays

Gradium.ai

Nouveau

TTS, STT, Voice Cloning & S2S Translation — ultra-basse latence, fondateurs académiques

TTSSTTVoice CloningS2S TranslationOn-devicePhononLiveKitPipecatFrançais

01Présentation

Gradium développe des modèles de langage audio conçus pour des interactions vocales naturelles, expressives et ultra-basse latence à grande échelle. Ses fondateurs ont collectivement inventé et publié les méthodes et algorithmes derrière la plupart des modèles vocaux existants aujourd'hui — des codecs audio neuronaux aux modèles de langage audio.

L'entreprise traduit plus d'une décennie de recherche ouverte en systèmes prêts pour la production. Gradium propose TTS, STT, Voice Cloning et une fonctionnalité unique de Speech-to-Speech Translation temps réel. En juillet 2026, Gradium a levé $100M (investisseur NVIDIA) et ouvert un bureau à San Francisco, tout en lançant Phonon Multilingual — un modèle on-device de 100M paramètres couvrant 5 langues (FR/EN/DE/ES/PT), fonctionnant hors ligne sur CPU.

02Produits & capacités

TTS — Text-to-Speech
  • ·Streaming et timestamps mot par mot pour lip-sync avatar
  • ·TTFA P50 216 ms et IQR 30 ms annoncés sur Coval
  • ·81 % sur entités structurées dans cinq langues dont français (benchmark éditeur)
  • ·Clonage vocal selon plan, consentement et zone à vérifier
  • ·Code-switching multilingue mid-sentence
  • ·Phonon on-device est une voie distincte de l’API cloud
STT — Speech-to-Text
  • ·Meilleure précision du marché (revendiqué)
  • ·VAD sémantique — turn detection intelligent
  • ·Robustesse au bruit
  • ·Latence contrôlable selon le cas d'usage
  • ·Diarisation des locuteurs
  • ·Timestamps mot par mot
Gradium Translate — S2S
  • ·Speech-to-Speech Translation temps réel
  • ·Speech-to-Text Translation
  • ·5 langues : EN, FR, ES, DE, PT
  • ·Meilleur BLEU/MetricX vs Gemini et GPT-Realtime (pareto)
  • ·API WebSocket bidirectionnel
  • ·Détection automatique de la langue source

Langues supportées : Anglais, Français, Espagnol, Allemand, Portugais (Brésil) — code-switching multilingue mid-sentence sans latence supplémentaire.

02bRepères produits 2026

8 juil. 2026

Financement $100M + NVIDIA

Extension de la levée seed à $100M total. NVIDIA parmi les investisseurs. Ouverture d’un bureau à San Francisco Bay Area.

15 juil. 2026

Phonon Multilingual

Modèle on-device 100M params, 5 langues (FR/EN/DE/ES/PT). WER : FR 2.18%, DE 0.50%, ES 0.53%, PT 1.31%. Bat NVIDIA Magpie (357M) à 3.6× moins de paramètres. Fonctionne sur CPU, ~200 MB, offline.

31 août 2026

Nouveau modèle TTS

Gradium annonce 216 ms TTFA P50 et IQR 30 ms sur Coval, ainsi que 81 % sur 500 phrases d’entités structurées dans cinq langues dont le français. Ces mesures éditeur n’évaluent ni émotion, ni réseau, ni avatar vidéo.

Juil. 2026

Semantic VAD + GradBot

Turn detection sémantique (prédictions toutes les 80 ms). GradBot : framework open-source pour agents vocaux en 50 lignes de code (Rust core).

03Différenciateurs clés

Fondateurs académiques

Inventeurs des neural audio codecs et audio language models. Plus d'une décennie de recherche ouverte → production.

VAD sémantique

Turn detection intelligent basé sur le sens, pas juste la détection de silence. Critique pour les agents conversationnels naturels.

S2S Translation unique

Speech-to-Speech Translation temps réel avec meilleur BLEU/MetricX vs Gemini et GPT-Realtime à faible latence.

Intégration native LiveKit & Pipecat

Plug-and-play dans les frameworks d'agents vocaux les plus utilisés. Aucune intégration custom nécessaire.

Résidence et voie on-device

Résidence UE ou US à activer puis vérifier sur plan payant ; Phonon on-device est une voie distincte. Une entreprise française ne garantit pas un hébergement Paris ni une souveraineté automatique.

Pricing à l'usage

Système de crédits flexible. Free tier sans carte bancaire. Plan XS à $13/mois suffisant pour le prototypage.

04Pricing

Taux de crédits par service

TTS

1 crédit / caractère

1h TTS ≈ 45k crédits

STT

3 crédits / seconde

1h STT = 10,800 crédits

STT Translation

4 crédits / seconde

1h = 14,400 crédits

S2S Translation

30 crédits / seconde

1h = 108,000 crédits

Plans mensuels

PlanPrix/moisCréditsTTS heuresSTT heuresConc. TTSConc. STT
FreeSans CB$045k~1h4h23
XS$13225k~5h21h520
S$43900k~20h83h520
M$3409M~200h833h1040
L$1,61545M~1,000h4,167h1560
EnterpriseSur devis∞∞∞CustomCustom

Crédits supplémentaires : $3.8–$6.9 / 100k crédits selon le plan. Concurrence TTS : 2/5/5/10/15/Custom. Concurrence STT : 3/20/20/40/60/Custom. Source : gradium.ai/pricing (juillet 2026).

05Intégrations & stack technique

Frameworks d'agents vocaux

LiveKit AgentsIntégration native — plug-and-play
PipecatIntégration native — pipeline déclaratif

SDKs & API

Python SDKClient officiel
Rust SDKClient officiel
WebSocket APIBidirectionnel, streaming
REST APIBatch et async

Déploiement

Cloud APITous plans
Résidence UE/USPlan payant · activation + vérification
Phonon on-deviceVoie distincte de l’API cloud

Souveraineté & RGPD

· Résidence UE ou US : plan payant, activation et signal de réponse à vérifier

· Phonon on-device : voie séparée ; ne pas déduire ses garanties de l’API cloud

· ZDR, voix clonées et éventuels termes on-premise : périmètre contractuel distinct

· Entreprise française ≠ hébergement Paris ou souveraineté suisse automatique

06Pertinence pour Storygami & Edugami

1

STT pour Storygami & Edugami

VAD sémantique → turn detection naturel pour les personnages IA. Langues FR/EN/DE/ES/PT couverts. Robustesse bruit en classe ou en salle de cinéma.

2

TTS précis + lip-sync

Timestamps mot par mot et prononciation d’entités structurées servent le lip-sync avatar et le vocabulaire français. La prosodie émotionnelle des protagonistes Où est Ava ? et du mentor reste à tester, sans contrôle explicite documenté.

3

S2S Translation multilingue

Cas d'usage unique : élève francophone parle, avatar répond en anglais (ou inversement). Pertinent pour Edugami dans des contextes scolaires multilingues.

4

Intégration Infrastructure Temps Réel

Compatible LiveKit et Pipecat nativement. Aligné avec la roadmap Infrastructure Temps Réel du portail. Évaluation possible en Phase B de GamiWays Core.

5

Résidence & Edugami

Activer l’endpoint UE sur plan payant puis vérifier son signal. La résidence UE ne vaut ni résidence suisse, ni garantie automatique sur les actifs de clonage ; à évaluer selon le cadre scolaire visé.

07Questions ouvertes

  • ?Quelle est la latence TTFA réelle de Gradium TTS depuis la Suisse ? (benchmark à réaliser)
  • ?Le WER du STT Gradium est-il validé indépendamment (Pipecat benchmark, Artificial Analysis) ?
  • ?La résidence UE est-elle activée sur le plan retenu, et le signal de réponse confirme-t-il réellement la zone ?
  • ?Les pauses et la prosodie de l’API sont-elles suffisamment crédibles pour Où est Ava ?, malgré l’absence de direction émotionnelle explicite ?
  • ?Le S2S Translation est-il stable en production (latence, précision) pour un usage scolaire en FR→EN ?

Pages liées

Sources

Données vérifiées : juillet 2026.