NVIDIA Parakeet TDT 0.6B v3
Open-weights ASR — 25 European languages, timestamps, NVIDIA GPU deployment
Scores comparatifs
Architecture
Candidat pour une piste ASR souveraine multi-européenne en Phase 2. Le WER et le RTFx batch publiés justifient une comparaison contrôlée avec Audiogami/Whisper sur le matériau français et suisse du projet ; valider le comportement par chunks de 2s, l’endpointing, la latence de queue mono-stream et l’exploitation GPU complète avant de remplacer un fournisseur streaming.
Analyse
Parakeet TDT 0.6B v3 est le modèle ASR multilingue open weights de NVIDIA pour 25 langues européennes. Sa fiche modèle publie 6,34% de WER moyen sur le Hugging Face Open ASR Leaderboard, dont 1,93% sur LibriSpeech test-clean, ainsi que des résultats français FLEURS, MLS et CoVoST. Le rapport technique NVIDIA publie aussi un débit batch RTFx de 3332,74 : sur le même protocole, l’instantané Parakeet à 6,32% devance Whisper large-v3 à 7,44% tout en traitant environ 22,9× plus vite. NVIDIA documente des chunks de deux secondes pour l’intégration, mais aucune TTFA conversationnelle P50/P95 ; endpointing, latence de queue, diarisation et coût GPU restent à valider sur le déploiement retenu.
Points forts
- 25 langues européennes dont le français
- Open weights sous CC-BY-4.0
- Timestamps mot à mot et par segment
- Ponctuation et capitalisation
- Auto-hébergeable avec NeMo / stack GPU NVIDIA
- Guidance NVIDIA publiée pour les audios longs
Limitations
- Pas de TTFA P50/P95 ni de latence de queue mono-stream publiée
- Le streaming par chunks exige une intégration et une stratégie d’endpointing
- Pas de diarisation native documentée pour le modèle de base
- Dépendance GPU NVIDIA pour le chemin de production documenté
- Coût d’infrastructure à mesurer par déploiement
Capacités STT
NVIDIA documents chunked streaming inference for TDT 0.6B v3 through a NeMo script: 2s chunks, 2s right context and 10s left context. This is an integration configuration, not a published TTFA P50/P95 measurement. Endpointing and operations remain implementation responsibilities; Riva/NIM documents a separate Parakeet CTC 0.6B microservice.
25+ langues
Tarification
Model weights are available under CC-BY-4.0. GPU, storage, operations and support costs are infrastructure-dependent and not shown as a universal hourly price.
| Plan | Abonnement/mois | Inclus | Dépassement/min |
|---|---|---|---|
Auto-hébergé — infrastructure à mesurerRecommandé Dimensionner la capacité GPU sur un test de charge représentatif | Gratuit | GPU / CapEx to measure | — |
Souveraineté & Conformité
Full self-hosting possible with the published weights. Production performance and data residency depend on the selected NVIDIA GPU environment and operations stack.
Résidence des données : Full control when self-hosted; compliance remains an operator responsibility.
Open weights. Self-host with NeMo or NeMo-Speech.cpp; Riva/NIM documents a separate Parakeet CTC 0.6B production path. NVIDIA GPU sizing and deployment validation remain required.
Open weights. Self-host with NeMo or NeMo-Speech.cpp; Riva/NIM documents a separate Parakeet CTC 0.6B production path. NVIDIA GPU sizing and deployment validation remain required.
Vérification de cette fiche
NVIDIA Parakeet TDT 0.6B v3 model card + technical report (Hugging Face Open ASR Leaderboard)
Note de mise à jour : 30 septembre 2026 : Moondream Parakeet Redux (178 Mo, CPU) et Ultra (GPU) sont notés, licence CC-BY-4.0, 25 langues. Ils ne remplacent pas cette fiche NVIDIA. Mesures du 19 août conservées : 6,34 % WER moyen, 1,93 % LibriSpeech test-clean, RTFx 3332,74.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis