GamiWays
Open SourceCC-BY-4.0Auto-hébergeable

NVIDIA Parakeet TDT 0.6B v3

Open-weights ASR — 25 European languages, timestamps, NVIDIA GPU deployment

3333×
Débit batch (RTFx)
2s
Chunk streaming (config.)
6.34%
WER (audio général)
Gratuit
Prix par minute

Scores comparatifs

Précision (WER)7/10
Latence streamingà mesurer
Multilingue7/10
Souveraineté10/10
Accessibilité prix9/10
Qualité streaming5/10

Architecture

ArchitectureFastConformer encoder + Token-and-Duration Transducer (TDT), NVIDIA NeMo
Paramètres0.6B
Langues25+
Auto-hébergeable Oui
Streaming Oui
WER audio propre 1.93%
GamiWays
Phase 2 — Sovereign multilingual ASR

Candidat pour une piste ASR souveraine multi-européenne en Phase 2. Le WER et le RTFx batch publiés justifient une comparaison contrôlée avec Audiogami/Whisper sur le matériau français et suisse du projet ; valider le comportement par chunks de 2s, l’endpointing, la latence de queue mono-stream et l’exploitation GPU complète avant de remplacer un fournisseur streaming.

Analyse

Parakeet TDT 0.6B v3 est le modèle ASR multilingue open weights de NVIDIA pour 25 langues européennes. Sa fiche modèle publie 6,34% de WER moyen sur le Hugging Face Open ASR Leaderboard, dont 1,93% sur LibriSpeech test-clean, ainsi que des résultats français FLEURS, MLS et CoVoST. Le rapport technique NVIDIA publie aussi un débit batch RTFx de 3332,74 : sur le même protocole, l’instantané Parakeet à 6,32% devance Whisper large-v3 à 7,44% tout en traitant environ 22,9× plus vite. NVIDIA documente des chunks de deux secondes pour l’intégration, mais aucune TTFA conversationnelle P50/P95 ; endpointing, latence de queue, diarisation et coût GPU restent à valider sur le déploiement retenu.

Points forts

  • 25 langues européennes dont le français
  • Open weights sous CC-BY-4.0
  • Timestamps mot à mot et par segment
  • Ponctuation et capitalisation
  • Auto-hébergeable avec NeMo / stack GPU NVIDIA
  • Guidance NVIDIA publiée pour les audios longs

Limitations

  • Pas de TTFA P50/P95 ni de latence de queue mono-stream publiée
  • Le streaming par chunks exige une intégration et une stratégie d’endpointing
  • Pas de diarisation native documentée pour le modèle de base
  • Dépendance GPU NVIDIA pour le chemin de production documenté
  • Coût d’infrastructure à mesurer par déploiement

Capacités STT

Streaming Oui

NVIDIA documents chunked streaming inference for TDT 0.6B v3 through a NeMo script: 2s chunks, 2s right context and 10s left context. This is an integration configuration, not a published TTFA P50/P95 measurement. Endpointing and operations remain implementation responsibilities; Riva/NIM documents a separate Parakeet CTC 0.6B microservice.

Diarisation No
Vocabulaire personnalisé No
Timestamps mot-à-mot Oui
Ponctuation auto Oui
Multilingue Oui

25+ langues

Tarification

Prix / minute
Gratuit
Prix / heure
Gratuit
Offre gratuite
Open weights; infrastructure costs excluded

Model weights are available under CC-BY-4.0. GPU, storage, operations and support costs are infrastructure-dependent and not shown as a universal hourly price.

PlanAbonnement/moisInclusDépassement/min
Auto-hébergé — infrastructure à mesurerRecommandé

Dimensionner la capacité GPU sur un test de charge représentatif

GratuitGPU / CapEx to measure—

Souveraineté & Conformité

On-premise Oui

Full self-hosting possible with the published weights. Production performance and data residency depend on the selected NVIDIA GPU environment and operations stack.

GDPR Conforme

Résidence des données : Full control when self-hosted; compliance remains an operator responsibility.

On-premise Oui

Open weights. Self-host with NeMo or NeMo-Speech.cpp; Riva/NIM documents a separate Parakeet CTC 0.6B production path. NVIDIA GPU sizing and deployment validation remain required.

Déploiement auto-hébergé

Open weights. Self-host with NeMo or NeMo-Speech.cpp; Riva/NIM documents a separate Parakeet CTC 0.6B production path. NVIDIA GPU sizing and deployment validation remain required.

Vérification de cette fiche

Vérifiée le 19 août 2026

NVIDIA Parakeet TDT 0.6B v3 model card + technical report (Hugging Face Open ASR Leaderboard)

Note de mise à jour : 30 septembre 2026 : Moondream Parakeet Redux (178 Mo, CPU) et Ultra (GPU) sont notés, licence CC-BY-4.0, 25 langues. Ils ne remplacent pas cette fiche NVIDIA. Mesures du 19 août conservées : 6,34 % WER moyen, 1,93 % LibriSpeech test-clean, RTFx 3332,74.

Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.

Benchmarks ELO / indices : Artificial Analysis