faster-whisper (CTranslate2)
4× faster Whisper inference — streaming-capable, CPU/GPU, production-ready
Scores comparatifs
Architecture
Recommandé pour le pipeline ASR souverain du MVP Phase 1. 4× plus rapide que Whisper de base, streaming avec VAD. Combiner avec silero-vad pour l'endpointing temps réel. Souveraineté totale. Benchmark : 150ms vs Deepgram 75ms — compromis acceptable pour déploiement souverain suisse.
Analyse
faster-whisper est la variante production de Whisper utilisant CTranslate2 pour une inférence 4× plus rapide avec la même précision. La quantification int8 permet le déploiement CPU. Le mode streaming avec silero-vad atteint 150ms de latence. Utilisé dans les templates d'agents vocaux LiveKit.
Points forts
- 4× plus rapide que Whisper original
- Même précision 2,7% WER
- CPU viable avec int8
- Mode streaming avec VAD
- Licence MIT — souveraineté totale
- Intégration LiveKit disponible
Limitations
- 150ms latence (2× Deepgram)
- Pas de diarisation
- Configuration VAD requise pour streaming
- GPU toujours recommandé en production
Capacités STT
Streaming mode with VAD (silero-vad). 150ms latency with chunked processing. Used in whisper-streaming and LiveKit integrations.
99+ langues
Tarification
Free (self-hosted). GPU compute: ~$0.05–0.20/hour with int8.
| Plan | Abonnement/mois | Inclus | Dépassement/min |
|---|---|---|---|
Auto-hébergéRecommandé Scalez en ajoutant de la capacité GPU | Gratuit | Unlimited (infra cost only) | $0.0020 |
Souveraineté & Conformité
Full on-premise. MIT license.
Résidence des données : Full control.
Full self-hosted. 4× faster than original Whisper. CPU viable with int8 quantization.
Full self-hosted. 4× faster than original Whisper. CPU viable with int8 quantization.
Positionnement de faster-whisper (CTranslate2)
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Faster-Whisper est le multiplicateur de production pour le STT open-source : inférence 4× plus rapide, 50% moins de mémoire, licence MIT — le pont d'ingénierie entre la précision de Whisper et les exigences de déploiement temps réel.
A. Positionnement stratégique
Client cible : Developer / Enterprise — optimized inference, resource-constrained deployments
Inférence Whisper 4× plus rapide avec 50% moins de mémoire via CTranslate2 — le Whisper prêt pour la production pour les déploiements auto-hébergés.
B. Avantage concurrentiel
- Inférence 4× plus rapide que Whisper standard avec 50% moins de mémoire — optimisation de niveau production
- Optimisation CTranslate2 — fonctionne efficacement sur CPU et GPU
- Licence MIT — zéro coût de licence, utilisation commerciale complète
Vulnérabilité : Dépendant de la qualité du modèle Whisper. Maintenu par la communauté — pas de support commercial. Les nouveaux modèles optimisés peuvent supplanter.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Entièrement auto-hébergeable sur infrastructure Suisse/UE. Licence MIT. L'amélioration de vitesse 4× rend Whisper auto-hébergé viable pour les applications temps réel.
Build vs. Buy
Construire (intégrer) pour la souveraineté Phase 2. L'amélioration de vitesse 4× en fait le choix par défaut pour les déploiements Whisper auto-hébergés.
Risque de lock-in
Open-source MIT — zéro lock-in fournisseur. La dépendance à l'architecture du modèle Whisper est la seule contrainte.
Alignement roadmap
Excellent pour la souveraineté Phase 2. Rend Whisper auto-hébergé compétitif avec le STT cloud en termes de latence.
Vérification de cette fiche
SYSTRAN faster-whisper benchmarks 2025
Note de mise à jour : faster-whisper v1.1.0 (Jan 2025). 4× faster than original Whisper on GPU, 2× on CPU with int8. Streaming mode with silero-vad confirmed. LiveKit voice agent template uses faster-whisper.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis