Fish Audio OpenAudio S1
Pay-as-you-go voice cloning — 70% cheaper than ElevenLabs
Scores comparatifs
Architecture
Bon rapport coût/qualité pour le MVP Phase 1. Option auto-hébergement S1-mini alignée avec les exigences de souveraineté. Clonage vocal inclus sans frais supplémentaires est un avantage significatif.
Analyse
Fish Audio OpenAudio S1 est classé #6 sur Artificial Analysis (ELO 1128, mai 2026). Clonage vocal inclus au même prix que le TTS de base — sans frais supplémentaires. 70% moins cher qu'ElevenLabs. Les poids open-source de S1-mini permettent l'auto-hébergement pour les déploiements souverains.
Points forts
- ELO 1128 — rang #6
- Clonage vocal inclus sans frais
- 70% moins cher qu'ElevenLabs
- S1-mini open-source pour auto-hébergement
- 13 langues
Limitations
- ~200ms TTFA (plus lent que Cartesia)
- Pas de données lip-sync natives
- Documentation limitée
Capacités vocales
Voice cloning included at no extra cost. 10-second audio sample. 70% cheaper than ElevenLabs for equivalent quality.
Large répertoire de tags émotionnels et non-verbaux, complété par une prosodie de vitesse et volume.
Comment : Objet `prosody` (`speed`, `volume`), tags `[happy]`, `[sad]`, `[whispering]`, `[laughing]`, `[break]` et paramètres d’échantillonnage.
À tester : Tester la stabilité des tags en WebSocket et la pertinence linguistique avant de l’utiliser dans une scène sensible.
Streaming API available. ~200ms TTFA.
No native lip-sync timestamps.
Tarification
$15/1M chars. Pay-as-you-go, no subscription. Voice cloning included at same price.
Souveraineté & Conformité
Cloud API. S1-mini weights available for self-hosting.
Résidence des données : US/Asia
Positionnement de Fish Audio OpenAudio S1
Au-delà des specs techniques : où se positionne cet outil dans l'écosystème, quels sont les risques et les enjeux stratégiques pour GamiWays ?
Fish Audio est le disrupteur open-source : clonage vocal de niveau entreprise avec contrôle d'émotion en langage naturel, disponible à la fois comme API cloud et modèle auto-hébergeable — le chemin le plus clair de la rapidité Phase 1 à la souveraineté Phase 2.
A. Positionnement stratégique
Client cible : Developer / SMB / Enterprise — voice cloning, multilingual content
Modèle open-source S2 avec API cloud — clonage vocal et expressivité de niveau entreprise à une fraction du coût d'ElevenLabs.
B. Avantage concurrentiel
- Modèle open-source S2 (auto-hébergeable) + API cloud — flexibilité de déploiement dual
- Balises d'émotion en langage naturel — contrôle d'expressivité supérieur vs SSML
- 50% de revenus provenant des entreprises — fort signal d'adoption institutionnelle
Vulnérabilité : Pas de certifications de conformité explicites (SOC2, HIPAA). Le marché open-source en évolution rapide pourrait être perturbé par des concurrents mieux financés.
E. Questions stratégiques pour GamiWays
Fit souveraineté
Le modèle open-source S2 permet l'auto-hébergement complet dans l'infrastructure Suisse/UE. Pas de certifications de conformité pour l'API cloud, mais le chemin auto-hébergé est clair.
Build vs. Buy
Construire (auto-héberger S2) pour la souveraineté Phase 2. Acheter (API cloud) pour la rapidité Phase 1. Le meilleur des deux mondes.
Risque de lock-in
Le modèle open-source S2 élimine le lock-in fournisseur. L'API cloud a un lock-in modéré mais l'alternative auto-hébergée est toujours disponible.
Alignement roadmap
Excellent : API cloud pour la rapidité Phase 1, S2 auto-hébergé pour la souveraineté Phase 2. Chemin de migration naturel.
Vérification de cette fiche
Artificial Analysis Speech Leaderboard + Fish Audio docs, 2026
Note de mise à jour : ELO 1124 du 18 août conservé (nom AA : Fish Audio S2 Pro). Le 30 septembre, aucun article Fish n’a été relu pour promouvoir S2.1 Pro : la fiche reste OpenAudio S1. Les labels d’émotion STT ne sont pas ajoutés.
Cette date concerne les prix, capacités et notes propres à cette fiche. Les benchmarks de comparaison suivent la synchronisation et la méthode indiquées dans le bloc au-dessus.
Benchmarks ELO / indices : Artificial Analysis · Dernière sync API : 18 août 2026