Kokoro-82M
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Kokoro-82M est un modèle de synthèse vocale open-weight de 82 millions de paramètres, bâti sur une architecture décodeur seul StyleTTS2/ISTFTNet, sans diffusion. Il couvre 8 langues et 54 voix, entraîné sur seulement quelques centaines d'heures de données audio libres de droits, ce qui limite sa richesse expressive et sa couverture linguistique face aux gros modèles TTS propriétaires. Sous licence Apache 2.0, il tourne sans effort sur un simple laptop et, une fois auto-hébergé, conserve toutes les données vocales sur l'infrastructure de l'utilisateur, quel que soit le pays de l'éditeur.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Prototypage vocal rapide
- Assistants vocaux embarqués
- Voix off automatisées
- Lecture à voix haute accessible
- Déploiements locaux sans cloud
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 0 Go | 2 Go | Tout PC/Mac récent |
| Q8 · équilibré | 0.1 Go | 2 Go | Tout PC/Mac récent |
| FP16 · qualité max | 0.2 Go | 2 Go | Tout PC/Mac récent |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajustez le contexte et le nombre de GPU à votre machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve hexgrad/Kokoro-82M \
--max-model-len 32768 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |