Chatterbox
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Chatterbox, développé par Resemble AI, est un modèle de synthèse vocale open source à 500 millions de paramètres, bâti sur une architecture Llama 3. Il couvre 23 langues avec clonage de voix et un curseur d'exagération émotionnelle, complété par six finetunes dédiés (chinois, espagnol, portugais, hindi) pour les usages exigeants. La licence est affichée MIT, mais les conditions d'usage commercial restent floues, à vérifier avant tout déploiement en production. Auto-hébergé, il tourne sur une simple machine de développeur et garde toutes les voix traitées en local, quel que soit le pays de l'éditeur.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Clonage de voix produit
- Doublage multilingue de contenus
- Agents vocaux IA
- Prototypage audio local
- Localisation de vidéos
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 0.3 Go | 2 Go | Tout PC/Mac récent |
| Q8 · équilibré | 0.5 Go | 3 Go | Tout PC/Mac récent |
| FP16 · qualité max | 1 Go | 3 Go | Tout PC/Mac récent |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajustez le contexte et le nombre de GPU à votre machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve ResembleAI/chatterbox \
--max-model-len 32768 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |