Dia 1.6B
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Dia 1.6B est un modèle de synthèse vocale de Nari Labs qui génère des dialogues à partir d'un script, avec gestion des tons, du clonage de voix et de sons non-verbaux (rires, soupirs, toux). Le projet, sous licence Apache 2.0, est encore jeune : il ne produit que de l'anglais, exige environ 10 Go de VRAM sur GPU (pas de support CPU ni de version quantifiée pour l'instant) et ne garantit pas une voix stable sans prompt audio ou seed fixe. Hébergé en local, il garde toutes les données sur l'infrastructure de l'utilisateur, quel que soit le pays de l'éditeur.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- génération de dialogues vocaux
- prototypage de podcasts
- clonage de voix contrôlé
- effets sonores non-verbaux
- TTS interne sur GPU local
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 0.9 Go | 3 Go | Tout PC/Mac récent |
| Q8 · équilibré | 1.7 Go | 4 Go | Tout PC/Mac récent |
| FP16 · qualité max | 3.2 Go | 6 Go | Tout PC/Mac récent |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajustez le contexte et le nombre de GPU à votre machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve nari-labs/Dia-1.6B \
--max-model-len 32768 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |