Voxtral Small 24B
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Voxtral Small reprend le socle texte de Mistral Small 3 et y ajoute une brique audio complète : transcription, traduction et compréhension de la parole, avec appel de fonctions directement depuis la voix. Il tient jusqu'à 30 minutes d'audio en transcription et 40 minutes en analyse, dans huit langues dont le français et l'allemand. Limite réelle : les invites système ne sont pas encore supportées, et le mode texte-audio en bf16 réclame environ 55 Go de VRAM. Sous licence Apache 2.0, il tourne entièrement sur votre infrastructure : les données audio ne quittent jamais vos serveurs.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Transcription réunions multilingues
- Résumé automatique d'appels
- Assistant vocal métier
- Automatisation par commande vocale
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 13.7 Go | 17 Go | PC 32 Go / Mac 24 Go / RTX 4070 Ti+ |
| Q8 · équilibré | 25.7 Go | 30 Go | Mac 64 Go / bi-GPU 24 Go |
| FP16 · qualité max | 48 Go | 55 Go | Mac Studio 96-128 Go / 4× GPU |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajustez le contexte et le nombre de GPU à votre machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve mistralai/Voxtral-Small-24B-2507 \
--max-model-len 32000 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |