ToolEn hausseéditeur officiel
vLLM
Tool : produit autonome, s’utilise directement
Moteur de service haute performance pour servir des LLM à plusieurs utilisateurs en parallèle.
Le choix production dès que plusieurs personnes tapent sur le même modèle.
Score global
9.1 /10
Sécu : rien à signaler
Utilité
9.0
Fiabilité
10.0
Sécurité
10.0
Facilité
Technique · Technique
En pratique
- Prix
- Gratuit
- Usage commercial
- Usage commercial : oui
- Disponible sur
- linux, docker, cli
- Licence
- Apache-2.0
Sécurité et données
- Pastille
- Sécu : rien à signaler
- Vos données
- Données en local
- Maintenance
- Active
- Dernière release
- 9 septembre 2026
Fiche vérifiée le 13 septembre 2026 · ajoutée le 1 juin 2023
Comment installer vLLM
1. Sur une machine Linux avec GPU NVIDIA et Python 3.10+, créez un environnement virtuel.
2. Installez vLLM avec pip, puis servez un modèle Hugging Face avec la commande ci-dessous.
3. L'API compatible OpenAI écoute sur http://localhost:8000/v1.
4. Pour la production : Docker officiel, plusieurs GPU avec --tensor-parallel-size, et un gateway devant.
pip install vllm && vllm serve meta-llama/Llama-3.2-3B-Instruct