InternLM3 8B
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
InternLM3-8B-Instruct est un modèle généraliste open source doté d'un mode de raisonnement long qui le place devant Llama3.1-8B et Qwen2.5-7B sur les benchmarks de maths et de logique, malgré un entraînement limité à 4 000 milliards de tokens. Avec 8,8 milliards de paramètres et une fenêtre de 32 000 tokens, il tient sur un laptop. Sa licence Apache 2.0 autorise un déploiement on-premise en Europe, données conservées en local, mais son score en code (HumanEval) reste en retrait sur Qwen2.5-7B, un vrai point faible pour les équipes dev.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Raisonnement mathématique embarqué
- PoC souverain sur laptop
- Assistant interne on-premise
- Prototypage rapide sans cloud
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 5 Go | 7 Go | PC 16 Go / Mac M1+ / GPU 8 Go |
| Q8 · équilibré | 9.4 Go | 12 Go | PC 32 Go / Mac 24 Go / RTX 4070 Ti+ |
| FP16 · qualité max | 17.6 Go | 21 Go | Mac 32 Go / RTX 3090-4090 |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve internlm/internlm3-8b-instruct \
--max-model-len 32000 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |