Gemma 4 12B
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Gemma 4 12B Unified est la version encodeur-free de la famille Gemma 4 de Google DeepMind : texte, image et audio entrent directement dans un seul transformeur décodeur. Elle affiche de bons résultats en raisonnement (GPQA Diamond 78,8 %) et en code (LiveCodeBench 72 %), mais chute nettement sur les tâches les plus dures type HLE (5,2 %). Publiée sous licence Apache 2.0 avec poids ouverts, elle tourne sur un simple laptop, un vrai atout pour les organisations européennes qui veulent garder leurs données sur site.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Assistant de code local
- Agents autonomes avec function calling
- Analyse multimodale texte-image-audio
- Déploiement confidentiel sur laptop
- Support multilingue 140 langues
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 6.8 Go | 9 Go | PC 16 Go / Mac M1+ / GPU 8 Go |
| Q8 · équilibré | 12.8 Go | 16 Go | PC 32 Go / Mac 24 Go / RTX 4070 Ti+ |
| FP16 · qualité max | 24 Go | 28 Go | Mac 64 Go / bi-GPU 24 Go |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve google/gemma-4-12B-it \
--max-model-len 32768 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |