🇺🇸 États-Unis🧠 GénéralisteSortie avril 2025
Llama 4 Scout
Meta
Open-sourceGratuitSelf-host
Verdict
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Llama 4 Scout est le record absolu du contexte (10 millions de tokens) sur un modèle déployable sur un GPU. Idéal pour analyser des bases entières de documents. Sa version MoE active 17B params seulement, donc rapide même sur du hardware accessible.
Profil de compétences
Arena Elo1290
Benchmarks vérifiés
MMLU80%
HumanEval84%
Que signifient ces scores ?
MMLU80%excellent
Connaissances générales réparties sur des dizaines de matières académiques.
HumanEval84%excellent
Génération de code Python à partir de spécifications.
Forces
- Très bonne qualité en français
- Très long contexte
- Dispose d'un tier gratuit
- Open-source et auto-hébergeable
Limites
- Pas de garantie RGPD native
À qui ça s'adresse
Pour vous si…
- vous voulez maîtriser vos coûts ou auto-héberger
- vous travaillez en français
À éviter si…
- vous manipulez des données sensibles européennes
Cas d'usage idéaux
- Documents géants (millions de tokens)
- Self-host modeste
- Recherche
- Apps avec contraintes hardware moyennes
Accès & disponibilité
API payante au tokenTier gratuit disponibleAuto-hébergeable (poids ouverts)
Caractéristiques clés
Contexte
10M
Prix entrée
$0.40 $/M
Prix sortie
$1.20 $/M
Vitesse
90 tok/s
Prix non auditéBenchmarks non audités
Estimez votre coût mensuel
Tarifs API au token$21/ mois avec Llama 4 Scout
Pour le même usage
- GPT-5$108+428%
- Claude Sonnet 4.6$196+857%
- Grok 4$256+1150%
Estimation indicative sur les tarifs API standard (hors cache, batch et remises volume). Vérifiez toujours la grille officielle avant de vous engager.
Confidentialité
Non conforme RGPDHébergement : US/selfDonnées anonymisables
Faire tourner en local
Serveur GPU dédié722k1k
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 62.1 Go | 70 Go | Mac Studio 96-128 Go / 4× GPU |
| Q8 · équilibré | 116.6 Go | 130 Go | Infra GPU serveur (H100/A100…) |
| FP16 · qualité max | 218 Go | 242 Go | Infra GPU serveur (H100/A100…) |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
🤗 Hugging Face
ollama run llama4:scout
Données avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
Données avancées · pour experts
Architecture, modalités, coût détaillé, benchmarks complets
Architecture
MoE
Taille
109B (17B actifs MoE)
Date de coupe
nov. 2024
Entrées
text, image
Sorties
text, code
Licence
llama-community
Hébergement
US/self
Score d'hallucination
3/5
Coût estimé (API)
Échange type (~3k entrée / 1k sortie)
≈ $0.0024
1M entrée + 1M sortie
≈ $1.60
Tous les benchmarks
| Arena Elo | 1290 |
| MMLU | 80.0% |
| GPQA | — |
| HumanEval | 84.0% |
| SWE-Bench | — |
| MATH | — |