EN DIRECT
Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|
🇨🇳 Chine generalistSortie juillet 2026

Kimi K3

Moonshot AI
Open-sourceSelf-host
Verdict

Une option solide pour l'auto-hébergement et le contrôle total des données.

Présentation

Kimi K3, signé Moonshot AI, est le premier modèle ouvert de classe 3T : 2,8 billions de paramètres (104B activés), architecture MoE à 896 experts, et un contexte d'1 million de tokens en multimodal natif (texte, image, vidéo). Il vise le travail agentique long-terme — codage, recherche, automatisation de bureau. Limite réelle : ses résultats de connaissance brute (HLE-Full) restent derrière ceux de Claude Fable 5. Poids ouverts sous licence Kimi K3, déployable sur serveur GPU européen, mais taille et origine chinoise imposent une gouvernance attentive.

Profil de compétences

Non communiqué

Forces

  • Très long contexte
  • Open-source et auto-hébergeable

Limites

  • Pas de garantie RGPD native
  • Tarification API non publiée

À qui ça s'adresse

Pour vous si…
  • vous voulez maîtriser vos coûts ou auto-héberger
À éviter si…
  • vous manipulez des données sensibles européennes

Cas d'usage idéaux

  • Codage long-terme autonome
  • Recherche documentaire approfondie
  • Automatisation de bureau
  • Analyse vidéo et image
  • Orchestration d'agents multi-outils

Accès & disponibilité

Auto-hébergeable (poids ouverts)

Caractéristiques clés

Contexte
1M
Prix entrée
Prix sortie
Vitesse
Prix non auditéBenchmarks non audités

Confidentialité

Non conforme RGPD

Faire tourner en local

Serveur GPU dédié2.6M11k
QuantizationDisqueRAM / VRAMMatériel type
Q4 · recommandé1596 Go1758 GoInfra GPU serveur (H100/A100…)
Q8 · équilibré2996 Go3298 GoInfra GPU serveur (H100/A100…)
FP16 · qualité max5600 Go6162 GoInfra GPU serveur (H100/A100…)

Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).

Déployer

Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.

Mémoire estimée · FP16 6162 Go · Q4 1758 Go2 GPU

Serveur OpenAI-compatible pour la production sur GPU NVIDIA.

pip install vllm
vllm serve moonshotai/Kimi-K3 \
  --max-model-len 32768 \
  --tensor-parallel-size 2 \
  --dtype auto
moonshotai/Kimi-K3
Données avancées · pour experts
Architecture, modalités, coût détaillé, benchmarks complets
Architecture
MoE
Taille
2800B (MoE, 104B actifs)
Date de coupe
Entrées
text
Sorties
text
Licence
kimi-k3
Hébergement
Score d'hallucination
Coût estimé (API)
Échange type (~3k entrée / 1k sortie)
Non communiqué
1M entrée + 1M sortie
Non communiqué
Tous les benchmarks
Arena Elo
MMLU
GPQA
HumanEval
SWE-Bench
MATH

Modèles similaires