EN DIRECT
Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|
🇨🇳 Chine💻 CodeSortie août 2026

GLM-5.3

Zhipu AI
Open-sourceSelf-host
Verdict

Une option solide pour l'auto-hébergement et le contrôle total des données.

Présentation

GLM-5.3 reprend le socle de GLM-5.2 et concentre le post-entraînement sur le code complexe et les tâches agentiques longues, avec +50% sur le Code Bench interne de Z.ai et un état de l'art open-weights sur Terminal Bench 3.0. Sa capacité cyber émergente, utile en détection de vulnérabilités, appelle aussi à la prudence. Limite: sur plusieurs benchmarks agentiques il reste derrière GPT-5.6 Sol. Poids ouverts et licence commerciale permettent un déploiement sur serveur européen, données locales, mais 753 milliards de paramètres exigent un parc GPU serveur conséquent.

Profil de compétences

Non communiqué

Forces

  • Très long contexte
  • Open-source et auto-hébergeable

Limites

  • Pas de garantie RGPD native
  • Tarification API non publiée

À qui ça s'adresse

Pour vous si…
  • vous codez avec un agent ou en autonomie
  • vous voulez maîtriser vos coûts ou auto-héberger
À éviter si…
  • vous manipulez des données sensibles européennes

Cas d'usage idéaux

  • Agents de code complexes
  • Automatisation DevSecOps
  • Détection de vulnérabilités
  • Tâches longues multi-étapes
  • Déploiement souverain on-premise

Accès & disponibilité

Auto-hébergeable (poids ouverts)

Caractéristiques clés

Contexte
1M
Prix entrée
Prix sortie
Vitesse
Prix non auditéBenchmarks non audités

Confidentialité

Non conforme RGPD

Faire tourner en local

Serveur GPU dédié304k2k
QuantizationDisqueRAM / VRAMMatériel type
Q4 · recommandé429.2 Go474 GoInfra GPU serveur (H100/A100…)
Q8 · équilibré805.7 Go888 GoInfra GPU serveur (H100/A100…)
FP16 · qualité max1506 Go1659 GoInfra GPU serveur (H100/A100…)

Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).

Déployer

Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.

Mémoire estimée · FP16 1659 Go · Q4 474 Go2 GPU

Serveur OpenAI-compatible pour la production sur GPU NVIDIA.

pip install vllm
vllm serve zai-org/GLM-5.3 \
  --max-model-len 32768 \
  --tensor-parallel-size 2 \
  --dtype auto
zai-org/GLM-5.3
Données avancées · pour experts
Architecture, modalités, coût détaillé, benchmarks complets
Architecture
MoE
Taille
753B (MoE, 40B actifs)
Date de coupe
Entrées
text
Sorties
text
Licence
glm-5.3
Hébergement
Score d'hallucination
Coût estimé (API)
Échange type (~3k entrée / 1k sortie)
Non communiqué
1M entrée + 1M sortie
Non communiqué
Tous les benchmarks
Arena Elo
MMLU
GPQA
HumanEval
SWE-Bench
MATH

Modèles similaires