EN DIRECT
CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage22/09/26|FleXray : un modèle généraliste pour segmenter les radiographies du corps entier22/09/26|Anthropic dévoile Claude Opus 5.522/09/26 · Anthropic|Des documents judiciaires révèlent des propos internes accablants sur le scraping de contenu par l'IA19/09/26|L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Google DeepMind ajoute une mémoire côté serveur sécurisée à Private AI Compute23/09/26 · Google DeepMind|Google DeepMind ajoute la synthèse vocale à Gemini 3.823/09/26 · Google DeepMind|NVIDIA lance Nemotron 3 Diarization pour identifier les locuteurs en temps réel23/09/26 · NVIDIA|OpenAI élargit l'accès de son programme Daybreak à l'Ukraine pour la cyberdéfense civile23/09/26 · OpenAI|OpenAI mise sur des influenceurs pour redorer son image publique23/09/26 · OpenAI|Claude Code ne lirait le fichier AGENTS.md que si la télémétrie est activée23/09/26 · Anthropic|CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage22/09/26|FleXray : un modèle généraliste pour segmenter les radiographies du corps entier22/09/26|Anthropic dévoile Claude Opus 5.522/09/26 · Anthropic|Des documents judiciaires révèlent des propos internes accablants sur le scraping de contenu par l'IA19/09/26|L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Google DeepMind ajoute une mémoire côté serveur sécurisée à Private AI Compute23/09/26 · Google DeepMind|Google DeepMind ajoute la synthèse vocale à Gemini 3.823/09/26 · Google DeepMind|NVIDIA lance Nemotron 3 Diarization pour identifier les locuteurs en temps réel23/09/26 · NVIDIA|OpenAI élargit l'accès de son programme Daybreak à l'Ukraine pour la cyberdéfense civile23/09/26 · OpenAI|OpenAI mise sur des influenceurs pour redorer son image publique23/09/26 · OpenAI|Claude Code ne lirait le fichier AGENTS.md que si la télémétrie est activée23/09/26 · Anthropic|
Recherche

CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage

Une nouvelle technique de compaction de contexte permettrait de réduire jusqu'à 50 % le coût des agents de codage sur de longues sessions, tout en maintenant ou améliorant leurs performances sur des benchmarks comme Terminal-Bench et KernelBench.

22 septembre 20263 min de lecturePublié pararXiv

Des chercheurs présentent CliffCompaction, une technique d'autocompaction destinée aux agents de codage qui doivent traiter des millions de tokens de contexte au fil de sessions successives. Le problème visé est bien connu : les fenêtres de contexte limitées obligent à compresser régulièrement l'historique des échanges, ce qui dégrade souvent la fidélité de l'information et donc les performances de l'agent sur le long terme.

La spécificité de CliffCompaction réside dans son approche conservatrice de la compression : plutôt que de reformuler ou de réécrire le contenu passé, la méthode se contente de tronquer ou de supprimer des passages, sans jamais reformuler. Autre principe clé, aucune compaction n'est appliquée à une compaction précédente — chaque passe ne traite que du contenu original, et les sorties déjà compressées sont écartées. Cette contrainte vise à empêcher l'accumulation d'erreurs ou de dérives sémantiques au fil des cycles de compression successifs.

Selon les auteurs, cette approche permettrait de réduire les coûts de calcul jusqu'à 50 % à budget de contexte constant, tout en maintenant ou en améliorant les résultats sur Terminal-Bench. Le gain se traduirait aussi par une meilleure efficacité du test-time scaling parallèle : la technique ajouterait plus de 10 points de pourcentage sur Terminal-Bench pour un coût inférieur à celui de deux exécutions en contexte complet. Les auteurs rapportent également qu'elle permettrait à un modèle comme Kimi K2.6 d'égaler ou de dépasser des modèles concurrents à moindre coût dans ce cadre.

Sur KernelBench, un benchmark orienté vers l'optimisation de noyaux CUDA, CliffCompaction atteindrait des accélérations de 2,23x après 200 étapes et 3,58x après 400 étapes, des résultats présentés comme supérieurs à ceux d'algorithmes de recherche spécialisés ou d'agents entraînés spécifiquement pour cette tâche — alors qu'il s'agit ici d'une technique de compaction générique. Les auteurs publient une implémentation open source sous forme de proxy API, compatible avec plusieurs environnements d'agents comme Claude Code ou Codex, ce qui facilite potentiellement son adoption indépendamment du modèle ou du harnais utilisé.

Ces résultats, s'ils se confirment à plus grande échelle, suggèrent que la gestion fine du contexte pourrait devenir un levier d'optimisation aussi important que la taille ou l'entraînement des modèles eux-mêmes pour les agents opérant sur de longues durées.

Tags
coding-agentscontext-managementtest-time-scalingkernelbenchopen-sourcellm-efficiency
CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage · nAIvigate