Des chercheurs présentent CliffCompaction, une technique d'autocompaction destinée aux agents de codage qui doivent traiter des millions de tokens de contexte au fil de sessions successives. Le problème visé est bien connu : les fenêtres de contexte limitées obligent à compresser régulièrement l'historique des échanges, ce qui dégrade souvent la fidélité de l'information et donc les performances de l'agent sur le long terme.
La spécificité de CliffCompaction réside dans son approche conservatrice de la compression : plutôt que de reformuler ou de réécrire le contenu passé, la méthode se contente de tronquer ou de supprimer des passages, sans jamais reformuler. Autre principe clé, aucune compaction n'est appliquée à une compaction précédente — chaque passe ne traite que du contenu original, et les sorties déjà compressées sont écartées. Cette contrainte vise à empêcher l'accumulation d'erreurs ou de dérives sémantiques au fil des cycles de compression successifs.
Selon les auteurs, cette approche permettrait de réduire les coûts de calcul jusqu'à 50 % à budget de contexte constant, tout en maintenant ou en améliorant les résultats sur Terminal-Bench. Le gain se traduirait aussi par une meilleure efficacité du test-time scaling parallèle : la technique ajouterait plus de 10 points de pourcentage sur Terminal-Bench pour un coût inférieur à celui de deux exécutions en contexte complet. Les auteurs rapportent également qu'elle permettrait à un modèle comme Kimi K2.6 d'égaler ou de dépasser des modèles concurrents à moindre coût dans ce cadre.
Sur KernelBench, un benchmark orienté vers l'optimisation de noyaux CUDA, CliffCompaction atteindrait des accélérations de 2,23x après 200 étapes et 3,58x après 400 étapes, des résultats présentés comme supérieurs à ceux d'algorithmes de recherche spécialisés ou d'agents entraînés spécifiquement pour cette tâche — alors qu'il s'agit ici d'une technique de compaction générique. Les auteurs publient une implémentation open source sous forme de proxy API, compatible avec plusieurs environnements d'agents comme Claude Code ou Codex, ce qui facilite potentiellement son adoption indépendamment du modèle ou du harnais utilisé.
Ces résultats, s'ils se confirment à plus grande échelle, suggèrent que la gestion fine du contexte pourrait devenir un levier d'optimisation aussi important que la taille ou l'entraînement des modèles eux-mêmes pour les agents opérant sur de longues durées.