OpenAI a annoncé des évolutions du mécanisme de mise en cache des prompts pour GPT-6, une fonctionnalité destinée aux développeurs qui envoient des requêtes répétées contenant des portions de texte identiques, comme des instructions système ou des documents de contexte volumineux. L'entreprise indique avoir amélioré le taux de succès du cache, ce qui signifie que davantage de requêtes bénéficient désormais d'un traitement accéléré et moins coûteux, sans nécessiter de retraitement complet du prompt à chaque appel.
Parmi les nouveautés figurent des outils de diagnostic permettant aux équipes techniques de mieux comprendre quand et pourquoi le cache est ou n'est pas utilisé. Cette visibilité accrue devrait faciliter l'optimisation des architectures d'applications s'appuyant sur l'API, notamment pour les cas d'usage impliquant de longs contextes ou des appels fréquents avec des préfixes partagés, comme les agents conversationnels ou les systèmes de génération augmentée par récupération.
OpenAI introduit également des points de coupure explicites, permettant aux développeurs de définir précisément où le cache doit s'arrêter au sein d'un prompt. Ce contrôle plus fin donne davantage de prévisibilité sur le comportement du système, un aspect important pour les applications en production où la latence et les coûts doivent être maîtrisés de manière fiable plutôt qu'aléatoire.
Cette annonce s'inscrit dans une tendance plus large du secteur, où les fournisseurs de modèles de langage cherchent à réduire le coût d'exploitation des applications reposant sur de longs contextes. Anthropic et Google proposent des mécanismes similaires depuis plusieurs mois, et cette mise à jour place GPT-6 sur un pied d'égalité technique avec ses concurrents sur ce point précis. Si l'amélioration reste avant tout technique et destinée aux équipes d'ingénierie, elle peut avoir un impact direct sur les marges des entreprises qui opèrent des produits d'IA à grande échelle.