EN DIRECT
OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Un compilateur GPU accélère jusqu'à 80 fois le calcul de regret contrefactuel10/09/26|Anthropic publie son rapport de septembre 2026 sur les usages malveillants de l'IA10/09/26 · Anthropic|Skild AI utilise la plateforme Physical AI de NVIDIA pour apprendre aux robots de nouvelles tâches à partir d'une seule vidéo10/09/26 · Skild AI|NVIDIA détaille son rôle de fournisseur technologique pour les leaders du robotaxi10/09/26 · NVIDIA|Un chercheur utilise Codex et ChatGPT pour traquer de nouvelles molécules antimicrobiennes10/09/26 · OpenAI|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Un compilateur GPU accélère jusqu'à 80 fois le calcul de regret contrefactuel10/09/26|Anthropic publie son rapport de septembre 2026 sur les usages malveillants de l'IA10/09/26 · Anthropic|Skild AI utilise la plateforme Physical AI de NVIDIA pour apprendre aux robots de nouvelles tâches à partir d'une seule vidéo10/09/26 · Skild AI|NVIDIA détaille son rôle de fournisseur technologique pour les leaders du robotaxi10/09/26 · NVIDIA|Un chercheur utilise Codex et ChatGPT pour traquer de nouvelles molécules antimicrobiennes10/09/26 · OpenAI|
Recherche

Un compilateur GPU accélère jusqu'à 80 fois le calcul de regret contrefactuel

GPU-CFR compile les jeux à information imparfaite en flux de données statique rejouable via CUDA Graph, dépassant les meilleures implémentations CPU et GPU existantes sur les jeux de taille moyenne à grande.

10 septembre 20263 min de lecturePublié pararXiv

La minimisation de regret contrefactuel (CFR) est un algorithme central pour résoudre les jeux à information imparfaite, notamment le poker. Curieusement, cet algorithme comptait parmi les rares charges de calcul intensif où les processeurs classiques battaient encore les GPU : chaque itération parcourt un arbre de jeu pouvant compter des milliards d'états via de multiples petites opérations de lecture et d'écriture dispersées, ce qui sature les GPU en surcharge de lancement de noyaux plutôt qu'en calcul utile.

Une équipe de chercheurs propose GPU-CFR, un compilateur et un environnement d'exécution qui exploitent une observation simple : pour un jeu donné, la séquence complète d'opérations d'une itération CFR est connue à l'avance, seules les valeurs numériques évoluant d'une itération à l'autre. Le système compile donc le jeu une seule fois en un flux de données statique — tableaux d'arêtes et d'ensembles d'information, indices précalculés, passes regroupées par niveau de profondeur — réduisant jusqu'à 18 fois le nombre d'opérations de framework nécessaires.

Cette structure figée permet d'utiliser CUDA Graph Replay : l'itération est enregistrée une fois puis rejouée par un unique lancement de graphe, sans repasser par le dispatch habituel. Sur un GPU A100, testé sur huit jeux couvrant cartes, dés et plateaux, GPU-CFR affiche des gains de 29,8 à 80,4 fois par rapport aux meilleures implémentations GPU précédentes, et de 14 à 258 fois par rapport à LiteEFG, une référence CPU open-source, sur les quatre jeux les plus volumineux.

Fait notable, une grande partie du gain provient de la compilation elle-même plutôt que du matériel : sur huit threads CPU sans accélérateur, la version optimisée reste 2,2 à 51,1 fois plus rapide que la référence GPU initiale, tout en reproduisant les résultats de référence au bit près. Ce travail illustre comment repenser la compilation d'un algorithme, plutôt que simplement le porter sur GPU, peut débloquer des gains de performance significatifs pour des charges de calcul jugées jusque-là mal adaptées à ce matériel.

Tags
cfrgame-theorygpu-computingcudacompiler-designperformance

À lire aussi