EN DIRECT
Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|
Recherche

Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme

Un nouveau harnais multi-agents découpe les problèmes de recherche en mathématiques et informatique théorique en sous-preuves vérifiables, avec des résultats notables sur des benchmarks de démonstration automatique.

14 septembre 20263 min de lecturePublié pararXiv

Des chercheurs présentent Stellar Colosseum, un système agnostique vis-à-vis du modèle de langage utilisé, conçu pour orchestrer des efforts de recherche de longue haleine en mathématiques et en informatique théorique. Plutôt que de demander à un modèle de produire une preuve d'un seul tenant, l'approche explore d'abord plusieurs stratégies possibles, puis utilise un mécanisme de "porte de maturité" pour déterminer quand une piste est suffisamment avancée pour être décomposée en sous-problèmes interdépendants au niveau des sections.

Le système génère des candidats en parallèle, les soumet à une phase de falsification ciblée, puis agrège les propositions et leurs critiques dans un document de synthèse unique via une méthode d'agrégation arborescente par échantillonnage aléatoire chevauchant. Les retours des vérificateurs sont réinjectés directement dans la partie de l'argumentation concernée, ce qui permet de corriger les erreurs sans reprendre l'ensemble du raisonnement depuis le début.

Les auteurs indiquent que ce flux de travail a été intégré au framework Teamwork de Google Antigravity sous la forme d'un motif appelé "Long Proof", suggérant une volonté de rendre cette méthodologie disponible au-delà du cadre expérimental initial. Les tests combinent recherche ouverte et évaluations chiffrées : associé à Gemini 3.1 Pro, Colosseum aurait permis d'obtenir plusieurs résultats nouveaux répondant à des problèmes ouverts issus d'articles publiés dans des conférences comme FOCS ou dans la revue JMLR.

Sur TCS-Bench, un ensemble de tâches de démonstration de théorèmes de niveau recherche tirées de FOCS, STOC et SODA, le système atteint 71,0 % de précision en combinant Gemini 3.1 Pro et Gemini 3.7 Flash. Sur une évaluation distincte de type Codeforces, la version orientée preuve avec retour d'exécution résout 218 des 222 problèmes soumis. Ces chiffres, s'ils se confirment par des évaluations indépendantes, indiqueraient un progrès notable dans la capacité des systèmes d'IA à mener des raisonnements structurés sur plusieurs étapes, un domaine où les modèles de langage restent généralement peu fiables au-delà de preuves courtes.

Tags
multi-agentreasoningtheorem-provingllm-agentsbenchmarkmathematics