EN DIRECT
Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Perplexity confie ses opérations à GPT-6 Astra d'OpenAI14/09/26 · OpenAI|Real-SWE : un nouveau benchmark pour évaluer l'IA sur du code d'entreprise réel12/09/26 · Specific|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Perplexity confie ses opérations à GPT-6 Astra d'OpenAI14/09/26 · OpenAI|Real-SWE : un nouveau benchmark pour évaluer l'IA sur du code d'entreprise réel12/09/26 · Specific|
RechercheSpecific

Real-SWE : un nouveau benchmark pour évaluer l'IA sur du code d'entreprise réel

La startup Specific propose un benchmark baptisé Real-SWE, conçu pour évaluer les modèles d'IA sur des dépôts de code privés et réels, plutôt que sur des jeux de données publics potentiellement contaminés.

12 septembre 20263 min de lecturePublié parHacker News

L'entreprise Specific a dévoilé Real-SWE, un benchmark destiné à mesurer les performances des modèles d'IA sur des bases de code d'entreprise privées, en opposition aux jeux de tests publics comme SWE-bench qui dominent aujourd'hui l'évaluation des agents de codage. L'idée centrale est simple : les benchmarks bâtis à partir de dépôts GitHub publics finissent souvent par être partiellement mémorisés par les grands modèles de langage lors de leur entraînement, ce qui fausse les résultats et surestime les capacités réelles de résolution de problèmes.

En s'appuyant sur du code propriétaire, non indexé et non accessible aux crawlers utilisés pour constituer les corpus d'entraînement, Real-SWE cherche à offrir une mesure plus fidèle de ce que les agents de codage sont capables d'accomplir face à des tâches d'ingénierie logicielle authentiques, avec leurs particularités, leurs dépendances internes et leurs conventions propres à chaque organisation. Cette approche s'inscrit dans une tendance plus large de méfiance envers les benchmarks publics, jugés de plus en plus vulnérables à la contamination des données et peu représentatifs des environnements de production réels.

Le positionnement de Specific rejoint les préoccupations exprimées par plusieurs équipes de recherche et entreprises utilisatrices d'agents de codage, qui constatent un écart entre les scores affichés sur les benchmarks publics et les performances observées en conditions réelles, notamment sur des bases de code volumineuses, historiques et faiblement documentées. Un tel écart complique les décisions d'adoption pour les équipes techniques cherchant à évaluer objectivement des outils comme les assistants de codage basés sur de grands modèles de langage.

Les détails méthodologiques concernant la constitution du jeu de données, le nombre de tâches couvertes ou les modèles déjà testés restent limités à ce stade. Reste à voir si cette initiative parviendra à s'imposer comme référence indépendante, dans un secteur où la question de la crédibilité et de la reproductibilité des benchmarks reste un enjeu majeur pour la comparaison objective des modèles.

Tags
benchmarkcoding-agentsswe-benchenterpriseevaluation

À lire aussi