L'entreprise Specific a dévoilé Real-SWE, un benchmark destiné à mesurer les performances des modèles d'IA sur des bases de code d'entreprise privées, en opposition aux jeux de tests publics comme SWE-bench qui dominent aujourd'hui l'évaluation des agents de codage. L'idée centrale est simple : les benchmarks bâtis à partir de dépôts GitHub publics finissent souvent par être partiellement mémorisés par les grands modèles de langage lors de leur entraînement, ce qui fausse les résultats et surestime les capacités réelles de résolution de problèmes.
En s'appuyant sur du code propriétaire, non indexé et non accessible aux crawlers utilisés pour constituer les corpus d'entraînement, Real-SWE cherche à offrir une mesure plus fidèle de ce que les agents de codage sont capables d'accomplir face à des tâches d'ingénierie logicielle authentiques, avec leurs particularités, leurs dépendances internes et leurs conventions propres à chaque organisation. Cette approche s'inscrit dans une tendance plus large de méfiance envers les benchmarks publics, jugés de plus en plus vulnérables à la contamination des données et peu représentatifs des environnements de production réels.
Le positionnement de Specific rejoint les préoccupations exprimées par plusieurs équipes de recherche et entreprises utilisatrices d'agents de codage, qui constatent un écart entre les scores affichés sur les benchmarks publics et les performances observées en conditions réelles, notamment sur des bases de code volumineuses, historiques et faiblement documentées. Un tel écart complique les décisions d'adoption pour les équipes techniques cherchant à évaluer objectivement des outils comme les assistants de codage basés sur de grands modèles de langage.
Les détails méthodologiques concernant la constitution du jeu de données, le nombre de tâches couvertes ou les modèles déjà testés restent limités à ce stade. Reste à voir si cette initiative parviendra à s'imposer comme référence indépendante, dans un secteur où la question de la crédibilité et de la reproductibilité des benchmarks reste un enjeu majeur pour la comparaison objective des modèles.