🔬 Méthodologie
Tout ce que nous comparons, comment nous classons, et d'où viennent nos données. Transparence totale : aucun chiffre que nous ne puissions justifier par une source officielle.
📋 Ce que nous comparons
Chaque modèle est documenté sur une quinzaine de dimensions, regroupées en cinq familles. Toutes sont visibles dans le comparateur côte à côte.
Performance
Technique
Économique
Souveraineté & conformité
Qualité perçue
🧮 Comment nous classons (Podium)
Le podium est un sous-ensemble : un score pondéré par catégorie. Les poids ci-dessous sont ceux réellement utilisés par l'algorithme. Ils diffèrent selon ce qui compte dans chaque domaine.
Généralistes
Code
Rapport qualité/prix
Vision
Multilingue
Open Source
Local (laptop / desktop / station)
Comment les valeurs sont normalisées
Prix — inversé : moins cher = meilleur score. Gratuit = 100, <1$/M = 95, <5$ = 85, <20$ = 70, <50$ = 50, <100$ = 30, au-delà = 15.
Contexte — par paliers : ≥1M = 100, ≥500k = 90, ≥200k = 80, ≥128k = 70, ≥32k = 50.
Fraîcheur — <1 mois = 100, <3 mois = 90, <6 mois = 75, <1 an = 55, au-delà décroît.
Licence — Apache/MIT = 100, BSD = 95, GPL = 85, Llama (restrictions) = 60.
Comment lire un score — Les scores de benchmarks ne sont pas des pourcentages de réussite : chaque benchmark est ramené à la distribution observée sur notre catalogue. 50 correspond au modèle moyen, 75 à un écart-type au-dessus, 100 à deux ou plus.
Sans cela, les tests saturés écraseraient les tests difficiles. Sur notre catalogue, HellaSwag a un écart-type de 2,3 points (tout le monde autour de 92) quand SWE-bench en a 14,8 : un point d'écart sur le premier ne vaut pas un point d'écart sur le second. Un 80 % sur un test dur pèse donc plus qu'un 96 % sur un test saturé.
Un benchmark renseigné pour moins de cinq modèles n'est pas normalisé — la distribution ne serait pas fiable — et sa valeur brute est conservée.
Self-host — selon la taille : ≤8B = 100 (tourne sur Mac), ≤30B = 85, ≤70B = 70, au-delà nécessite un cluster.
✅ Fiabilité & sources
C'est ce qui distingue ce comparateur d'un simple tableau. Notre engagement sur la donnée :
⚖️ Limites assumées
Le prix ne rentre PAS dans le podium principal : celui-ci classe la capacité seule. Un modèle cher n'y est donc pas pénalisé. Le rapport qualité/prix fait l'objet d'un podium distinct, et chaque modèle porte un badge de coût (économique sous 5 $, standard de 5 à 25 $, premium au-delà, par million de tokens entrée + sortie).
Un modèle doit être évalué sur au moins la moitié du poids des critères pour être classé. En dessous, il reste visible au comparateur mais n'apparaît pas au podium : sans données suffisantes, un rang serait une invention. C'est pourquoi certains modèles très récents figurent au comparatif sans être classés.
Les critères reposent sur MMLU, GPQA, SWE-Bench et HumanEval. Plusieurs modèles sortis en 2026 ne publient plus ces scores et privilégient Terminal-Bench, SWE-Bench Pro ou ARC-AGI : ils figurent alors au comparateur sans apparaître au podium. C'est une limite connue de la grille actuelle.
Les scores sont relatifs à notre catalogue, pas absolus. Un même modèle peut voir son score bouger d'un mois sur l'autre sans avoir changé, simplement parce que de nouveaux modèles sont entrés au comparatif et ont déplacé la moyenne. C'est le prix d'un classement qui reste comparable entre benchmarks d'échelles différentes.
La fraîcheur est valorisée : un modèle récent gagne quelques points. C'est un choix, car le domaine évolue vite — mais cela peut surpondérer la nouveauté.
Les benchmarks ne disent pas tout : un modèle peut bien scorer et décevoir à l'usage. Le classement est généré et publié automatiquement le 1er de chaque mois à partir de règles fixes et publiques ; il reste corrigeable a posteriori, et l'historique des changements est consultable.