EN DIRECT
Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|

🔬 Méthodologie

Tout ce que nous comparons, comment nous classons, et d'où viennent nos données. Transparence totale : aucun chiffre que nous ne puissions justifier par une source officielle.

📋 Ce que nous comparons

Chaque modèle est documenté sur une quinzaine de dimensions, regroupées en cinq familles. Toutes sont visibles dans le comparateur côte à côte.

Performance

Arena Elo
Classement par préférence humaine (LMArena).
MMLU
Connaissance générale, 57 sujets.
SWE-Bench
Résolution de vrais bugs GitHub.
HumanEval
Génération de code fonctionnel.

Technique

Fenêtre de contexte
Tokens traitables en une fois (32k → 2M).
Vitesse
Débit de génération en tokens/seconde.
Date de sortie
Ancienneté du modèle.
Spécialité
Domaine de force principal.

Économique

Prix entrée/sortie
Coût en $ par million de tokens.
Offre gratuite
Existence d'un tier gratuit.

Souveraineté & conformité

Hébergement UE
Résidence des données en UE possible (éditeur ou self-host).
Open source
Poids du modèle disponibles, self-hostable.
Origine
Pays / entreprise éditrice.

Qualité perçue

Qualité française
Aisance et nuance en français (évaluation éditoriale).
Profondeur de raisonnement
Enchaînement d'étapes logiques complexes (évaluation éditoriale).
Créativité
Originalité et richesse des productions (évaluation éditoriale).
Fiabilité factuelle
Tendance à éviter les hallucinations (évaluation éditoriale).

🧮 Comment nous classons (Podium)

Le podium est un sous-ensemble : un score pondéré par catégorie. Les poids ci-dessous sont ceux réellement utilisés par l'algorithme. Ils diffèrent selon ce qui compte dans chaque domaine.

Généralistes

Arena Elo
40%
MMLU
20%
GPQA
20%
Contexte
10%
Fraîcheur
10%

Code

SWE-bench
30%
Terminal-Bench
25%
HumanEval
20%
Arena Elo
15%
Fraîcheur
10%

Rapport qualité/prix

Capacité
55%
Prix
45%

Vision

MMBench
45%
MMMU
25%
Prix
15%
Fraîcheur
15%

Multilingue

MMLU-multi
40%
FLORES
25%
Culturel
15%
Prix
10%
Fraîcheur
10%

Open Source

Licence
30%
Benchmarks
30%
Communauté
20%
Self-host
20%

Local (laptop / desktop / station)

Capacité
40%
Popularité
30%
Licence
15%
Fraîcheur
15%

Comment les valeurs sont normalisées

Prixinversé : moins cher = meilleur score. Gratuit = 100, <1$/M = 95, <5$ = 85, <20$ = 70, <50$ = 50, <100$ = 30, au-delà = 15.

Contextepar paliers : ≥1M = 100, ≥500k = 90, ≥200k = 80, ≥128k = 70, ≥32k = 50.

Fraîcheur<1 mois = 100, <3 mois = 90, <6 mois = 75, <1 an = 55, au-delà décroît.

LicenceApache/MIT = 100, BSD = 95, GPL = 85, Llama (restrictions) = 60.

Comment lire un scoreLes scores de benchmarks ne sont pas des pourcentages de réussite : chaque benchmark est ramené à la distribution observée sur notre catalogue. 50 correspond au modèle moyen, 75 à un écart-type au-dessus, 100 à deux ou plus.

Sans cela, les tests saturés écraseraient les tests difficiles. Sur notre catalogue, HellaSwag a un écart-type de 2,3 points (tout le monde autour de 92) quand SWE-bench en a 14,8 : un point d'écart sur le premier ne vaut pas un point d'écart sur le second. Un 80 % sur un test dur pèse donc plus qu'un 96 % sur un test saturé.

Un benchmark renseigné pour moins de cinq modèles n'est pas normalisé — la distribution ne serait pas fiable — et sa valeur brute est conservée.

Self-hostselon la taille : ≤8B = 100 (tourne sur Mac), ≤30B = 85, ≤70B = 70, au-delà nécessite un cluster.

Fiabilité & sources

C'est ce qui distingue ce comparateur d'un simple tableau. Notre engagement sur la donnée :

Sources éditeurs en priorité
Les prix et benchmarks sont recherchés d'abord sur les pages des éditeurs (Anthropic, OpenAI, Google, Mistral, Moonshot…). Quand un éditeur ne publie pas une donnée, elle provient d'un tracker indépendant et reste identifiée comme telle.
Traçabilité par modèle
Chaque modèle porte une date de vérification, affichée sur le comparateur. Les URL de source sont renseignées au fil des vérifications : la couverture est en cours d'extension et n'est pas encore complète.
Vérification mensuelle
Le 1er de chaque mois, un contrôle est effectué. L'historique des changements est public.
Sourced or excluded
Un modèle dont les benchmarks ne sont pas vérifiables indépendamment (ex : modèle non public) n'est pas classé comme les autres et porte la mention « accès restreint ».
Scores Elo : source créditée
Les scores Elo proviennent du jeu de données public Arena (lmarena-ai/leaderboard-dataset), publié sous licence CC-BY-4.0 et resynchronisé automatiquement. Ils entrent dans le calcul à hauteur de 40 % du podium Généralistes et 15 % du podium Code ; ils sont affichés à titre indicatif ailleurs.

⚖️ Limites assumées

Le prix ne rentre PAS dans le podium principal : celui-ci classe la capacité seule. Un modèle cher n'y est donc pas pénalisé. Le rapport qualité/prix fait l'objet d'un podium distinct, et chaque modèle porte un badge de coût (économique sous 5 $, standard de 5 à 25 $, premium au-delà, par million de tokens entrée + sortie).

Un modèle doit être évalué sur au moins la moitié du poids des critères pour être classé. En dessous, il reste visible au comparateur mais n'apparaît pas au podium : sans données suffisantes, un rang serait une invention. C'est pourquoi certains modèles très récents figurent au comparatif sans être classés.

Les critères reposent sur MMLU, GPQA, SWE-Bench et HumanEval. Plusieurs modèles sortis en 2026 ne publient plus ces scores et privilégient Terminal-Bench, SWE-Bench Pro ou ARC-AGI : ils figurent alors au comparateur sans apparaître au podium. C'est une limite connue de la grille actuelle.

Les scores sont relatifs à notre catalogue, pas absolus. Un même modèle peut voir son score bouger d'un mois sur l'autre sans avoir changé, simplement parce que de nouveaux modèles sont entrés au comparatif et ont déplacé la moyenne. C'est le prix d'un classement qui reste comparable entre benchmarks d'échelles différentes.

La fraîcheur est valorisée : un modèle récent gagne quelques points. C'est un choix, car le domaine évolue vite — mais cela peut surpondérer la nouveauté.

Les benchmarks ne disent pas tout : un modèle peut bien scorer et décevoir à l'usage. Le classement est généré et publié automatiquement le 1er de chaque mois à partir de règles fixes et publiques ; il reste corrigeable a posteriori, et l'historique des changements est consultable.