EN DIRECT
Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|
Recherche

Des modifications d'architecture permettraient de casser les lois d'échelle classiques

Une étude montre que des interventions architecturales, comme les transformers à boucles, peuvent modifier les exposants des lois d'échelle plutôt que leurs seules constantes, avec des gains de compute croissants selon l'échelle.

16 septembre 20263 min de lecturePublié pararXiv

Les lois d'échelle en apprentissage profond décrivent généralement comment la perte diminue à mesure que le calcul augmente, selon une courbe dont l'exposant est considéré comme fixe pour une famille d'architectures donnée. Cette étude remet en question cette hypothèse en montrant que certaines interventions architecturales peuvent directement modifier cet exposant, produisant des améliorations de performance qui s'accélèrent avec le calcul plutôt que de simplement le décaler.

Les auteurs s'appuient sur les transformers à boucles, une architecture où un même bloc de calcul est répété plusieurs fois, un mécanisme habituellement associé au raisonnement plutôt qu'à l'entraînement lui-même. En augmentant le nombre de boucles pendant l'entraînement pour faire croître le modèle, avec ou sans partage de poids, ils obtiennent les changements les plus marqués sur les exposants de scaling. Un modèle de 7,4 milliards de paramètres construit selon cette méthode égale les performances d'un GPT-3 de 13 milliards de paramètres sur le benchmark CORE, tout en consommant environ vingt fois moins de calcul.

Les gains d'efficacité computationnelle augmentent avec l'échelle, ce qui distingue cette approche des optimisations classiques qui offrent des bénéfices constants ou décroissants. Les chercheurs testent également un opérateur de bordure plus simple, qui normalise et réinjecte un bloc antérieur dans un transformer classique sans boucle : cette technique produit des gains similaires mais plus modestes. Dans un contexte où les données sont limitées et où le modèle doit voir plusieurs fois les mêmes exemples, le bouclage standard agirait aussi comme un régularisateur utile, et il devient optimal d'augmenter le nombre de boucles à mesure que l'échelle du modèle croît.

Les auteurs interprètent ces résultats à travers la notion de profondeur computationnelle utilisable : pour un budget de calcul donné, l'objectif est d'exploiter davantage la profondeur effective du réseau. Cette lecture ouvre une piste de recherche distincte de l'augmentation pure des paramètres ou des données, en suggérant que la structure même du calcul interne d'un modèle peut être un levier d'efficacité à part entière, potentiellement pertinent pour repenser la conception des futurs modèles de grande taille.

Tags
scaling-lawstransformer-architecturecompute-efficiencylooped-transformerspre-training

À lire aussi

Des modifications d'architecture permettraient de casser les lois d'échelle classiques · nAIvigate