Les lois d'échelle en apprentissage profond décrivent généralement comment la perte diminue à mesure que le calcul augmente, selon une courbe dont l'exposant est considéré comme fixe pour une famille d'architectures donnée. Cette étude remet en question cette hypothèse en montrant que certaines interventions architecturales peuvent directement modifier cet exposant, produisant des améliorations de performance qui s'accélèrent avec le calcul plutôt que de simplement le décaler.
Les auteurs s'appuient sur les transformers à boucles, une architecture où un même bloc de calcul est répété plusieurs fois, un mécanisme habituellement associé au raisonnement plutôt qu'à l'entraînement lui-même. En augmentant le nombre de boucles pendant l'entraînement pour faire croître le modèle, avec ou sans partage de poids, ils obtiennent les changements les plus marqués sur les exposants de scaling. Un modèle de 7,4 milliards de paramètres construit selon cette méthode égale les performances d'un GPT-3 de 13 milliards de paramètres sur le benchmark CORE, tout en consommant environ vingt fois moins de calcul.
Les gains d'efficacité computationnelle augmentent avec l'échelle, ce qui distingue cette approche des optimisations classiques qui offrent des bénéfices constants ou décroissants. Les chercheurs testent également un opérateur de bordure plus simple, qui normalise et réinjecte un bloc antérieur dans un transformer classique sans boucle : cette technique produit des gains similaires mais plus modestes. Dans un contexte où les données sont limitées et où le modèle doit voir plusieurs fois les mêmes exemples, le bouclage standard agirait aussi comme un régularisateur utile, et il devient optimal d'augmenter le nombre de boucles à mesure que l'échelle du modèle croît.
Les auteurs interprètent ces résultats à travers la notion de profondeur computationnelle utilisable : pour un budget de calcul donné, l'objectif est d'exploiter davantage la profondeur effective du réseau. Cette lecture ouvre une piste de recherche distincte de l'augmentation pure des paramètres ou des données, en suggérant que la structure même du calcul interne d'un modèle peut être un levier d'efficacité à part entière, potentiellement pertinent pour repenser la conception des futurs modèles de grande taille.