Sebastian Raschka, chercheur et auteur reconnu pour ses analyses pédagogiques sur les architectures de modèles de langage, consacre sa dernière publication à plusieurs sujets connexes qui agitent la communauté IA. Le premier concerne des indices et rumeurs autour d'un successeur de GPT-4/5, parfois désigné en interne ou dans des fuites sous le nom de code 'Astra', sans confirmation officielle d'OpenAI sur son architecture ou sa date de sortie.
Le second axe de l'article porte sur les 'transformeurs en boucle' (looped transformers), une piste de recherche qui consiste à réutiliser les mêmes blocs de calcul plusieurs fois de suite au sein d'un réseau, plutôt que d'empiler des couches distinctes. Cette approche permettrait en théorie d'augmenter la capacité de calcul effective d'un modèle sans multiplier le nombre de paramètres, une piste explorée par plusieurs équipes académiques pour répondre aux limites de mise à l'échelle des transformeurs classiques.
Enfin, Raschka aborde la question du 'raisonnement caché', c'est-à-dire les mécanismes par lesquels certains modèles récents produisent des étapes de raisonnement internes non affichées à l'utilisateur final, à l'image de ce que font les modèles de la famille o1/o3 d'OpenAI. Ce choix de conception pose des questions à la fois techniques (comment entraîner et évaluer ce raisonnement latent) et de transparence, puisque l'utilisateur n'a pas toujours accès au cheminement complet du modèle.
L'article s'inscrit dans la tradition des synthèses de Raschka, qui visent à clarifier des sujets techniques complexes pour un public de praticiens et de chercheurs. Sans révéler d'information confirmée sur un GPT-6, la publication offre surtout un état des lieux utile sur les directions de recherche actuelles concernant l'efficacité et l'opacité croissante des grands modèles de langage.