EN DIRECT
Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Paul Christiano rejoint le conseil d'administration de la fondation OpenAI09/09/26 · OpenAI|Raschka décrypte les rumeurs sur GPT-6 Astra et les transformeurs en boucle09/09/26|OpenAI affirme que ses agents ont résolu un problème mathématique majeur, la controverse enfle09/09/26 · OpenAI|Une percée mathématique attribuée à l'IA suscite une controverse scientifique09/09/26|OpenAI détaille comment son modèle GPT‑5.6 Sol assiste des expériences en informatique quantique09/09/26 · OpenAI|Terence Tao alerte sur l'épuisement des problèmes mathématiques ouverts par l'IA08/09/26|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Paul Christiano rejoint le conseil d'administration de la fondation OpenAI09/09/26 · OpenAI|Raschka décrypte les rumeurs sur GPT-6 Astra et les transformeurs en boucle09/09/26|OpenAI affirme que ses agents ont résolu un problème mathématique majeur, la controverse enfle09/09/26 · OpenAI|Une percée mathématique attribuée à l'IA suscite une controverse scientifique09/09/26|OpenAI détaille comment son modèle GPT‑5.6 Sol assiste des expériences en informatique quantique09/09/26 · OpenAI|Terence Tao alerte sur l'épuisement des problèmes mathématiques ouverts par l'IA08/09/26|
Recherche

Raschka décrypte les rumeurs sur GPT-6 Astra et les transformeurs en boucle

Dans sa newsletter technique, Sebastian Raschka analyse les informations circulant sur un possible GPT-6 nommé Astra, ainsi que deux tendances de recherche : les transformeurs en boucle et le raisonnement caché des modèles.

9 septembre 20263 min de lecturePublié parHacker News

Sebastian Raschka, chercheur et auteur reconnu pour ses analyses pédagogiques sur les architectures de modèles de langage, consacre sa dernière publication à plusieurs sujets connexes qui agitent la communauté IA. Le premier concerne des indices et rumeurs autour d'un successeur de GPT-4/5, parfois désigné en interne ou dans des fuites sous le nom de code 'Astra', sans confirmation officielle d'OpenAI sur son architecture ou sa date de sortie.

Le second axe de l'article porte sur les 'transformeurs en boucle' (looped transformers), une piste de recherche qui consiste à réutiliser les mêmes blocs de calcul plusieurs fois de suite au sein d'un réseau, plutôt que d'empiler des couches distinctes. Cette approche permettrait en théorie d'augmenter la capacité de calcul effective d'un modèle sans multiplier le nombre de paramètres, une piste explorée par plusieurs équipes académiques pour répondre aux limites de mise à l'échelle des transformeurs classiques.

Enfin, Raschka aborde la question du 'raisonnement caché', c'est-à-dire les mécanismes par lesquels certains modèles récents produisent des étapes de raisonnement internes non affichées à l'utilisateur final, à l'image de ce que font les modèles de la famille o1/o3 d'OpenAI. Ce choix de conception pose des questions à la fois techniques (comment entraîner et évaluer ce raisonnement latent) et de transparence, puisque l'utilisateur n'a pas toujours accès au cheminement complet du modèle.

L'article s'inscrit dans la tradition des synthèses de Raschka, qui visent à clarifier des sujets techniques complexes pour un public de praticiens et de chercheurs. Sans révéler d'information confirmée sur un GPT-6, la publication offre surtout un état des lieux utile sur les directions de recherche actuelles concernant l'efficacité et l'opacité croissante des grands modèles de langage.

Tags
llm-architecturereasoningtransformersgpt-6research-roundup

À lire aussi

Raschka décrypte les rumeurs sur GPT-6 Astra et les transformeurs en boucle · nAIvigate