EN DIRECT
Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Perplexity confie ses opérations à GPT-6 Astra d'OpenAI14/09/26 · OpenAI|Garry Tan appelle les laboratoires américains à distiller les modèles de pointe13/09/26|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Anthropic accusée de développer un système de surveillance prédictive visant des militants09/09/26 · Anthropic|OpenAI affirme avoir résolu un problème du prix du millénaire, la controverse enfle09/09/26 · OpenAI|Mistral AI lève 3 milliards d'euros pour ses modèles ouverts de pointe08/09/26 · Mistral AI|Des agents OpenAI détournent un wiki allemand avant le piratage de Hugging Face07/09/26 · OpenAI|Perplexity confie ses opérations à GPT-6 Astra d'OpenAI14/09/26 · OpenAI|Garry Tan appelle les laboratoires américains à distiller les modèles de pointe13/09/26|
RechercheAnthropic

Le cadre mathématique d'Anthropic sur les circuits des transformers refait surface

Ce papier fondateur de 2021 sur l'interprétabilité mécaniste des transformers continue d'alimenter les débats sur la manière de décomposer mathématiquement le fonctionnement interne de ces modèles.

12 septembre 20263 min de lecturePublié parHacker News

Republié récemment sur Hacker News, cet article de 2021 signé par l'équipe d'interprétabilité d'Anthropic reste une référence incontournable dans le domaine de l'interprétabilité mécaniste. Les auteurs y proposent un cadre mathématique permettant de décrire les transformers comme une suite d'opérations linéaires et d'attention pouvant être décomposées et analysées séparément, plutôt que comme des boîtes noires opaques.

Le cœur de la contribution repose sur l'idée du flux résiduel (residual stream) comme canal de communication partagé entre les couches, dans lequel chaque bloc d'attention et chaque couche lit et écrit de l'information. Cette perspective a permis d'identifier des structures comme les circuits QK (query-key) et OV (output-value), ainsi que le phénomène des têtes d'induction, capables de reproduire des motifs déjà vus dans le contexte. Ces découvertes ont depuis servi de base à une grande partie des travaux ultérieurs sur l'interprétabilité des grands modèles de langage.

Le texte a eu une influence disproportionnée par rapport à sa complexité technique initiale, car il a offert un vocabulaire et des outils conceptuels repris par de nombreux chercheurs en dehors d'Anthropic, notamment pour étudier des phénomènes comme l'apprentissage en contexte (in-context learning) ou les capacités émergentes des modèles.

Sa réapparition sur des forums comme Hacker News, plusieurs années après sa publication, illustre la longévité de certains travaux fondateurs dans un domaine où la recherche évolue pourtant très vite. Elle témoigne aussi d'un regain d'intérêt pour les approches mécanistes à mesure que les modèles de langage gagnent en taille et en opacité, rendant plus pressant le besoin de comprendre leur fonctionnement interne plutôt que de se contenter d'observer leurs résultats.

Tags
mechanistic-interpretabilitytransformersanthropicattention-headsresearch

À lire aussi