Republié récemment sur Hacker News, cet article de 2021 signé par l'équipe d'interprétabilité d'Anthropic reste une référence incontournable dans le domaine de l'interprétabilité mécaniste. Les auteurs y proposent un cadre mathématique permettant de décrire les transformers comme une suite d'opérations linéaires et d'attention pouvant être décomposées et analysées séparément, plutôt que comme des boîtes noires opaques.
Le cœur de la contribution repose sur l'idée du flux résiduel (residual stream) comme canal de communication partagé entre les couches, dans lequel chaque bloc d'attention et chaque couche lit et écrit de l'information. Cette perspective a permis d'identifier des structures comme les circuits QK (query-key) et OV (output-value), ainsi que le phénomène des têtes d'induction, capables de reproduire des motifs déjà vus dans le contexte. Ces découvertes ont depuis servi de base à une grande partie des travaux ultérieurs sur l'interprétabilité des grands modèles de langage.
Le texte a eu une influence disproportionnée par rapport à sa complexité technique initiale, car il a offert un vocabulaire et des outils conceptuels repris par de nombreux chercheurs en dehors d'Anthropic, notamment pour étudier des phénomènes comme l'apprentissage en contexte (in-context learning) ou les capacités émergentes des modèles.
Sa réapparition sur des forums comme Hacker News, plusieurs années après sa publication, illustre la longévité de certains travaux fondateurs dans un domaine où la recherche évolue pourtant très vite. Elle témoigne aussi d'un regain d'intérêt pour les approches mécanistes à mesure que les modèles de langage gagnent en taille et en opacité, rendant plus pressant le besoin de comprendre leur fonctionnement interne plutôt que de se contenter d'observer leurs résultats.