RECHERCHE
Mécanismes internes des juges LLM
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.
arXiv cs.AI · cs.LG · cs.CL·Himil Vasava, Ming Jiang·1 septembre 2026
Cette étude explore le fonctionnement interne des LLM utilisés pour évaluer la qualité du langage naturel via une approche mécaniste. Les expériences de causal tracing sur Themis et Prometheus révèlent que l'attention compare les erreurs localement avant une couche 15, tandis que le MLP intègre le signal et écrit la note finale autour de la couche 26.