RECHERCHE
Lisibilité n'est pas interprétabilité : importance jugée vs réelle dans le raisonnement chain-of-thought
Une étude montre que les LLM-juges ne détectent que partiellement les étapes de raisonnement réellement décisives pour la réponse finale.
arXiv cs.AI · cs.LG · cs.CL·Kevin Du, Alexander Hoyle, Laura Ruis, Acyr Locatelli·3 septembre 2026
Les chercheurs mesurent l'importance réelle d'une étape de raisonnement via son avantage causal (impact sur la probabilité de bonne réponse, estimé par rollouts Monte Carlo). Ils comparent cette référence aux jugements de LLM-juges censés évaluer la fidélité des traces chain-of-thought. Les modèles capables dépassent une base de prévalence mais restent loin d'un plafond de bruit ; même après fine-tuning en critique pas-à-pas, l'écart persiste pour les réponses correctes. Conclusion : la lisibilité textuelle d'un raisonnement ne garantit pas son interprétabilité, ce qui questionne l'usage des process reward models.