RECHERCHE
Quand les juges LLM sont d'accord, faut-il les croire ?
Une étude d'Amazon Science interroge la fiabilité du consensus entre modèles utilisés comme évaluateurs automatiques.
Hacker News (filtré IA)·@Betelbuddy·14 septembre 2026
Des chercheurs d'Amazon Science examinent la pratique du LLM-as-judge, où plusieurs modèles évaluent la qualité de réponses générées. Ils montrent que l'accord entre juges LLM ne garantit pas nécessairement un jugement correct, notamment en raison de biais partagés entre modèles. L'étude appelle à la prudence dans l'interprétation des scores d'évaluation automatisée.