Toutes les news taguées avec ce sujet.
Une méthode statistique pour arbitrer entre annotation automatique bruitée et expertise humaine coûteuse en évaluation off-policy.
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.