Toutes les news taguées avec ce sujet.
Un nouveau benchmark open-source permet d'évaluer de façon reproductible les modèles de décision typés, comblant un manque dans l'écosystème d'évaluation des LLM.
Une collaboration entre l'UK AI Safety Institute et l'initiative EvalEval s'attaque au manque de reproductibilité des évaluations de modèles.
IdeaAMBIG évalue la capacité des LLM à détecter et corriger les imprécisions méthodologiques entravant l'implémentation.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.