SAFETY · Hugging Face
Comment l'UK AISI et EvalEval rendent les résultats de benchmarks reproductibles
Une collaboration entre l'UK AI Safety Institute et l'initiative EvalEval s'attaque au manque de reproductibilité des évaluations de modèles.
L'UK AI Safety Institute (AISI) et le projet EvalEval présentent une initiative commune visant à standardiser et documenter les benchmarks utilisés pour évaluer les modèles d'IA. L'objectif est de résoudre les problèmes récurrents de reproductibilité des résultats, souvent dus à des différences de configuration, de prompts ou de méthodologie entre laboratoires.