RECHERCHE · Hugging Face
BenchMIRT : que mesurent réellement les benchmarks LLM ?
Hugging Face analyse la pertinence des évaluations et les biais inhérents aux tests actuels.
Hugging Face présente BenchMIRT, une étude utilisant la Théorie de Réponse aux Items pour évaluer ce que les benchmarks LLM mesurent réellement. L'analyse révèle des limitations méthodologiques et suggère que les performances actuelles pourraient surestimer les capacités réelles des modèles.