RECHERCHE
Impact de l'évaluation efficace sur les conclusions de benchmark IA responsable
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
arXiv cs.AI · cs.LG · cs.CL·Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou·31 août 2026
Cette étude examine la robustesse des conclusions de benchmark responsible-AI lorsque l'évaluation est optimisée. Comparer le batching, la quantization et la réduction de benchmark à un baseline BF16 montre que si l'accuracy globale se maintient souvent, la stabilité des sous-groupes et la consommation énergétique varient significativement selon les méthodes.