RECHERCHE
QuranicMMLU : un benchmark cognitif pour évaluer l'IA générative sur la langue coranique
Un nouveau benchmark de 980 questions révèle un écart marqué entre précision en QCM et qualité des réponses ouvertes chez les LLM sur l'arabe coranique.
arXiv cs.AI · cs.LG · cs.CL·Rawan El Ghali, Umm Kulsoom, Anas Madkoor, Dima Faris Alsaudi·18 septembre 2026
QuranicMMLU propose une taxonomie en cinq piliers (phonologie, morphologie, syntaxe, sémantique, pragmatique) et 31 sous-catégories pour évaluer finement les compétences linguistiques des LLM sur le Coran. Sur 980 questions révisées manuellement, un modèle spécialisé islamique arrive en tête parmi 12 systèmes testés. Les scores moyens atteignent 84% en QCM contre seulement 60% en réponses ouvertes, montrant que le format à choix multiples masque des lacunes réelles.