RECHERCHE
MUSE : benchmark pour l'éducation multimodale des LVLM
Un nouveau benchmark évalue la compréhension artistique et contextuelle des modèles vision-langage dans l'éducation.
arXiv cs.AI · cs.LG · cs.CL·Luyao Zhu, Xun Wei Yee, Wei Li, Mun Thye Mak·16 septembre 2026
MUSE est un benchmark conçu pour évaluer les capacités des grands modèles vision-langage (LVLM) dans des contextes éducatifs situés, en se concentrant sur l'imagerie artistique. Il sépare l'annotation d'image de la génération de questions pour couvrir douze tâches de perception, interprétation et raisonnement culturel, incluant des contextes asiatiques et occidentaux. Les tests révèlent des écarts de performance importants entre modèles, notamment en interprétation affective.