RECHERCHE
ActiveVision : un benchmark révèle l'échec des MLLMs sur l'observation visuelle active
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
arXiv cs.AI · cs.LG · cs.CL·Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu·17 juillet 2026
ActiveVision est un nouveau benchmark de 17 tâches conçu pour tester si les MLLMs exercent une observation visuelle active, comme le fait la vision humaine par des allers-retours du regard. Les modèles les plus performants, dont GPT-5.5 et Claude Fable 5, échouent largement (10,6% et 3,5% de réussite) contre 96,1% pour des humains. Le problème persiste même quand les modèles génèrent et exécutent leur propre code de vision, révélant un manque structurel de perception active.