SAFETY
DiaVLo : un framework de diagnostic des comportements des modèles vision-langage
DiaVLo détecte les désalignements comportementaux des VLM et identifie les concepts causaux qui orientent leurs réponses, favorisant un déploiement plus fiable.
arXiv cs.AI · cs.LG · cs.CL·Lorenzo Corti, Jie Yang·18 septembre 2026
DiaVLo est un framework de diagnostic pour les modèles vision-langage (VLM). Il combine curation humaine et génération du modèle pour spécifier les comportements attendus et observés, révélant ainsi les désalignements. Il fournit également des estimations causales des concepts les plus influents sur ces comportements. Les évaluations sur plusieurs VLM open-weights montrent que DiaVLo produit des étiquettes corrélées à la performance et met en évidence des patterns de perception et de priorisation des concepts.