Toutes les news taguées avec ce sujet.
Un nouveau benchmark évalue la compréhension artistique et contextuelle des modèles vision-langage dans l'éducation.
PANORAMA améliore l'ancrage pixel des légendes VLM via la sélection de masques conditionnels et un benchmark dédié.
Des tests sur des pièges photographiques montrent que les spécialistes comme BioCLIP surclassent les VLM généralistes de 2 à 8B.
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.