RECHERCHE
Voir avant de synthétiser : détection d'événements de transition guidée par VLM pour le captioning vidéo dense faiblement supervisé
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.
arXiv cs.AI · cs.LG · cs.CL·Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim·3 septembre 2026
SBS propose une méthode qui exploite un VLM pour générer des narrations frame par frame entre événements et détecter les transitions via variation sémantique, plutôt que d'assigner des légendes de transition de façon rigide via LLM. Les masques temporels sont ensuite affinés en combinant point médian temporel et point de changement sémantique. La méthode atteint l'état de l'art sur ActivityNet Captions et YouCook2.