RECHERCHE
ReToken : un unique token pour améliorer la recherche visuelle dans les modèles vision-langage
Une méthode légère à un seul embedding entraîné améliore la récupération de tokens visuels pertinents, avec des gains mesurables sur plusieurs benchmarks image et vidéo.
arXiv cs.AI · cs.LG · cs.CL·Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu·30 juillet 2026
ReToken introduit un unique embedding apprenable servant de cible de récupération explicite pour sélectionner les tokens visuels pertinents dans un cache KV visuel pré-rempli. Entraîné sur un petit jeu de données image-QA, il améliore Qwen3VL-8B de 13,4 points et InternVL3.5 de 12,4 points sur Visual Haystacks, et transfère en zero-shot vers la vidéo longue avec un gain de 8,0 points sur LVBench. L'approche reste légère : entraînement et inférence tiennent sur un seul GPU H100.