RECHERCHE
Moins de décodeur, plus d'encodeur : apprentissage de représentations géométriques via la synthèse de nouvelles vues
SNAP, un transformer auto-supervisé, montre qu'un décodeur plus simple et des objectifs en espace latent améliorent la qualité des représentations géométriques apprises.
arXiv cs.AI · cs.LG · cs.CL·Keerthi Kaashyap, Dennis Anthony, Akshay Krishnan, Nhi Ngoc Nguyen·2 octobre 2026
Les méthodes de synthèse de nouvelles vues par encodeur produisent souvent des représentations médiocres, non par manque de signal mais à cause de choix architecturaux : décodeurs trop expressifs et cibles en espace pixel. SNAP, un transformer encodeur-décodeur auto-supervisé, utilise un décodeur local conditionné par la pose et une reconstruction en espace latent. Il rivalise avec des méthodes supervisées sur cinq tâches (localisation visuelle, estimation de pose, correspondance de points, profondeur, manipulation robotique) et montre une invariance de point de vue émergente malgré un budget de calcul réduit.