Toutes les news taguées avec ce sujet.
SNAP, un transformer auto-supervisé, montre qu'un décodeur plus simple et des objectifs en espace latent améliorent la qualité des représentations géométriques apprises.
VideoMSN détourne des Vision Transformers pré-entraînés sur des images pour apprendre des représentations vidéo, sans 3D ni reconstruction.