Toutes les news taguées avec ce sujet.
VideoMSN détourne des Vision Transformers pré-entraînés sur des images pour apprendre des représentations vidéo, sans 3D ni reconstruction.
Une étude montre que les poids MLP des ViT Softmax se transfèrent tels quels vers les ViT linéaires, tandis que l'attention doit être distillée pour combler l'écart de performance.
Une méthode entraîne explicitement les poids d'un réseau à admettre une grammaire compressée plus petite, via un estimateur straight-through.
Une méthode unifiée combine pruning, quantization et distillation pour déployer des ViTs sur des appareils agricoles contraints.