Toutes les news taguées avec ce sujet.
Les modèles vision-langage sont sensibles à l'ordre des entrées. Une méthode d'adaptation corrige ce biais et améliore les performances.
Une méthode découple fréquence de mise à jour et d'application de la mémoire pour permettre du rendu temps réel sur des scènes dynamiques prolongées.
Un modèle robotique étend le contexte visuomoteur à 8 000 pas de temps grâce au Test-Time Training, sans alourdir la latence d'inférence.