Toutes les news taguées avec ce sujet.
Une méthode entraîne un token de mémoire compact à partir de VLM, évitant leur usage coûteux au moment de l'exécution des tâches robotiques.
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.
Un système de compréhension documentaire basé sur un VLM MoE compact réduit les coûts de plus de 80% face à l'annotation humaine, tout en battant des modèles bien plus gros.