Toutes les news taguées avec ce sujet.
Liquid AI publie LFM2.5-VL-DSpark, un modèle vision-langage optimisé par une architecture de sparse mixture-of-experts pour une inférence plus rapide.
Apple publie un modèle vision-langage qui encode les documents comme des images compressées, réduisant le coût du traitement de longs contextes.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
Un nouveau système, Kuafu, synthétise automatiquement des programmes sémantiques pour entraîner des politiques robotiques sans démonstrations ni récompenses manuelles.