Toutes les news taguées avec ce sujet.
Apple publie un modèle vision-langage qui encode les documents comme des images compressées, réduisant le coût du traitement de longs contextes.
Un modèle vision-langage ouvert conçu pour interpréter les scanners CT volumétriques et reproduire le raisonnement diagnostique des radiologues.
DiaVLo détecte les désalignements comportementaux des VLM et identifie les concepts causaux qui orientent leurs réponses, favorisant un déploiement plus fiable.
Une interface sémantique compacte permet aux modèles vision-langage de contrôler des robots par zero-shot ou fine-tuning rapide.
SAGE interroge un VLM seulement en cas d'incertitude pour distiller une politique RL légère, autonome à l'évaluation.