RECHERCHE · Hugging Face
LensVLM : Apple compresse le contexte long sous forme d'images, en n'agrandissant que les pages pertinentes
Apple publie un modèle vision-langage qui encode les documents comme des images compressées, réduisant le coût du traitement de longs contextes.
LensVLM-9B, publié par Apple sur Hugging Face, adopte une approche originale : transformer le contexte long en représentations visuelles compressées, puis n'étendre en haute résolution que les pages jugées pertinentes pour la requête. Cette méthode viserait à réduire le coût computationnel du traitement de documents longs par rapport aux approches classiques de fenêtre de contexte textuelle.