RECHERCHE
Étudier les tokenizers d'images comme langages visuels dans les modèles multimodaux unifiés
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
arXiv cs.AI · cs.LG · cs.CL·Siting Li, Zhengyang Wang, Simon Shaolei Du, Xi Chen·8 septembre 2026
Les chercheurs analysent comment les tokenizers d'images influencent l'apprentissage conjoint texte-image via un banc d'essai autorégressif contrôlé. Ils montrent que les pertes doivent être analysées par tâche, que la relation perte-performance dépend de l'espace de tokens prédit, et qu'une meilleure reconstruction n'implique pas nécessairement de meilleures performances en aval.