RECHERCHE
Quantization des LLM : pourquoi mieux vaut répartir la précision globalement
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
arXiv cs.AI · cs.LG · cs.CL·Jundong Hu, Shekar Ramachandran·1 septembre 2026
Des chercheurs testent trois hypothèses sur l'origine des pertes de précision liées à la quantization post-entraînement (PTQ) des LLM, sans qu'aucune ne prédise correctement les couches à restaurer. La récupération de précision s'avère diffuse pour 8 modèles sur 9, sauf Qwen3-8B. À budget égal, allouer la précision globalement via une granularité plus fine surpasse la réparation sélective des couches, de 21 à 52 points.