RECHERCHE
LeapQuant : quantification précise de l'état récurrent pour l'attention linéaire efficace
Une méthode sans entraînement permet de quantifier en 8 bits l'état récurrent des architectures à attention linéaire, sans perte notable de qualité.
arXiv cs.AI · cs.LG · cs.CL·Yi Pan, Haocheng Xi, Kan Zhu, Xingyang Li·29 septembre 2026
LeapQuant s'attaque au goulot d'étranglement de l'attention linéaire (GDN, KDA) en proposant une quantification par fenêtre et des « Compensator Tokens » pour préserver les valeurs aberrantes de l'état récurrent. Cette approche training-free réduit fortement la mémoire et le calcul à l'inférence tout en maintenant une précision proche du FP32, validée sur les familles Qwen, Kimi et GLM.