Toutes les news taguées avec ce sujet.
Une méthode sans entraînement permet de quantifier en 8 bits l'état récurrent des architectures à attention linéaire, sans perte notable de qualité.
Une méthode de quantification spatio-temporelle réduit jusqu'à 68,7% la mémoire de serving tout en préservant la précision proche du FP32.
Un projet open source distribue l'inférence d'un LLM quantifié en 1,58 bit sur plusieurs microcontrôleurs ESP32-S3.
Une étude théorique établit des bornes de généralisation pour OPTQ et propose un nouveau choix du paramètre de régularisation λ.
Une méthode entraîne explicitement les poids d'un réseau à admettre une grammaire compressée plus petite, via un estimateur straight-through.
Une étude montre que la quantification pousse les modèles de raisonnement à produire des chaînes de pensée plus longues sans gain de précision réel.
La bibliothèque Transformers de Hugging Face intègre nativement les modèles quantifiés au format GGUF de llama.cpp.
Tim Dettmers présente une semaine dédiée à l'open source visant à rendre les modèles d'IA de pointe exécutables sur du matériel personnel.
Une nouvelle méthode de quantisation repousse les limites de compression des LLM ternaires sans perte significative de performance.
DealgnAI publie une version non censurée et optimisée FP8 de DeepSeek v4.1 Flash.
FOM-UL cible les couches influentes pour un oubli robuste, résistant à la quantisation.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.