Toutes les news taguées avec ce sujet.
Une nouvelle méthode réduit l'empreinte mémoire du KV cache en LLM tout en limitant la perte de précision, même à 2 bits.
Une méthode de distillation on-policy corrige les biais d'exposition amplifiés par la quantification sub-3-bit, restaurant la performance des modèles sur les tâches de raisonnement long.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.