Toutes les news taguées avec ce sujet.
Une méthode qui combine cache principal exact et cache résiduel compact pour limiter les pertes d'information lors de la compression du KV cache en contexte long.
Une méthode de réplication prédictive du cache KV optimise l'inférence lors des pics de charge.
Une nouvelle façon de penser la gestion de mémoire des LLM révèle les limites des méthodes existantes sur des benchmarks tiers indépendants.
Une fenêtre glissante appliquée uniquement au module de prédiction multi-token accélère le décodage spéculatif sans perte de qualité sur des contextes massifs.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.