Toutes les news taguées avec ce sujet.
Une nouvelle méthode réduit l'empreinte mémoire du KV cache en LLM tout en limitant la perte de précision, même à 2 bits.
Un nouveau mécanisme évite de reconstruire le cache KV à chaque compaction, avec un gain de vitesse d'entraînement jusqu'à 5x.
Un framework sans entraînement qui accélère les LLMs de diffusion en s'attaquant au goulot d'étranglement mémoire du cache KV.
Un papier propose de faire échanger des LLMs via leurs caches internes plutôt que par du texte généré, pour transmettre du sens plus directement.
Un décryptage technique de l'architecture de DeepSeek-V4.1 Flash, centré sur ses optimisations agressives de compression du cache clé-valeur.
Un dépôt GitHub questionne les gains réels des stratégies récentes de cache KV face à la simple politique LRU.