Toutes les news taguées avec ce sujet.
Une méthode qui combine cache principal exact et cache résiduel compact pour limiter les pertes d'information lors de la compression du KV cache en contexte long.
Face à la montée des workloads agentiques et à contexte long, NVIDIA plaide pour une co-conception de l'attention et du hardware GPU.
Un billet de blog décortique pas à pas la logique derrière ce mécanisme d'attention, en le rendant accessible aux non-spécialistes.
Hugging Face publie la troisième partie de sa série sur le profilage PyTorch, focalisée sur les mécanismes d'attention et leur analyse de performance.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
Des chercheurs identifient pourquoi certaines méthodes de linéarisation préservent mieux la qualité des LLMs, avec des résultats probants jusqu'à 32B paramètres.
Une nouvelle architecture d'attention combinant filtrage spectral et convolution de graphes surpasse l'attention linéaire classique pour le débruitage.