Toutes les news taguées avec ce sujet.
Une méthode qui combine cache principal exact et cache résiduel compact pour limiter les pertes d'information lors de la compression du KV cache en contexte long.
Face à la montée des workloads agentiques et à contexte long, NVIDIA plaide pour une co-conception de l'attention et du hardware GPU.
Hugging Face publie LFM2.5-Encoders, une solution optimisée pour le traitement de contextes longs.
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
Un modèle robotique étend le contexte visuomoteur à 8 000 pas de temps grâce au Test-Time Training, sans alourdir la latence d'inférence.
Des chercheurs identifient pourquoi certaines méthodes de linéarisation préservent mieux la qualité des LLMs, avec des résultats probants jusqu'à 32B paramètres.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.
Une méthode d'inférence sans entraînement améliore l'utilisation des preuves dans les LLMs sur des contextes de 128K tokens.
Microsoft Research présente Memora, un système de mémoire scalable pour agents IA qui réduit jusqu'à 98 % les tokens de contexte tout en battant l'état de l'art sur deux benchmarks.