Toutes les news taguées avec ce sujet.
Une méthode qui combine cache principal exact et cache résiduel compact pour limiter les pertes d'information lors de la compression du KV cache en contexte long.
Une étude théorique et empirique révèle un paradoxe : la méthode de compression la plus efficace en pratique est aussi celle qui diverge en théorie.
Un framework à base d'autoencodeur promet des taux de compression bien plus élevés pour les données volumétriques scientifiques, sans réentraînement par fichier.
Une nouvelle méthode de compression exploitant les données auto-générées surpasse les limites du prequential coding.
Une méthode de régularisation sans état qui améliore la compressibilité des réseaux de neurones avec moins de 1 % de surcoût à l'entraînement.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.
Un outil open-source propose une technique de « context folding » déterministe pour optimiser la gestion du contexte dans les agents IA.
SigMap promet de réduire massivement la consommation de tokens lors des sessions de codage assistées par IA, en ne transmettant que les informations sémantiquement significatives.