Toutes les news taguées avec ce sujet.
Une étude systématique montre que le calcul supplémentaire à l'inférence n'améliore pas toujours les agents CUA locaux, mais change surtout leur façon d'échouer.
OpenAI dévoile GPT-5.6, optimisant l'efficacité de l'inférence et des workflows agents pour maximiser l'intelligence par dollar.
Une nouvelle méthode de routage ajuste dynamiquement le nombre d'experts activés selon l'incertitude du modèle, token par token.
Une méthode sélective réduit de moitié les paramètres entraînables du fine-tuning LoRA en ciblant les matrices les plus informatives.
Un framework où un petit modèle décide lui-même quand solliciter un LLM, réduisant fortement les coûts d'inférence sans sacrifier la précision.
Une méthode pour agrandir le vocabulaire d'un modèle déjà entraîné sans repartir de zéro, appliquée à LFM2.5-8B-A1B.
Des chercheurs montrent que l'échec d'un agent LLM est prévisible dès le premier tour via ses représentations internes, permettant d'économiser jusqu'à 47 % du calcul d'inférence.
Une nouvelle méthode structure la compression de tokens visuels comme un problème de maximisation submodulaire, filtrant le bruit textuel par entropie statistique.
Une étude montre qu'affiner un seul layer d'un Transformer via RL atteint des performances comparables à l'entraînement complet de tous les paramètres.
Des chercheurs proposent de découpler le flux de calcul des Transformers en deux flux distincts, améliorant l'efficacité et les performances sur les tâches en aval.