Toutes les news taguées avec ce sujet.
Une nouvelle loi d'échelle modélise conjointement récurrence et sparsité, et prédit plus finement les performances des modèles MoE bouclés.
Un nouveau mécanisme évite de reconstruire le cache KV à chaque compaction, avec un gain de vitesse d'entraînement jusqu'à 5x.
Une méthode de post-training qui concentre les itérations supplémentaires sur les tokens qui en tirent vraiment profit, avec des gains mesurés sur AIME.
Un fine-tuning auto-supervisé basé sur la confiance réduit de 25% les tokens générés par les modèles de raisonnement, sans perte de précision.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Une méthode de compilation qui transforme une description textuelle en petit modèle spécialisé, autonome et réutilisable, sans dépendre d'un LLM distant.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
Une analyse examine le rapport entre performance des LLM et coût d'inférence, questionnant la course à la puissance brute.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Un développeur détaille comment atteindre 44 % de score sur le benchmark ARC-AGI-1 avec un budget de calcul dérisoire.