Toutes les news taguées avec ce sujet.
Une méthode cible uniquement les tokens-pivots les plus déterminants pour affiner les dLMs, avec un gain de performance à faible coût d'entraînement.
Une étude identifie la découverte de primitifs mathématiques comme principal goulot d'étranglement du raisonnement des LLM, et propose une méthode de correction par auto-distillation.
Une nouvelle méthode permet d'estimer le résultat d'un post-entraînement RL sans relancer l'entraînement, en combinant les politiques de modèles déjà optimisés.
Nathan Lambert s'entretient avec JS Denain d'Epoch AI sur la RSI, le retard chinois en IA, la distillation et la sécurité des modèles ouverts face aux modèles fermés.
Un pipeline transforme des logiciels de bureau réels en environnements hybrides pour entraîner des agents combinant interface graphique et ligne de commande.
Un framework transforme les historiques d'exécution d'agents en environnements reproductibles pour générer des tâches synthétiques et améliorer le post-training.
Une entreprise unifie 200+ applications internes sur un seul LLM en fusionnant des experts GRPO entraînés séparément via SLERP en deux étapes.
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.
Une perspective industrielle sur l'ingénierie des données de post-training, entre budgets contraints et gains mesurables sur des benchmarks de code.