Toutes les news taguées avec ce sujet.
Une méthode d'attribution de crédit au niveau des tokens améliore la robustesse du raisonnement des LLM entraînés par RLVR.
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
Hugging Face montre comment améliorer les sorties structurées d'un petit modèle via GRPO avec TRL, en seulement 100 étapes d'entraînement.
Une entreprise unifie 200+ applications internes sur un seul LLM en fusionnant des experts GRPO entraînés séparément via SLERP en deux étapes.