Toutes les news taguées avec ce sujet.
Une analyse théorique montre la convergence presque sûre du gradient de politique vers le bras optimal, avec un regret borné en O(log T).
Le WCM corrige l'estimation de valeur dans le RL robotique en modélisant explicitement la dynamique temporelle.
Une étude théorique montre que l'interaction avec l'expert allège les exigences de représentation du modèle, avec un nouvel algorithme à l'appui.
Une méthode d'alignement sans données de référence améliore la prédiction de structures cristallines et protéiques via récompenses physiques.
Microsoft Research crée douze mondes d'entraînement à haute fidélité pour agents d'usage informatique, doublant les performances d'un modèle 9B.
L'étude remet en cause l'intérêt du pré-entraînement des Q-fonctions lors du fine-tuning online en RL.
Un simulateur GPU multi-agents rend les vues caméra de chaque agent en temps réel, permettant d'entraîner des politiques de conduite sans observations privilégiées.
Une nouvelle méthode d'apprentissage asymétrique améliore les représentations d'état pour les algorithmes de type Dreamer.
Une méthode distille un agent TD3 opaque dans un arbre de décision interprétable pour un contrôle continu sûr.
Une étude systématique en environnement contrôlé décortique comment les modèles acquièrent et affinent la capacité de planification longue durée.
Un fine-tuning par renforcement peu coûteux permet à un petit modèle open-weights de dépasser les SOTA sur une tâche de revue de catalogue.
Un framework génératif accélère d'un ordre de grandeur la synthèse de circuits quantiques pour la chimie computationnelle, testé sur du matériel Quantinuum réel.
Des chercheurs testent des cartes de saillance pour rendre lisibles les décisions d'un agent RL chargé d'éviter les zones interdites de vol.
Un nouveau cadre d'entraînement par auto-jeu pour améliorer les capacités de raisonnement et d'usage d'outils des LLM.
Un framework open-source pour entraîner des agents de bout en bout via des infrastructures d'inférence complexes.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Un système de téléprésence combinant réalité virtuelle et RL adapté aux robots humanoïdes miniatures, testé sur la plateforme ROBOTIS OP3.
Une étude explore si les LLM peuvent extraire des stratégies réutilisables de leurs propres traces de résolution, comme le font les humains avec l'expérience.
Une variante du GRPO utilisant des informations privilégiées guide le modèle vers des solutions correctes sans déstabiliser l'apprentissage.
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
Un cadre utilisant des outils spécialisés et le reinforcement learning pour améliorer la vérification de réclamations scientifiques.
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
Un nouveau cadre basé sur la diffusion estime l'écart de dynamique entre domaines pour adapter des politiques de RL avec peu d'interactions cible.
Une étude exploratoire compare Muon à AdamW en post-training RL sur des tâches agentiques à récompense éparse, avec des gains significatifs sous certaines conditions.
Une nouvelle méthode combine RL et différentiabilité des dynamiques physiques pour réduire drastiquement le nombre d'interactions nécessaires.
Une méthode RL adaptée aux générateurs de vélocité moyenne qui optimise le récompense sans altérer la vitesse d'échantillonnage.
Optimisation du remplacement préventif de machines via des approches bandit et estimation non paramétrique.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Une méthode d'apprentissage par renforcement affine le crédit accordé à chaque action d'un agent, sans critique additionnelle ni supervision coûteuse.
Une nouvelle stratégie de reset guidé par des configurations performantes améliore l'efficacité et la généralisation du RL pour la conception de circuits.