Toutes les news taguées avec ce sujet.
Un robot bimanuel fixe des points 3D comme un œil humain pour manipuler finement sans caméra de poignet, via RL hiérarchique.
Un nouveau papier explique pourquoi le gradient de politique exact perd face à l'entropie croisée, et propose une « horizon loss » qui comble l'écart.
Cloudflare dévoile Clef, une famille de modèles de décision à poids ouverts, accompagnée d'une plateforme de fine-tuning par renforcement.
Un nouvel algorithme de RL en ligne améliore les politiques via un critique sans différencier celui-ci par rapport aux actions, pour des mises à jour plus fiables.
Un modèle de langage protéique entraîné sur 54 millions d'IDR, combiné à une méthode RL-SAE, permet de concevoir des séquences désordonnées fonctionnelles de façon contrôlable.
Une méthode entraîne un petit modèle « conseiller » à guider des LLM figés plus puissants, avec des gains mesurés sur BFCL-v3 et EnvScaler.
Des chercheurs proposent une nouvelle politique qui dépasse la borne classique en 1/√N pour une famille de processus de décision markoviens couplés.
Un nouveau mécanisme évite de reconstruire le cache KV à chaque compaction, avec un gain de vitesse d'entraînement jusqu'à 5x.
Un nouveau cadre de RL utilise des démonstrations main-objet humaines pour résoudre l'exploration en manipulation robotique dextre.
Une nouvelle méthode entraîne un modèle proposeur à réviser le harness d'un agent via retour d'exécution, sans mise à jour des poids.
Une méthode de fine-tuning basée uniquement sur des explications rétrospectives rivalise avec GRPO sur SWE-bench, sans reward ni verifier.
Une méthode de RL entraîne conjointement diagnostic textuel et révision d'image pour que les modèles unifiés corrigent leurs propres générations.
Privilégier la diversité des stratégies plutôt que la seule exactitude des réponses produit de meilleures données d'auto-entraînement pour les LLM.
Une méthode qui détecte la dérive du contexte dans le Decision Transformer et filtre les suffixes fiables avant de choisir l'action optimale.
Une nouvelle attaque par inversion de gradients exploite la structure temporelle des gradients de politique pour reconstituer quasi-parfaitement les trajectoires privées des agents en RL incarnée.
Une nouvelle méthode de world model améliore fortement la planification robotique en distinguant mieux les actions candidates plutôt que la seule prédiction factuelle.
Un article de blog décortique le RLCD, une technique d'entraînement par renforcement citée comme clé du modèle Jev.
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
Un nouveau cadre théorique permet à des agents en équipe d'apprendre des politiques quasi-optimales sans coordinateur central ni modèle connu du système.
Une méthode identifie précisément quels appels de modèle méritent l'entraînement dans les interactions multi-tours avec outils, améliorant les performances de 14 points sur certaines tâches.
Un nouveau framework multi-plateforme entraîne des agents à mélanger interaction GUI et développement logiciel via des tâches de recréation vérifiables.
Une pipeline agentique transforme des dépôts open-source en environnements d'entraînement RL, sans dépendre des issues ou commits.
Une méthode de distillation adaptative améliore les agents RL en désactivant le professeur une fois l'étudiant performant.
Une correction additive corrige le biais de dérive entre moteurs d'entraînement et d'inférence, source d'instabilité du RL sur les LLM.
Une infrastructure convertit les dépôts de code scientifique en environnements exécutables pour entraîner et évaluer des agents IA.
Un article de blog explore comment appliquer les principes de « Never Give Up » à l'apprentissage par renforcement des LLM sur des tâches complexes.
Un espace de travail de recherche qui combine évolution du harness et renforcement du modèle pour des agents scientifiques qui s'améliorent en continu.
Une synthèse explore les connexions théoriques entre cinq disciplines : contrôle, transport optimal, inférence, thermodynamique et machine learning.
Un nouveau cadre de meta-reinforcement learning garantissant la sécurité lors de l'adaptation à de nouvelles tâches.
Une nouvelle approche BPO optimise les politiques d'IA sans estimateur de valeur, améliorant le raisonnement mathématique.