RECHERCHE
PoEM : prédire les résultats de l'RL à partir de politiques existantes
Une nouvelle méthode permet d'estimer le résultat d'un post-entraînement RL sans relancer l'entraînement, en combinant les politiques de modèles déjà optimisés.
arXiv cs.AI · cs.LG · cs.CL·Kimia Hamidieh, Giannis Daras, Antonio Torralba·24 septembre 2026
Le post-entraînement des modèles de fondation par RL est coûteux et instable, nécessitant un reclcul complet à chaque changement de fonction de récompense. PoEM propose de prédire la politique résultante d'une nouvelle récompense en combinant les log-policies de modèles déjà post-entraînés. Les auteurs montrent que ces log-policies occupent un sous-espace de rang faible, permettant d'approximer la nouvelle politique sans entraînement RL supplémentaire. L'approche est validée sur des récompenses synthétiques et réelles, en modalités texte et image.