Toutes les news taguées avec ce sujet.
Une nouvelle méthode permet d'estimer le résultat d'un post-entraînement RL sans relancer l'entraînement, en combinant les politiques de modèles déjà optimisés.
Une nouvelle méthode reformule l'instabilité inhérente aux modèles flow-matching comme une ressource mesurable et budgetée, surpassant les stabilisateurs ajustés à la main.
Une nouvelle approche BPO optimise les politiques d'IA sans estimateur de valeur, améliorant le raisonnement mathématique.
Optimiser l'entraînement distribué via Async GRPO et LoRA sur Hugging Face Jobs sans dépendre de NCCL.
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.