Toutes les news taguées avec ce sujet.
Une méthode de distillation on-policy corrige les biais d'exposition amplifiés par la quantification sub-3-bit, restaurant la performance des modèles sur les tâches de raisonnement long.
Une correction token par token pour guider précisément les réponses des modèles, avec 52% de temps d'annotation en moins.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.