RECHERCHE
Pivot-SD : une self-distillation efficace pour les modèles de langage à diffusion masquée
Une méthode cible uniquement les tokens-pivots les plus déterminants pour affiner les dLMs, avec un gain de performance à faible coût d'entraînement.
arXiv cs.AI · cs.LG · cs.CL·Seo Hyun Kim, Sunwoo Hong, Younwoo Choi, Chen-Hao Chao·2 octobre 2026
Les modèles de langage à diffusion masquée (dLMs) posent un problème d'attribution de crédit : certains engagements précoces pendant le débruitage déterminent fortement le reste de la réponse. Pivot-SD identifie ces « pivots » via une mesure de gain d'information et les supervise spécifiquement, par cross-entropie pour les trajectoires réussies et par unlikelihood ciblée pour les échecs. Avec seulement 200 questions et quatre rollouts chacune, la méthode améliore LLaDA-8B-Instruct par rapport au SFT classique et aux baselines RL à budget équivalent, sur des benchmarks de math et de code.