RECHERCHE
Le post-training des LLM vu comme de la maintenance logicielle « brownfield »
Une perspective industrielle sur l'ingénierie des données de post-training, entre budgets contraints et gains mesurables sur des benchmarks de code.
arXiv cs.AI · cs.LG · cs.CL·Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan·31 août 2026
Les auteurs comparent le post-training industriel des LLM à une maintenance de type brownfield : on part d'un checkpoint déployé et on applique des patches de mixture bornés, sans réentraînement complet. Une étude de cas sur l'amélioration de la génération de code montre qu'optimiser le rendement de la distillation augmente la supervision exploitable de 2,84x et améliore le pass@1 CodeForces de +2,59 points et LiveCodeBench v6 de +6,11 points, sans régression sur AIME et MATH.