RECHERCHE
Apprendre des modèles récurrents extrapolables en longueur
Une nouvelle méthode CST permet aux modèles récurrents de généraliser à des contextes bien plus longs que ceux utilisés lors de l'entraînement.
arXiv cs.AI · cs.LG · cs.CL·Hanwen Jiang·8 septembre 2026
Les modèles récurrents classiques échouent souvent à généraliser au-delà de leur horizon d'entraînement. Ce papier identifie le "state credit" comme le signal clé reliant les pertes futures aux états passés et propose la méthode Credit Stabilization through Time (CST). En stabilisant ce signal durant la rétropropagation, CST permet d'atteindre des performances sur des longueurs de contexte allant jusqu'à 128 fois la longueur d'entraînement.