RECHERCHE
Planning to Learn : repenser le gradient de politique via un horizon d'apprentissage
Un nouveau papier explique pourquoi le gradient de politique exact perd face à l'entropie croisée, et propose une « horizon loss » qui comble l'écart.
arXiv cs.AI · cs.LG · cs.CL·Ian Osband·2 octobre 2026
L'auteur montre que le gradient de politique exact, bien que mathématiquement précis sur la classification, reste myope car il ignore l'apprentissage restant. L'entropie croisée correspond à une version « patiente » de cette perte, à horizon infini. La horizon loss, qui interpole entre les deux selon l'avancement de l'entraînement, améliore la précision top-1 sur MNIST et ImageNet (ResNet-50, ResNet-101, ViT-S/16), surtout en présence de bruit d'étiquetage.