Toutes les news taguées avec ce sujet.
Une méthode de post-training qui concentre les itérations supplémentaires sur les tokens qui en tirent vraiment profit, avec des gains mesurés sur AIME.
Privilégier la diversité des stratégies plutôt que la seule exactitude des réponses produit de meilleures données d'auto-entraînement pour les LLM.
Une technique d'autocompaction qui réduit de 50% le coût contextuel des agents tout en améliorant leurs performances sur Terminal-Bench et KernelBench, sans dérive de contexte.