Toutes les news taguées avec ce sujet.
Une nouvelle loi d'échelle modélise conjointement récurrence et sparsité, et prédit plus finement les performances des modèles MoE bouclés.
Une méthode de post-training qui concentre les itérations supplémentaires sur les tokens qui en tirent vraiment profit, avec des gains mesurés sur AIME.
Analyse prospective sur les futures architectures LLM et le raisonnement latent.