Toutes les news taguées avec ce sujet.
Une nouvelle loi d'échelle modélise conjointement récurrence et sparsité, et prédit plus finement les performances des modèles MoE bouclés.
800 modèles entraînés révèlent que le texte IA dans les corpus web profite d'abord puis nuit à la qualité du pretraining, selon les volumes disponibles.
Des interventions architecturales permettraient de modifier les lois d'échelle, avec des gains de calcul croissants selon la taille du modèle.