Toutes les news taguées avec ce sujet.
Les modèles Mixture-of-Experts se dégradent plus vite que les denses avec les données répétées, malgré des régularisations partiellement efficaces.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.