Toutes les news taguées avec ce sujet.
Une nouvelle architecture fait tourner les mêmes blocs Transformer plusieurs fois par étape de diffusion, surpassant des modèles 6,5x plus gros à compute réduit.
Des interventions architecturales permettraient de modifier les lois d'échelle, avec des gains de calcul croissants selon la taille du modèle.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.