Toutes les news taguées avec ce sujet.
Un projet open source montre comment entraîner un mini-transformer minimaliste extrêmement rapidement, à titre pédagogique ou expérimental.
Un nouveau papier de DeepSeek décrit une architecture permettant d'ajuster dynamiquement les ressources de calcul lors de l'entraînement de grands modèles.
NVIDIA détaille une optimisation technique pour entraîner des modèles Mixture of Experts sans perte de tokens, via son Transformer Engine intégré à JAX.