OUTILS · NVIDIA
NVIDIA accélère l'entraînement dropless des modèles MoE dans JAX avec Transformer Engine
NVIDIA détaille une optimisation technique pour entraîner des modèles Mixture of Experts sans perte de tokens, via son Transformer Engine intégré à JAX.
NVIDIA présente une méthode pour accélérer l'entraînement dropless des modèles Mixture of Experts (MoE) dans JAX grâce à son Transformer Engine. L'architecture MoE, utilisée par DeepSeek, Qwen ou Mixtral, permet d'atteindre des performances comparables aux modèles denses avec un coût de calcul réduit grâce au calcul conditionnel.