RECHERCHE · NVIDIA
Entraînement efficace des modèles MoE pour la biologie
NVIDIA détaille l'entraînement des architectures Mixture-of-Experts pour les modèles fondation en biologie, une alternative aux transformers denses trop coûteux à scale.
Le passage à l'échelle des architectures denses devient prohibitif car chaque token active toutes les couches. Les architectures MoE contournent ce problème en utilisant de nombreux sous-réseaux experts, dont seuls un petit sous-ensemble est activé par token. NVIDIA présente une méthode d'entraînement efficace de ces modèles MoE appliqués aux modèles fondation biologiques.