RECHERCHE · NVIDIA
Modèles denses vs MoE : paramètres actifs, débit et critères de choix
NVIDIA détaille les compromis entre architectures denses et Mixture-of-Experts, à travers l'exemple de Nemotron 3.5 Lightning.
Un article technique NVIDIA explique comment un modèle MoE de 30 milliards de paramètres peut n'en activer que 3 milliards par token, tout en conservant la capacité du modèle complet. Le texte compare architectures denses et MoE en termes de débit, de coût d'inférence et de cas d'usage, en s'appuyant sur Nemotron 3.5 Lightning comme illustration.