Toutes les news taguées avec ce sujet.
NVIDIA détaille les compromis entre architectures denses et Mixture-of-Experts, à travers l'exemple de Nemotron 3.5 Lightning.
ESRL est un nouveau cadre qui optimise l'exploration des modèles MoE via le routage stochastique.
NVIDIA détaille une optimisation technique pour entraîner des modèles Mixture of Experts sans perte de tokens, via son Transformer Engine intégré à JAX.
Un système de compréhension documentaire basé sur un VLM MoE compact réduit les coûts de plus de 80% face à l'annotation humaine, tout en battant des modèles bien plus gros.