Toutes les news taguées avec ce sujet.
Avec DeepSeek-V3 671B, NVIDIA atteint 1 648 TFLOPs par GPU sur GB300 NVL72, illustrant l'importance croissante de la communication inter-GPU.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
Tencent publie Hy3, un modèle MoE de 295 milliards de paramètres qui affiche des performances comparables aux modèles de taille trillion.
Un essai de réflexion sur le compromis fondamental entre largeur (MoE, parallélisme) et profondeur (chaînes de raisonnement) dans l'architecture des modèles de langage.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.