Toutes les news taguées avec ce sujet.
Allen Institute for AI publie Olmo-core 3, une infrastructure open source conçue pour entraîner des modèles Mixture-of-Experts à grande échelle.
Le fabricant chinois de smartphones surprend en dévoilant un modèle frontière natif omnimodal, avec des variantes Flash et UltraSpeed.
NVIDIA détaille l'entraînement des architectures Mixture-of-Experts pour les modèles fondation en biologie, une alternative aux transformers denses trop coûteux à scale.
Une étude évalue comment le pruning affecte les appels d'outils contextuels sur plusieurs architectures et niveaux de complexité.
DeepSeek lance une nouvelle architecture causale hybride 763B-P8B-D16B avec vision, remplaçant V4 Pro.
Les modèles Mixture-of-Experts se dégradent plus vite que les denses avec les données répétées, malgré des régularisations partiellement efficaces.
NVIDIA détaille une technique d'optimisation d'inférence qui sépare l'encodage visuel du prefill et du decode, avec des gains jusqu'à 5x.
Une étude contrôlée évalue 13 modèles Qwen et GPT pour déterminer l'influence de la taille sur l'apprentissage d'ontologies.