Toutes les news taguées avec ce sujet.
Une étude montre que le vote majoritaire et l'agrégation plafonnent selon que les tâches sont disjonctives ou compensatoires.
NVIDIA détaille l'entraînement des architectures Mixture-of-Experts pour les modèles fondation en biologie, une alternative aux transformers denses trop coûteux à scale.
Une étude identifie deux mécanismes distincts expliqués par le gating de la voie de valeur dans les modèles de langage : abstention et filtrage du bruit.
Le PDG d'OpenAI indique que la société pourrait ralentir sa cadence si les gains d'intelligence s'avéraient minimes.
Un thread relève une croissance rapide de la taille des paramètres des world models publiés en open-weights, au rythme d'un doublement semestriel.
L'infrastructure d'inférence nécessite une optimisation globale mémoire, stockage et réseau pour réduire latence et coûts.
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.