Toutes les news taguées avec ce sujet.
Un cadre unifié pour généraliser des modèles ML à des entrées de tailles arbitraires, jamais vues à l'entraînement, via des maps d'échantillonnage.
Un nouveau mécanisme de récompense double pour ancrer le raisonnement des VLMs dans la réalité physique et réduire les hallucinations dans les tâches interactives.
Un nouveau framework limite les fuites d'information et préserve la capacité d'exploration des LLMs lors de la distillation sur politique.
Une approche non supervisée exploite l'asymétrie vérification/recherche pour résoudre des problèmes d'optimisation combinatoire avec moins de calcul.
Des chercheurs montrent qu'une pénalité de norme simple peut accélérer le grokking jusqu'à 6x en contraignant les représentations cachées sur une hypersphère.