Toutes les news taguées avec ce sujet.
Le modèle Astra aurait réussi à résoudre dix problèmes majeurs non résolus en mathématiques et en informatique.
Une étude montre que les capacités de raisonnement avancé des grands modèles de langue n'améliorent pas leurs performances en trading.
Les modèles semblent raisonner, mais leurs mécanismes internes divergent souvent de la logique humaine.
Une étude contrôlée sur 36 comparaisons montre qu'aucune méthode d'auto-critique ne surpasse le sampling répété une fois le coût en tokens égalisé.
Une nouvelle méthode généralise l'auto-distillation on-policy en introduisant un paramètre β pour équilibrer stabilité et performance.
En activant la rétention du raisonnement et la compaction, GPT-5.6 voit ses performances et son efficacité fortement progresser sur ce benchmark.
Un nouveau cadre d'entraînement par auto-jeu pour améliorer les capacités de raisonnement et d'usage d'outils des LLM.
Une discussion technique explore ce que recouvre réellement le paramètre 'effort' proposé par certains fournisseurs de LLM.
Moonshot AI publie un nouveau modèle multimodal sur Hugging Face.
Un nouveau cadre transfère le raisonnement logique de modèles textuels vers des modèles audio via un alignement on-policy.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Une variante du GRPO utilisant des informations privilégiées guide le modèle vers des solutions correctes sans déstabiliser l'apprentissage.
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
Analyse technique des méthodes pour optimiser les ressources de calcul.
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
Un post Reddit relaie une affirmation selon laquelle GPT-5.6 aurait résolu un problème ouvert en optimisation convexe, dans la foulée de l'annonce d'OpenAI sur une preuve mathématique.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Une nouvelle méthode permet de corriger directement les erreurs de raisonnement des LLM sans tout régénérer, avec un gain de correction de 25%.
Un challenge massif sur le modèle Nemotron identifie les techniques les plus efficaces pour améliorer les capacités de raisonnement des IA.
Une architecture multi-agents surpasse les systèmes classifs au challenge QANTA 2026 via des politiques de raisonnement ciblées.
Un outil open-source pour rendre visibles les raisonnements internes des grands modèles de langage, présenté sur Hacker News.