Toutes les news taguées avec ce sujet.
Une méthode d'attribution de crédit au niveau des tokens améliore la robustesse du raisonnement des LLM entraînés par RLVR.
PostHog publie Jeeves, un projet explorant comment le raisonnement renforce les modèles de décision inspirés de Jev.
Une méthode de post-training qui concentre les itérations supplémentaires sur les tokens qui en tirent vraiment profit, avec des gains mesurés sur AIME.
Un fine-tuning auto-supervisé basé sur la confiance réduit de 25% les tokens générés par les modèles de raisonnement, sans perte de précision.
Un nouveau modèle du monde corrige les raisonnements bruités des agents LLM plutôt que de simuler les retours des outils.
Évaluation de l'efficacité communicative de six LLM dans un jeu de questions-réponses à asymétrie d'information.
Une nouvelle approche BPO optimise les politiques d'IA sans estimateur de valeur, améliorant le raisonnement mathématique.
Le modèle Qwen 3.8 adopte une approche de préremplissage similaire au raisonnement de GPT-5.5 Pro.
Analyse prospective sur les futures architectures LLM et le raisonnement latent.
L'approche probabiliste jugée risquée par les spécialistes de la sécurité de l'IA.
Une nouvelle méthode RLVR identifie la première erreur de raisonnement pour guider l'entraînement des LLM.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.