Toutes les news taguées avec ce sujet.
Queen, un modèle de 4 milliards de paramètres, combine un moteur d'échecs silencieux et un LM pour atteindre le niveau Grand Maître tout en expliquant ses décisions.
Un site propose de deviner le comportement d'une fonction mystère à partir d'exemples, un exercice ludique de raisonnement algorithmique.
Un nouveau cadre couple génération discrète de tokens et trajectoire latente continue pour améliorer les modèles de diffusion textuelle.
Un nouveau harnais visuel dote les modèles multimodaux d'une mémoire longue durée, propulsant Claude Opus 5.0 à un score parfait sur ARC-AGI-3.
Le co-créateur d'AlphaGo revient sur le coup 37 contre Lee Sedol pour expliquer pourquoi le raisonnement véritable fait encore défaut aux LLM actuels.
Une nouvelle loi d'échelle modélise conjointement récurrence et sparsité, et prédit plus finement les performances des modèles MoE bouclés.
Un papier de 2021 explore comment doter les systèmes d'IA d'une métacognition inspirée du modèle dual de Kahneman, resurgi dans les discussions HN.
Le laboratoire de R&D H Company expose sa philosophie de conception associant raisonnement rapide et lent pour développer de nouveaux systèmes d'IA.
Anthropic publie une note de recherche sur les capacités de raisonnement itératif de Claude, en réponse à des questions sur ses limites.
Une méthode de distillation on-policy corrige les biais d'exposition amplifiés par la quantification sub-3-bit, restaurant la performance des modèles sur les tâches de raisonnement long.
Google DeepMind dévoile deux nouvelles variantes de Gemini axées sur l'interaction en temps réel et le raisonnement approfondi.
Une méthode injecte des traces de raisonnement d'un modèle enseignant pour débloquer l'exploration en RL sur les modèles de diffusion.
Un nouveau cadre sans entraînement transforme le traitement du contexte long en convolution hiérarchique, réduisant latence et risque de surapprentissage.
OpenAI publie une solution générée par IA à l'un des sept problèmes du millénaire, avec preuve formelle en Lean.
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
Les LLM ne se limitent pas à la prédiction statistique du mot suivant.
Un framework de raisonnement structuré vise à réduire les hallucinations des LLM appliqués au diagnostic de pannes réseau 5G/6G.
Le chercheur en informatique quantique revient sur la capacité des grands modèles de langage à raisonner sur eux-mêmes.
Un développeur détaille comment atteindre 44 % de score sur le benchmark ARC-AGI-1 avec un budget de calcul dérisoire.