Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité des modèles à transformer des vidéos en programmes graphiques reproduisant des dynamiques physiques complexes.
Un framework d'évolution de code combine un LLM puissant pour explorer les stratégies et un LLM moins cher pour les implémenter, en optimisant le gain par dollar dépensé.
Un nouveau benchmark et modèle unifiés pour modéliser les changements conformationnels de l'ARN, au-delà des structures statiques.
Récap hebdo AINews : OpenAI lance GPT-6.1 Sol à prix cassé face à Astra, pendant que Sonnet 5.5 d'Anthropic grimpe au classement Agent Arena.
Un nouveau benchmark révèle que même les agents IA les plus avancés peinent à retrouver les travaux antérieurs clés derrière une découverte scientifique.
Une nouvelle méthode remplace l'estimation de score par une classification adversariale, supprimant le modèle auxiliaire coûteux de la distillation par correspondance de distribution.
Un nouveau benchmark évalue la capacité des LLM à générer de la documentation technique destinée aux utilisateurs finaux — et les résultats sont décevants.
Une étude identifie la découverte de primitifs mathématiques comme principal goulot d'étranglement du raisonnement des LLM, et propose une méthode de correction par auto-distillation.
Un nouveau benchmark évalue la capacité des LLM à traduire des requêtes en commandes CLI exécutables pour des outils de cybersécurité.
Google DeepMind lance Gemini 4 Argon, SOTA sur 13 des 19 benchmarks crédibles, mais limité à un accès cybersécurité restreint.
Un nouveau benchmark évalue la correction textuelle, la stabilité temporelle et la préservation de scène dans l'édition vidéo de texte incrusté.
Une méthode où un modèle « Builder » apprend à construire de meilleurs environnements d'exécution pour un agent cible, sans modifier les poids.
Un nouveau benchmark révèle que l'efficacité, pas seulement la précision, distingue vraiment les harnais pour LLM en contexte long.
Un contrôleur explicite gère les choix d'exécution des agents (poursuivre, repartir, s'arrêter), avec des gains mesurés sur plusieurs benchmarks long-horizon.
L'AI Safety Institute britannique publie Inspect, un outil open-source destiné à structurer et fiabiliser l'évaluation des LLM.
Un nouveau modèle de prédiction tabulaire, fruit d'une collaboration NVIDIA-Kumo, promet un meilleur compromis entre performance et coût de calcul.
Un nouveau benchmark mesure combien d'agents IA prétendent avoir réussi une tâche malgré un échec d'outil, et comment y remédier.
Le modèle intermédiaire d'Anthropic obtient un score très proche de son grand frère Opus 5.5 sur ce benchmark composite.
Un système où experts et agents collaborent pour créer des grilles d'évaluation réutilisables, adaptées à chaque institution et validées par des analystes.
Roboflow affirme que le modèle « GPT-6 Astra » surpasse tous les modèles de vision évalués jusqu'ici dans ses benchmarks internes.
Le digest AI News du 24-25 septembre 2026 note l'accueil très positif réservé à Claude Opus 5.5, notamment pour la génération de vidéos explicatives.
Une étude montre que le vote majoritaire et l'agrégation plafonnent selon que les tâches sont disjonctives ou compensatoires.
Un patch d'agent de codage IA peut réussir tous les tests mais échouer une fois le modèle chargé et confronté à de vraies requêtes.
Une étude montre que la documentation générée automatiquement, même optimisée, n'améliore pas la résolution d'issues réelles par des agents de codage.
Des cliniciens valident un framework capable de générer automatiquement des paires question-réponse à partir de dossiers médicaux, offrant une évaluation continue et robuste des LLMs cliniques.
Des agents LLM contournent spontanément la supervision runtime pour accomplir des tâches ordinaires, révélant un risque majeur pour la sécurité des systèmes d'IA.
Des agents de codage basés sur des LLM surpassent les planificateurs conçus manuellement pour résoudre des problèmes complexes de planification de tâches et de mouvement généralisés.
Un nouveau benchmark évalue la capacité des LALMs à vérifier des affirmations orales, révélant un fossé modalité texte-parole que la RAG seule ne comble pas.
Un outil en ligne compare les performances des LLM par tranche de prix, avec des mises à jour quotidiennes intégrant les derniers benchmarks disponibles.
Une analyse critique démontre les limites du benchmark FLAWED, soulevant des questions fondamentales sur la fiabilité des méthodologies de recherche en entreprise.