Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste si les modèles multimodaux peuvent deviner si deux personnes se connaissent déjà à partir d'un court échange filmé.
Un nouveau benchmark teste la capacité des agents LLM à mener des expériences ML itératives et à ajuster les hyperparamètres à partir des résultats observés.
Un développeur teste les modèles d'IA sur une tâche insolite et révélatrice : dessiner en SVG une grenouille au prognathisme prononcé.
Un nouveau dataset évalue la précision et l'exhaustivité des agents IA pour l'extraction guidée par schéma.
Un projet indépendant compare le coût d'exécution d'une tâche par un LLM à son équivalent en salaire humain, sur le modèle du Big Mac Index.
Un benchmark montre que les GPU MI355X d'AMD surpassent les B300 de Nvidia en performance par dollar pour l'inférence du modèle Kimi K3.
Un fil de discussion questionne la fiabilité et la portée réelle des performances mathématiques attribuées à des modèles d'IA récents.
Un nouveau benchmark mesure la capacité des modèles d'IA à gérer des tâches opérationnelles d'oncall.
Un benchmark compare modèles et frameworks d'agents sur des tâches d'ingénierie logicielle multi-langages, avec des résultats mis à jour régulièrement.
Une étude systématique montre que le calcul supplémentaire à l'inférence n'améliore pas toujours les agents CUA locaux, mais change surtout leur façon d'échouer.
13,6% des instances de SWE-bench Verified présentent un décalage entre pull request et issue, faussant l'évaluation des LLM sur la résolution de bugs.
Un système qui convertit les pull requests fusionnées en tâches vérifiées pour entraîner et évaluer les agents de codage.
Un benchmark évalue la fiabilité des VLM comme juges d'agents informatiques.
Anthropic lance Claude Opus 5, performant comme Fable mais deux fois moins cher, selon les évaluations indépendantes.
Une méthode légère à un seul embedding entraîné améliore la récupération de tokens visuels pertinents, avec des gains mesurables sur plusieurs benchmarks image et vidéo.
Un benchmark massif révèle les limites de la prédiction conforme classique sur les classes minoritaires et propose une méthode corrective plus fiable.
Un pipeline automatisé génère des environnements d'entraînement pour apprendre à des modèles compacts à coder des programmes entiers, de zéro à la maintenance.
Microsoft Research crée douze mondes d'entraînement à haute fidélité pour agents d'usage informatique, doublant les performances d'un modèle 9B.
Un nouveau benchmark évalue les agents LLM sur des workflows bureautiques longs avec des indicateurs économiques.
Une méthode en deux étapes améliore la génération de code via une phase d'exploration dédiée avant l'implémentation.
JuliaHub compare deux modèles frontière sur des tâches d'IA physique, un domaine encore peu couvert par les benchmarks classiques.
Une étude compare une architecture de diffusion neuronale (MARC) à un simple redémarrage aléatoire pour résoudre des systèmes de contraintes algébriques.
Une étude compare mélanges lognormaux, DeepONet et transformers sur la reconstruction de densités risque-neutre, sans vainqueur universel.
Mercor et Ramp lancent un benchmark fermé de 160 tâches comptables. Aucun modèle ne dépasse 56% de réussite moyenne.
En activant la rétention du raisonnement et la compaction, GPT-5.6 voit ses performances et son efficacité fortement progresser sur ce benchmark.
Un benchmark interne montre que le self-hosting du modèle Kimi K3 améliore la résolution de tâches de 20% pour un surcoût matériel équivalent.
Neuf modèles fondation pour données tabulaires testés sur des scénarios de shift de distribution : tous se dégradent, quelle que soit leur architecture.
Un nouveau benchmark teste la capacité des modèles d'IA à comprendre les transitions d'interface graphique sur desktop.
APS-RAG combine recherche dense, sparse et graphe de connaissances pour interroger des décennies de savoir opérationnel d'un accélérateur de particules.
Un benchmark indépendant compile des mesures de performance d'inférence LLM sur puces Apple Silicon, données publiées sous licence CC BY 4.0.