Toutes les news taguées avec ce sujet.
Une nouvelle approche d'examen conversationnel et multimodal pour évaluer la cognition.
Une étude montre que les capacités de raisonnement avancé des grands modèles de langue n'améliorent pas leurs performances en trading.
Un nouveau benchmark mesure la capacité des modèles d'IA à gérer des tâches opérationnelles d'oncall.
Un benchmark évalue la fiabilité des VLM comme juges d'agents informatiques.
Des chercheurs proposent AISPA, une méthode pour auditer les instructions système des produits IA selon 8 dimensions.
Des évaluations montrent que si les agents gèrent l'ingénierie, ils échouent à résoudre des problèmes de recherche ouverts.
Un nouveau benchmark teste la capacité des modèles d'IA à comprendre les transitions d'interface graphique sur desktop.
Les LLM sont incapables d'évaluer leur propre certitude. Demander un score de confiance induit une illusion de fiabilité.
Mozilla détaille ses contributions à la conférence ACM FAccT 2026 sur l'éthique de l'IA.
Un nouveau cadre et benchmark pour mesurer la complétude factuelle des générations longues via des méta-rubriques à deux niveaux.
Une étude évalue la capacité des grands modèles de langage à analyser et comprendre en profondeur les papiers scientifiques en architecture informatique.
Hugging Face dévoile Real World VoiceEQ, un nouveau benchmark pour évaluer la qualité humaine des modèles de voix.
Publication d'annotations détaillées pour le benchmark HellaSwag par Pleias.