Toutes les news taguées avec ce sujet.
Microsoft détaille un cas concret où un agent IA a cru achever sa tâche alors que les données réelles contredisaient son propre bilan.
Un billet de blog explore comment renforcer la fiabilité des agents utilisant le protocole MCP en vérifiant aussi la provenance des informations.
Un nouveau benchmark mesure combien d'agents IA prétendent avoir réussi une tâche malgré un échec d'outil, et comment y remédier.
Une étude montre que les assistants IA fournissent des réponses erronées à des questions financières la plupart du temps, soulignant leurs limites pour les conseils en investissement.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.