Toutes les news taguées avec ce sujet.
Une étude compare douze configurations de modèles sur des choix sémantiques dans des tâches scientifiques déterministes.
Un nouveau benchmark évalue la mémoire des agents via l'accomplissement de tâches réelles, en intégrant coût et latence, pas seulement la précision.
Un outil open source propose de remplacer les LLM utilisés comme juges par des décisions structurées et typées, dites « Jev ».
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.