Toutes les news taguées avec ce sujet.
Une étude empirique montre que le taux de compilation, indicateur phare pour évaluer la réparation de code par IA, récompense en réalité les non-corrections.
Un nouveau benchmark de 980 questions révèle un écart marqué entre précision en QCM et qualité des réponses ouvertes chez les LLM sur l'arabe coranique.
Évaluation de l'efficacité communicative de six LLM dans un jeu de questions-réponses à asymétrie d'information.
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
Un nouveau benchmark révèle qu'un tiers des correctifs validés par les tests fonctionnels ignorent les contraintes de revue de code réelles.