Toutes les news taguées avec ce sujet.
Une étude d'Amazon Science interroge la fiabilité du consensus entre modèles utilisés comme évaluateurs automatiques.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.