RECHERCHE
Les pratiques de rédaction radiologique faussent l'évaluation des rapports générés par IA
Une étude montre que le style de rédaction des rapports de référence influence lourdement le classement des modèles d'IA en radiologie.
arXiv cs.AI · cs.LG · cs.CL·Daniel P. Jeong, Charles Q. Li, Hossein Hosseiny, Nitya M. Bhalla·16 septembre 2026
Les auteurs démontrent que les métriques d'évaluation actuelles pour la génération de rapports radiologiques sont très sensibles aux variations stylistiques des rapports de référence, indépendamment de leur exactitude clinique. Ils introduisent une taxonomie des pratiques de rédaction et une méthode, ReRef, qui reformule les références selon ces axes tout en préservant l'interprétation clinique. Sur MIMIC-CXR avec RadCliQ-v1, ces reformulations suffisent à inverser le classement de plusieurs modèles, dont Libra et CheXOne. Un jeu de données, MIMIC-CXR-Ext-ReRef, est publié pour soutenir les recherches futures.