RECHERCHE
Les LLM récupèrent-ils les données moléculaires par cœur ?
Une étude auditant 22 modèles frontières révèle un phénomène massif de mémorisation littérale sur les benchmarks de propriétés moléculaires.
arXiv cs.AI · cs.LG · cs.CL·Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich·4 septembre 2026
Ce papier audite 22 LLMs sur 12 benchmarks de régression moléculaire pour détecter la récupération verbatim de valeurs publiées. Ce phénomène est répandu mais spécifique aux datasets et amplifié par le raisonnement. La suppression de la retrieval réduit les écarts de performance entre modèles.