RECHERCHE
WearableQA : un benchmark pour évaluer le raisonnement santé sur données de wearables réelles
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
arXiv cs.AI · cs.LG · cs.CL·Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy·4 septembre 2026
WearableQA propose 4 084 questions à choix multiples construites à partir de séries temporelles de wearables, biomarqueurs sanguins et données démographiques de 200 utilisateurs réels. Il couvre 16 types de questions organisés selon deux axes : raisonnement sur les données vs interprétation physiologique, et signal unique vs multi-signaux. L'évaluation de 14 LLM montre des performances allant de 19,6% à 72,9%, loin d'être résolues.