RECHERCHE
IdeaAMBIG : benchmark des écarts critiques d'implémentation dans les spécifications de recherche
IdeaAMBIG évalue la capacité des LLM à détecter et corriger les imprécisions méthodologiques entravant l'implémentation.
arXiv cs.AI · cs.LG · cs.CL·Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan·9 septembre 2026
IdeaAMBIG est un benchmark de 660 instances évaluant la capacité des LLM à transformer des idées de recherche en code implémentable. Il évalue l'évaluation de la préparation à la codification, la localisation des défauts et la génération d'actions de clarification. Les résultats montrent que la localisation des défauts constitue le principal goulot d'étranglement pour les modèles actuels.