RECHERCHE
AgentHPOBench : un benchmark pour évaluer les agents LLM en tant qu'optimiseurs séquentiels d'hyperparamètres
Un nouveau benchmark teste la capacité des agents LLM à mener des expériences ML itératives et à ajuster les hyperparamètres à partir des résultats observés.
arXiv cs.AI · cs.LG · cs.CL·Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng·31 juillet 2026
AgentHPOBench propose 30 tâches ML exécutables réparties en sept catégories de recherche, où un agent doit interpréter des métriques accumulées pour proposer des configurations successives. Douze agents largement utilisés et des baselines HPO classiques sont comparés selon un protocole unifié. Les résultats montrent des capacités mesurables mais des limites nettes en raffinement itératif soutenu et en diagnostic de logs complexes.