RECHERCHE
CordisBench : raisonnement sur cycles de vie d'agents
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
arXiv cs.AI · cs.LG · cs.CL·Damien Sileo, Dimitri Kachler·1 septembre 2026
CordisBench est un benchmark de 1 200 questions testant le raisonnement des modèles sur les cycles de vie de composants dans des harnais d'agents dynamiques. Les résultats montrent que les modèles peinent à maintenir la fiabilité lorsque le nombre d'interactions pertinentes augmente, malgré des coûts d'inférence élevés.