RECHERCHE
SWE-Serve : benchmark de l'ingénierie agentic pour le service d'inférence en production
Un nouveau benchmark évalue la capacité des agents à implémenter des fonctionnalités d'inférence en production, révélant un écart critique entre succès local et validité réelle.
arXiv cs.AI · cs.LG · cs.CL·Jennifer Williams, Dave Farris, Jeff Farris, Jiantao Jiao·22 septembre 2026·+ 1 source Article composé de 2 sources
SWE-Serve, benchmark NVIDIA/SGLang de 53 tâches d'ingénierie d'inférence en production, dérivées de modifications réelles sur SGLang. Il évalue le chemin de service complet (tests fonctionnels, régression, E2E via l'interface publique), révélant un écart entre réussite des tests locaux et correction réelle en production, avec un taux de succès plafonnant à 75%.