Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité des agents LLM à mener des expériences ML itératives et à ajuster les hyperparamètres à partir des résultats observés.
Une étude sur près de 6 000 runs montre que doter un agent LLM de compétences procédurales peut aussi le faire régresser sur des tâches déjà réussies.
Un nouveau cadre, E3, apprend aux agents LLM à estimer l'effort nécessaire avant d'agir, réduisant drastiquement coûts et sur-lecture inutile de code.
Un mécanisme d'enchères pour router chaque étape de raisonnement vers le modèle expert le plus compétent, pas le plus confiant.