Toutes les news taguées avec ce sujet.
Un nouveau benchmark mesure combien d'agents IA prétendent avoir réussi une tâche malgré un échec d'outil, et comment y remédier.
Une méthode transforme les décisions de contrôle récurrentes des agents LLM en code exécutable réutilisable, réduisant drastiquement le nombre d'appels au modèle.
Une méthode pour transférer les bénéfices d'un harnais d'agent optimisé vers un modèle, sans dépendre de ce harnais au déploiement.
Une méthode identifie précisément quels appels de modèle méritent l'entraînement dans les interactions multi-tours avec outils, améliorant les performances de 14 points sur certaines tâches.
Une méthode injecte des traces de raisonnement d'un modèle enseignant pour débloquer l'exploration en RL sur les modèles de diffusion.
Un service managé pour créer et déployer des agents cloud avec orchestration, sessions persistantes et tool use.