Toutes les news taguées avec ce sujet.
Une étude systématique montre que le calcul supplémentaire à l'inférence n'améliore pas toujours les agents CUA locaux, mais change surtout leur façon d'échouer.
Un benchmark évalue la fiabilité des VLM comme juges d'agents informatiques.
Microsoft Research crée douze mondes d'entraînement à haute fidélité pour agents d'usage informatique, doublant les performances d'un modèle 9B.
Un nouveau benchmark teste la capacité des modèles d'IA à comprendre les transitions d'interface graphique sur desktop.
La start-up française dévoile une API permettant à des agents IA de piloter directement des interfaces informatiques.
Le lab français dévoile une API permettant de déployer des agents IA capables d'interagir directement avec des interfaces informatiques.
Une startup passée par Y Combinator dévoile une API destinée à faciliter le développement d'agents IA capables d'utiliser des ordinateurs.