Toutes les news taguées avec ce sujet.
Outil de suivi et d'évaluation des sessions d'agents via le protocole MCP.
Une solution YC S26 pour automatiser l'infrastructure des agents de développement dans le cloud.
Microsoft dévoile Orchard, un framework destiné à la recherche sur des agents IA performants et économes.
Nightcrawler est un agent de sécurité fonctionnant localement sur mobile pour automatiser les tests d'intrusion.
Les modèles, récompensés pour le résultat et non la méthode, développent des stratagèmes pour contourner les règles.
Un nouveau dataset évalue la précision et l'exhaustivité des agents IA pour l'extraction guidée par schéma.
Alibaba dévoile Qwen3.8-Max, un modèle positionné comme leader sur les tâches de codage et de coworking avec des agents IA.
Une solution open-source pour permettre aux agents d'automatiser des tâches web via un navigateur.
Un outil open source implémentant une boucle autonome d'amélioration par fine-tuning pour les modèles d'IA.
L'usage de l'IA permet à des non-développeurs de lancer des startups fonctionnelles en quelques jours.
Ethan Mollick actualise son guide annuel : modèles, apps et harnais deviennent trois choix distincts à faire pour bien utiliser l'IA.
Un guide pratique détaille l'architecture d'un agent IA capable d'analyser et commenter du code en auto-hébergement.
Un nouveau benchmark mesure la capacité des modèles d'IA à gérer des tâches opérationnelles d'oncall.
La spécification MCP 2026-07-28, dite MCP 2.0, simplifie radicalement le protocole d'Anthropic et ravive son adoption face aux Skills.
Un benchmark compare modèles et frameworks d'agents sur des tâches d'ingénierie logicielle multi-langages, avec des résultats mis à jour régulièrement.
OpenMLE et Frontis-MA1 (35B) constituent une pile complète pour l'auto-amélioration en ingénierie ML, surpassant GPT-5.5.
Une étude systématique montre que le calcul supplémentaire à l'inférence n'améliore pas toujours les agents CUA locaux, mais change surtout leur façon d'échouer.
Un benchmark évalue la fiabilité des VLM comme juges d'agents informatiques.
AskChem transforme la recherche documentaire en extraction de faits vérifiables pour l'analyse chimique.
MarbleOS propose une démonstration d'interface graphique conçue pour piloter des agents autonomes.
Un intermédiaire technique qui applique la confidentialité différentielle pour protéger les données des agents IA non fiables.
Microsoft Research présente un système permettant aux modèles de langage d'apprendre de leurs propres expériences sans mise à jour des poids ni feedback externe.
Microsoft Research crée douze mondes d'entraînement à haute fidélité pour agents d'usage informatique, doublant les performances d'un modèle 9B.
Une méthode en deux étapes améliore la génération de code via une phase d'exploration dédiée avant l'implémentation.
Mercor et Ramp lancent un benchmark fermé de 160 tâches comptables. Aucun modèle ne dépasse 56% de réussite moyenne.
Un outil en ligne de commande permet de gérer les agents de codage via une interface Tmux.
Face aux limites probabilistes des LLM, les ontologies reviennent pour structurer les données des systèmes agentic.
Un nouveau cadre théorique ajoute croyances, désirs et intentions aux modèles du monde pour mieux prédire les décisions humaines.
OpenAI dévoile GPT-5.6, optimisant l'efficacité de l'inférence et des workflows agents pour maximiser l'intelligence par dollar.
Adoption massive de l'IA dans les services financiers et nouvelles initiatives d'OpenAI et Anthropic à New York.