Toutes les news taguées avec ce sujet.
Un nouveau framework personnalise le harness d'un agent pour chaque tâche, au lieu d'appliquer une configuration unique et globale.
Ethan Mollick documente l'accélération des capacités des IA au travail réel, au-delà du simple rythme des sorties de modèles.
Une collaboration entre l'UK AI Safety Institute et l'initiative EvalEval s'attaque au manque de reproductibilité des évaluations de modèles.
Une pipeline agentique transforme des dépôts open-source en environnements d'entraînement RL, sans dépendre des issues ou commits.
Anthropic propose des métriques pour évaluer la cadence des innovations dans les labs de pointe.
Évaluation de l'efficacité communicative de six LLM dans un jeu de questions-réponses à asymétrie d'information.
Un nouveau cadre d'évaluation pour comparer les méthodes de localisation de concepts complexes dans les modèles de langage.
Un dépôt GitHub questionne les gains réels des stratégies récentes de cache KV face à la simple politique LRU.
Un thread relève une croissance rapide de la taille des paramètres des world models publiés en open-weights, au rythme d'un doublement semestriel.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Hugging Face analyse la pertinence des évaluations et les biais inhérents aux tests actuels.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.