Toutes les news taguées avec ce sujet.
Un nouveau benchmark révèle que l'efficacité, pas seulement la précision, distingue vraiment les harnais pour LLM en contexte long.
Partenariat pour déployer l'évaluation intégrée des modèles IA au sein des grandes entreprises.
Un nouveau benchmark évalue la compréhension artistique et contextuelle des modèles vision-langage dans l'éducation.
Un modèle GPT-2 125M entraîné exclusivement sur du français révèle l'importance des benchmarks natifs et la sensibilité au tokenizer.
Un framework de simulation multi-agent valide le raisonnement social des LLM via des motifs cachés vérifiables.
Un framework à boucle fermée génère automatiquement des benchmarks pour agents embarqués via synthèse et réparation d'artefacts.
Un nouveau benchmark évalue les modèles d'IA sur du code d'entreprise réel et privé.
Un nouveau cadre pour évaluer les modèles de découverte causale face aux challenges du pré-entraînement.
Des tests sur des pièges photographiques montrent que les spécialistes comme BioCLIP surclassent les VLM généralistes de 2 à 8B.
IBIB corrige l'erreur de mesure des benchmarks classiques en évaluant la route de service et non l'identifiant du modèle.
Une méthode sans référence évalue la fiabilité des modèles en temps réel via l'accord avec un arbitre indépendant.
Anthropic évalue les risques de prolifération liés aux capacités offensives tactiques des modèles d'IA.
L'incohérence des prévisions probabilistes des LLM mesurée par le profit des Dutch Books.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.
Un nouveau cadre d'évaluation exploite les traces d'exécution pour améliorer le benchmarking d'agents logiciels.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
Une étude contrôlée évalue 13 modèles Qwen et GPT pour déterminer l'influence de la taille sur l'apprentissage d'ontologies.