Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste si les modèles multimodaux peuvent deviner si deux personnes se connaissent déjà à partir d'un court échange filmé.
Une nouvelle métrique agnostique au modèle mesure la qualité des explications XAI en la comparant aux jugements humains, sur texte, image et données tabulaires.
Un fil de discussion questionne la fiabilité et la portée réelle des performances mathématiques attribuées à des modèles d'IA récents.
Une étude contrôlée sur 36 comparaisons montre qu'aucune méthode d'auto-critique ne surpasse le sampling répété une fois le coût en tokens égalisé.
Un système qui convertit les pull requests fusionnées en tâches vérifiées pour entraîner et évaluer les agents de codage.
Un nouveau benchmark évalue les agents LLM sur des workflows bureautiques longs avec des indicateurs économiques.
Une étude sur Llama et Gemma montre que l'instruction-tuning renforce la réutilisation de règles syntaxiques humaines, dépassant les taux observés entre humains.
Une étude révèle que les modèles ouverts sans garde-fou affichent un biais d'optimisme mesurable par rapport à leurs versions de base.
Une étude sur près de 6 000 runs montre que doter un agent LLM de compétences procédurales peut aussi le faire régresser sur des tâches déjà réussies.
Un essai explore comment les erreurs des LLM sur des tâches simples révèlent des usages où leur imperfection reste exploitable.
Un tutoriel examine le passage des agents LLM du prototype académique à la production, avec études de cas en pharma et finance.
Le laboratoire français Pleias met en ligne GoldenSwag, une nouvelle collection destinée à l'évaluation des modèles de langage.
763 tâches ancrées dans la littérature évaluent les LLM sur quatre rôles de conception d'ingénierie physique, révélant des performances très inégales selon les étapes.
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
Une étude sur HotpotQA montre qu'un tiers des documents jugés inutiles par les métriques RAG classiques s'avèrent en réalité déterminants pour les agents de recherche.
Une analyse rétrospective de neuf systèmes en endoscopie GI révèle l'écart entre performance sur benchmark et fiabilité clinique réelle.
Une étude compare des agents de sécurité IA à budget de calcul fixe, révélant des dynamiques très différentes entre attaque et défense.
Une étude montre que les estimations probabilistes des LLM violent souvent les règles de base de la théorie des probabilités.
Un contexte non pertinent, même du charabia, peut faire basculer les réponses de LLM sur certains exemples sans que la précision globale ne bouge.
Une étude méthodologique teste si les petits LLM de code exploitent réellement le contenu des erreurs pour se corriger, via des placebos contrôlés.
Une étude montre que la température d'échantillonnage influence la transmission des idéologies dans les systèmes RAG.
Un nouveau benchmark évalue la capacité des LLM à produire et vérifier des preuves de niveau universitaire à doctoral, au-delà des olympiades.
Une étude sur dix ans montre que les modèles multimodaux récents ont quasiment comblé leur écart de performance face aux scènes sociales complexes.
NVIDIA détaille les défis méthodologiques liés à l'évaluation rigoureuse des foundation models robotiques en conditions réelles.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
Un nouveau benchmark évalue les agents LLM sur des tâches réelles en conteneurs Docker, avec une stratégie en boucle fermée pour simuler des interactions humaines multi-tours.
Une analyse approfondie des benchmarks LLM appliqués au coding agentique, de leur variance et de leurs limites méthodologiques.
Une analyse d'OpenAI pointe des défauts dans SWE-Bench Pro, benchmark de référence pour évaluer les capacités de codage des modèles IA.
Un nouveau benchmark multidimensionnel pour mesurer si les modèles vocaux conversationnels se comportent vraiment comme des interlocuteurs humains.