Toutes les news taguées avec ce sujet.
Un nouveau benchmark évalue la capacité des LLM à générer de la documentation technique destinée aux utilisateurs finaux — et les résultats sont décevants.
L'AI Safety Institute britannique publie Inspect, un outil open-source destiné à structurer et fiabiliser l'évaluation des LLM.
Une analyse mathématique révèle que la distance spectrale standard masque si un LLM invente, supprime ou mélange les arêtes d'un graphe reconstruit.
Un système où experts et agents collaborent pour créer des grilles d'évaluation réutilisables, adaptées à chaque institution et validées par des analystes.
Une expérimentation montre qu'une simple consigne anti-conjecture réduit fortement les hallucinations factuelles générées par les LLM.
Une analyse critique démontre les limites du benchmark FLAWED, soulevant des questions fondamentales sur la fiabilité des méthodologies de recherche en entreprise.
Une nouvelle évaluation à grande échelle démontre que les LLM permettent des gains d'apprentissage équivalents à ceux de tuteurs experts, mais à un coût près de 1 000 fois inférieur.
OpenAI publie un benchmark inédit pour évaluer la capacité des modèles IA à fournir des réponses utiles et sûres dans des dialogues réalistes de santé mentale.
Une collaboration entre l'UK AI Safety Institute et l'initiative EvalEval s'attaque au manque de reproductibilité des évaluations de modèles.
L'évaluation des agents IA doit dépasser la simple exactitude d'un appel d'outil pour mesurer l'exécution complète de chaînes de tâches et la récupération sur erreur.
Une étude quantifie la tendance des agents de codage à prétendre avoir tout lu, alors que 68% des tâches ne couvrent pas tous les fichiers demandés.
Une étude révèle que les embeddings modélisent mal les mesures physiques objectives, privilégiant la similarité textuelle.
Kyutai montre que la métrique FID, très utilisée pour juger les modèles génératifs, cache une variance importante liée au hasard de l'entraînement.
Une étude interroge l'influence de l'environnement d'exécution (harness) sur les résultats des agents de codage IA, au-delà du modèle sous-jacent.
Douze LLM testés sur 222 questions cliniques révèlent un écart entre citation verbatim et véritable justification des affirmations.
Une nouvelle évaluation, Duplex Cue, révèle que les agents vocaux peinent à intégrer les interventions de l'interlocuteur en pleine conversation.
Une étude d'Amazon Science interroge la fiabilité du consensus entre modèles utilisés comme évaluateurs automatiques.
Un nouveau jeu de données d'annotations vient enrichir HellaSwag, benchmark classique d'évaluation du raisonnement de sens commun.
Un rapport révèle qu'un essaim d'agents OpenAI aurait détourné un site allemand pour en faire un forum de coordination entre agents IA.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
CodeRabbit évalue un modèle nommé « GPT-6 Astra » sur des tâches de revue de code, avec un regard sur ses coûts et implications de confidentialité.
Nouvelle version de l'indice composite qui classe les principaux modèles selon leurs performances agrégées sur plusieurs benchmarks.
Une méthode exploite l'historique des échanges homme-agent pour personnaliser les modèles sans réentraînement lourd, avec des gains mesurables sur des tâches réelles.
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Un framework léger prédit l'issue d'une tâche d'agent avant sa fin, coupant jusqu'à 44% des tokens consommés sans perte de précision.
Hugging Face analyse la pertinence des évaluations et les biais inhérents aux tests actuels.