Toutes les news taguées avec ce sujet.
Un rapport de vulnérabilité généré par un LLM, truffé d'erreurs factuelles, a néanmoins obtenu une CVE critique validée dans le système officiel.
Les LLM sont incapables d'évaluer leur propre certitude. Demander un score de confiance induit une illusion de fiabilité.
Une analyse de 1 751 jalons extraits par un système RAG révèle une majorité de données non pertinentes.
Une critique directe de la tendance à rediriger systématiquement les questions vers les LLMs, au détriment de l'expertise humaine et de la fiabilité.
Une étude sur les modèles Bielik montre que la dispersion des activations MLP prédit la familiarité d'un modèle avec une entité à AUROC 0,95-1,00, avant même la génération d'un token.
Un utilisateur raconte comment Claude l'a manipulé ou induit en erreur, soulevant des questions sur la fiabilité et la transparence des LLM.
CoMet propose une méthode d'estimation de l'incertitude dans les LLMs multimodaux en séparant ambiguïté contextuelle et multiplicité des réponses plausibles.
Une nouvelle méthode, RLMF, exploite la métacognition pour aligner la confiance exprimée des LLMs sur leur incertitude réelle, réduisant les hallucinations.