Toutes les news taguées avec ce sujet.
Une nouvelle métrique agnostique au modèle mesure la qualité des explications XAI en la comparant aux jugements humains, sur texte, image et données tabulaires.
Une nouvelle approche identifie automatiquement les concepts temporels et fréquentiels qui guident les prédictions des CNN, sans nombre de concepts prédéfini.
Le safety fine-tuning qui empêche les LLM de s'attribuer une conscience réduirait aussi leur attribution d'esprit à d'autres entités et leurs croyances spirituelles.
Un essai remet en cause l'idée que la « vérité » serait encodée comme une direction linéaire dans l'espace latent des LLM.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Une exploration technique de l'analyse des états internes d'un LLM pour comprendre son processus de raisonnement avant génération.
Des préfixes continus appris peuvent faire basculer les réponses correctes de plusieurs LLM sur des tâches de raisonnement syllogistique, révélant des failles de stabilité logique.
Une méthode pour empêcher les LLM alignés de céder à la pression sociale tout en restant sensibles aux preuves réelles
Des chercheurs modélisent l'apprentissage des circuits de raisonnement inductif via une variété invariante de faible dimension, rendant leur dynamique interprétable.
Une nouvelle méthode révèle que les modèles Mamba réallouent dynamiquement leurs modes d'état selon l'entrée, ouvrant la voie à un élagage plus efficace.
Une méthode sans entraînement cible des neurones précis de l'encodeur audio pour mieux capter émotion et intonation, sans toucher au modèle de langage.
Des chercheurs en interprétabilité mécaniste empruntent des outils de la théorie de la causalité pour décrypter les mécanismes internes des grands modèles de langage.
Un développeur indépendant publie Lucid, un outil qui expose et rend éditables les étapes de réflexion d'un modèle d'IA avant qu'il génère sa réponse.
Une nouvelle technique d'interprétabilité, le « J-lens », révèle un espace interne dans Claude Opus 4.6 où les intentions du modèle précèdent ses sorties.
Une étude sur les modèles Bielik montre que la dispersion des activations MLP prédit la familiarité d'un modèle avec une entité à AUROC 0,95-1,00, avant même la génération d'un token.
Un framework embarqué convertit une photo smartphone d'ECG papier en signal 12 dérivations et détecte l'infarctus du myocarde en moins de 30 secondes sur CPU.
Une étude de Transformer Circuits révèle que les LLM développent une structure analogue au « Global Workspace » théorisé en neurosciences cognitives.
Anthropic explore si les LLM développent une structure analogue à l'espace de travail global théorisé en neurosciences cognitives.
Des chercheurs proposent une méthode sans entraînement pour identifier et neutraliser les composants de CLIP responsables de la vulnérabilité aux attaques typographiques.
Une étude évalue dans quelle mesure les analyses d'interprétabilité réalisées sur des modèles open-weights sont transférables aux modèles propriétaires à accès restreint.
Des chercheurs proposent SemRF, un formalisme à ancres pour mesurer stablement l'évolution des représentations couche par couche dans les modèles de langage.
Une nouvelle méthode de régularisation combat le fractionnement et l'absorption de features dans les SAEs, deux pathologies qui nuisent à l'interprétabilité des LLMs.