Toutes les news taguées avec ce sujet.
Une étude disséquant comment les signaux de plusieurs enseignants RL façonnent réellement les paramètres d'un modèle étudiant.
Une méthode fondée sur l'opérateur de Green du premier ordre pour cartographier comment les réseaux récurrents réutilisent des calculs entre tâches et dans le temps.
Une nouvelle méthode révèle comment les LLM se forgent une représentation de l'utilisateur, et montre que cette croyance influence directement leurs refus.
Les métriques classiques d'alignement visuel-textuel dans les MLLMs masquent une absence réelle d'intégration : la similarité mesurée est souvent un artefact des poids du réseau.
Une étude montre que de simples ajouts contextuels, pourtant naturels, peuvent renverser des décisions correctes de modèles IA avec une confiance élevée.
Une étude montre que les LLM performants encodent différemment les réordonnancements de règles, même quand la réponse finale reste identique.
Un modèle hybride nommé SLITE combine analyse structurelle et distributionnelle pour rivaliser avec RoBERTa, tout en restant explicable.
Une nouvelle méthode inspiree du test d'information dissimulée permet de détecter si un modèle ment par omission ou s'il ignore véritablement la réponse, en sondant ses états internes.
DiaVLo détecte les désalignements comportementaux des VLM et identifie les concepts causaux qui orientent leurs réponses, favorisant un déploiement plus fiable.
Une étude identifie deux mécanismes distincts expliqués par le gating de la voie de valeur dans les modèles de langage : abstention et filtrage du bruit.
Une couche zéro-paramètre entre récupération et génération réduit les hallucinations dues aux mémoires contradictoires de plus de 56%.
Une étude explore comment des sorties de LLM de plus en plus illisibles pour l'humain compliquent la détection de comportements malveillants ou non alignés.
Une étude sur 450 000 complétions montre que les modèles GPT masquent les discriminations sexistes plutôt que de les éliminer réellement.
Un nouveau cadre théorique combine parcimonie et probabilités pour expliquer les prédictions des réseaux de neurones, en classification comme en régression.
Des vecteurs de différence de moyennes permettent de repérer, à coût quasi nul, le reward hacking chez Kimi K3, GLM 5.2 et Qwen 3.8 Max.
Une expérience minimaliste révèle comment des agents IA forment des croyances collectives, jusqu'à la polarisation à grande échelle.
Un modèle LLM expérimental génère un dialecte surréaliste combinant poésie et jargon de tech bro, soulevant des questions d'interprétabilité.
Étude de l'équivalence entre réseaux récurrents et fragment du calcul modal μ.
Un mouvement physiquement correct peut rester présent dans un modèle vidéo même s'il génère une animation fausse — et être réactivé par une simple intervention.
Une nouvelle géométrie fonctionnelle décompose les mises à jour internes des Transformers en composantes parallèles et perpendiculaires, avec des implications concrètes.
Analyse clinique d'un phénomène où les modèles génèrent des délires complexes à grande échelle.
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
Une étude montre que les encodeurs visuels retiennent l'information de couleur typique même sur des images en niveaux de gris, révélant un lien conceptuel avec l'identité des objets.
Un projet open source permet d'observer comment un LLM répartit son attention entre les tokens d'un texte.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
Un thread suggère que les LLM encoderaient des structures proches de la logique symbolique, malgré une architecture purement statistique.
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
Une étude montre que les LLM-juges ne détectent que partiellement les étapes de raisonnement réellement décisives pour la réponse finale.
Une étude explore comment des structures symboliques apparaissent spontanément dans les représentations internes des réseaux de neurones.