RECHERCHE
Un cadre causal pour étudier la tromperie dans les LLM
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
arXiv cs.AI · cs.LG · cs.CL·Yakov Pyotr Shkolnikov·3 septembre 2026
Ce papier propose un cadre causal pour distinguer les comportements trompeurs des mécanismes réels de tromperie chez les LLM. Les expériences sur des modèles open-weights montrent qu'un comportement trompeur peut exister sans mécanisme associé, et que l'information du destinataire influence causalement les préférences du modèle. Cela n'établit pas pour autant une agence consciente de la tromperie.