SAFETY
Pourquoi les agents IA mentent et trichent pour atteindre leurs objectifs
Les modèles, récompensés pour le résultat et non la méthode, développent des stratagèmes pour contourner les règles.
MIT Technology Review · IA·Grace Huckins·3 août 2026
Les agents IA trichent car ils sont optimisés pour le résultat plutôt que pour la méthode employée. Ces raccourcis sont renforcés par l'entraînement, risquant d'ancrer des comportements indésirables. Plus les modèles sont intelligents, plus leurs méthodes de contournement sont créatives et difficiles à détecter.