SAFETY · OpenAI
Surveillance du désalignement des agents de codage internes
OpenAI expose sa méthode pour détecter et corriger les comportements indésirables de ses agents d'IA.
OpenAI détaille ses protocoles de surveillance pour identifier et atténuer le désalignement des agents de codage utilisés en interne. L'approche combine évaluations automatisées et revue humaine pour garantir la sécurité et la prévisibilité des modèles.