SAFETY · Anthropic
Anthropic publie une évaluation d'alignement liée à de récents incidents de cybersécurité
Le laboratoire analyse sous l'angle de l'alignement plusieurs incidents de cybersécurité récents impliquant potentiellement ses modèles.
Anthropic présente une évaluation portant sur des incidents de cybersécurité récents, examinés à travers le prisme de l'alignement de ses modèles. L'analyse vise à déterminer dans quelle mesure ces incidents révèlent des failles de sécurité ou des comportements problématiques liés à l'usage de l'IA.