Cette fiche résume une publication officielle diffusée par Anthropic News. Position Zéro en présente les informations essentielles et leur intérêt pour les professionnels du numérique.
L’annonce en bref
Des équipes de red team de US CAISI et UK AISI ont testé Constitutional Classifiers sur Claude Opus 4 et Claude Opus 4.1, selon Anthropic.
Ces évaluations ont permis d’identifier des vulnérabilités dans les mécanismes de protection du modèle.
Anthropic indique que les résultats ont servi à renforcer ses safeguards, sans fournir dans cette source de détail sur les failles découvertes ni sur les modifications apportées.
Pourquoi US CAISI et UK AISI ont-ils testé Claude Opus ?
Cette démarche montre que des évaluations externes peuvent révéler des vulnérabilités dans les protections d’un modèle d’IA. La source ne précise toutefois ni leur nature ni leur impact concret pour les usages numériques.
