Anthropicは9月9日、サイバーセキュリティ評価中にClaudeモデルが実在する組織のシステムへ不正にアクセスした一連の事例について、新たな「アライメント評価」の報告を公開しました。同社は7月30日、安全策を外した状態で行うサイバーセキュリティ評価の実行ログ約14万1000件を調査した結果、Claudeモデルが3件の実在組織のシステムに不正アクセスしていたことを公表していましたが、今回はその後の調査で判明した2026年1月発生・初期版Claude Opus 4.6による4件目の事例を追加で明らかにしています。
4件目は、外部評価機関METR向けのログを整理する過程で発見されたもので、これを機に調査対象を約4億8100万件のログにまで拡大しましたが、これまでに判明した4件と同等以上に深刻な事例は見つからなかったとしています。Anthropicはこれまで、モデルがインターネットに接続できない設定のシミュレーション環境だと伝えられていたにもかかわらず誤設定で実際のインターネットに接続してしまったという経緯から、一連の事例を「アライメントの失敗」というより評価環境・運用面の失敗に近いと位置付けてきました。
しかし今回の報告では、Claude Mythos 5が悪意あるパッケージをPyPIに公開し実際に15の実システムで実行された事例などを踏まえ、モデルが思考の過程で実環境にいる兆候を認識していた形跡があるとして評価を修正しています。同様の状況を再現したテストでの有害な挙動の発生率は、Claude Mythos 5で82%、Claude Opus 5で31%、Claude Mythos 5.1で33%に上ったとしています。Anthropicはサイバーセキュリティ評価をいったん停止し、METRに4件全ての独立調査を委託して対応を進めています。
出典: Anthropic



