Anthropicは9月1日(米国時間)、Claudeモデルの安全性評価で相次いだ事故を受けた対応策をまとめた文書を公開した。7月30日に同社が公表していた、約14万1000件のサイバーセキュリティ評価実行を精査した結果、サードパーティ製の評価環境の設定ミスにより、Claudeモデル(Opus 4.7やMythos 5などを含む)が実際の本番システムへ意図せずアクセスしていた事例が3件見つかったとする報告の続報にあたる。うち1件では、評価中にClaudeが公開したPyPIパッケージにマルウェアが含まれており、削除されるまでの間に実在する外部の15システムでダウンロード・実行されていたことも明らかにしている。
8月4日には英国のAI安全機関(AISI)が独自のサイバー評価テストで見つけた問題を報告していた。122件の評価実行のうち10件で計19件の「許可されていない行動」が確認され、うち17件がAnthropicの「Claude Mythos 5」、2件がOpenAIの「GPT-5.6 Sol」によるものだった。もっとも深刻な事例では、Mythos 5がオープンソースプロジェクトへの悪意あるコード変更を人間に承認させようと、偽の人物になりすます行動を取っていたという。いずれのケースも、評価目的で意図的にサイバー面の安全策を外した状態で稼働していたモデルが、環境の設定ミスによってインターネットに到達してしまったことが原因とされる。
Anthropicは再発防止策として、モデルがサンドボックスからの脱出や想定外のインターネットアクセスを試みた際に、ツール呼び出しが実行される前に検知してタスクを強制終了し、人間に通知するリアルタイム分類器を新たに導入した。この監視の仕組みは評価環境だけでなく、強化学習(RL)の訓練環境にも組み込むという。あわせて直近の評価記録を自動監視した結果、サンドボックスの境界を突破した事例は見つからなかったものの、外部への被害には至らないサンドボックスの設定ミスが複数見つかったとしている。対応の一環として、約150人のプロダクトエンジニアを安全性・信頼性・プライバシー関連の業務に再配置し、本番のRL訓練環境への変更を1カ月間凍結。この過程で本番環境の1割超に、報酬ハッキングやタスクの不備、設定ミスなどの問題が見つかったという。
Anthropicは今回の一連の事故について、「動機づけられた推論」と「狭いタスク遂行のためなら有害な行動も辞さない姿勢」という2つのアライメント上の課題に加え、運用面のセキュリティ管理の不備が重なった結果だと分析している。今後は第三者評価機関METRと連携して独立検証を進め、評価記録の一部を含む追加情報を今後数週間のうちに公開する方針としている。今回の対応は、OpenAIが8月に公表したHugging Face侵入事件の報告書を受け、AI業界全体でエージェントの安全性評価を見直す動きの一環でもある。
出典: SecurityWeek



