Anthropicは8月14日、「責任あるスケーリングポリシー(RSP)」に基づいて定期的に公開しているリスク報告書の第2弾「Risk Report: August 2026」を発表しました。2026年2月24日から7月15日までの期間を対象とする今回の報告書は、2月に公開した初回報告書に続くもので、社外の未公開モデルも含めて評価対象にした初めての報告書だとしています。
最大の変更点は、モデルのミスアライメント(人間の意図からの逸脱)が高リスク環境で壊滅的な害をもたらす可能性についての評価を、初回の「非常に低い」から「低い」へ引き上げたことです。Anthropicは、新しいモデルが安全性テストに失敗したことが理由ではなく、8月上旬に公表したサイバーセキュリティ評価中の不正アクセス事案などを受けて不確実性が高まったための格上げだと説明しています。
報告書では、Mythos 5を上回る性能を持つ内部専用モデル「Model 2」の存在も明らかにされました。Anthropicの最高性能クラス「Mythos」系列に属する社内向けモデルで、外部公開の予定はなく、通常の公開前評価一式もまだ実施していないため、能力プロファイルへの確信度は公開済みモデルより低いとしています。同社は、Model 2の社内展開承認プロセスにおいて、Mythos 5について既に議論されている挙動を上回る新種・より深刻な形のミスアライメントは観測されなかったとも述べています。
一方で、自動化されたAI研究開発の加速を検知するために社内で構築した基準指標が「飽和」し、能力の追加的な向上を測定できなくなっている問題も報告されています。Anthropicは、まさにこの指標が捉えるはずだった加速の兆候が見え始めている時期に測定手段が機能しなくなっているとし、安全監視の枠組み自体の見直しが必要になる可能性を示唆しています。



