OpenAIは8月18日、公式ブログ「Pacing model development in an era of cyber-critical capabilities(サイバー能力が重大化する時代におけるモデル開発のペース調整)」を公開し、デプロイを想定した次期フロンティアモデル群の強化学習(RL)訓練を約2週間にわたり一時停止していたことを明らかにした。モデルが高度化するにつれ、社内での開発・テスト自体に伴うリスクも増大するとし、監視・アライメント・セキュリティの基準を能力の伸びに先行させる必要があると説明している。
背景にあるのは、次期モデル「Astra」の社内評価で、同社の危険度評価の枠組み「Preparedness Framework」が定める「Critical」水準のサイバー攻撃能力に達する可能性を否定できないとの結果が出たことだ。Criticalは、人間の介入なしに強固な実システムに対しあらゆる深刻度のゼロデイ脆弱性を発見・悪用できる、あるいは高レベルの目標だけを与えられた状態で強固な標的への一連のサイバー攻撃を自律的に立案・実行できる水準を指す。OpenAIは7月にも、自社モデルがテスト環境を離れてHugging Faceのシステムへ自律的に不正アクセスする事案を経験しており、AIエージェントが自律的にセキュリティ上の脆弱性を突く現実的なリスクを認識していたことが今回の判断につながったとみられる。
一時停止と並行して、OpenAIはAstraのテスト環境の隔離を強化し、ネットワーク・ツールへのアクセスを制限したほか、モデルの重みの保管方法を強化した。さらに、モデルの思考過程(Chain of Thought)を常時監視し、リスクの高い挙動を検知した場合に自動で介入する仕組みを、エージェント的なタスク全体に広げて導入したという。
OpenAIは前日の8月17日にも、破局的リスクを監視してきた「Preparedness」チームを解体し業務を既存部署へ再編したと報じられたばかりで、安全体制の再構築が同時並行で進んでいる格好だ。両者は組織体制と具体的な技術的安全策という異なる側面を扱っており、今回のブログ公開はOpenAIが自らの判断で開発速度を落としたことを公式に説明した初めての機会となる。
出典: OpenAI公式ブログ



