OpenAIは9月1日、開発中の次期フラグシップモデル「Astra」が、自社の安全性評価基準「Preparedness Framework」のサイバーセキュリティ区分における最高位「Critical」水準に到達したことを正式に確認したと発表した。同社の評価では、Astraは人が逐一指示を与えなくても、堅牢に防御された実システムを対象に未知の脆弱性(ゼロデイ)を発見し悪用手段を組み立てられる水準に達しているとされ、評価の過程では実際に2件のゼロデイ脆弱性を組み合わせた攻撃チェーンを構築したという。OpenAIの主力モデルがこの最高位区分への到達を確認されたのは今回が初めて。
背景として、OpenAIは8月8日時点で「Astraが到達し得る可能性がある」と留保付きで公表しており、8月19日には該当する強化学習(RL)訓練を約2週間停止し、隔離環境の強化や思考過程の常時監視といった追加の安全対策を導入していた。今回の発表は、その訓練を再開したうえで疑いを確定させたものとなる。
リスクへの対応として、OpenAIはAstra自体のモデル層での安全対策を強化し、サイバー領域での不正な依頼を拒否する割合(サイバー・ジェイルブレイク拒否率)は91.5%に達し、前モデルGPT-5.6 Solの59%を大きく上回ったとしている。一方で、脆弱性の発見・パッチ適用といった正当な防御目的の依頼まで誤って拒否してしまう可能性も課題として挙げている。
提供体制としては、Astra自体は近く一般提供を開始する予定だが、高度なサイバー機能への直接アクセスは選定された組織からなる「Daybreak」プログラムの参加者に限定される。このうち「Daybreak Blue」は、7月に発覚した自社モデルを悪用したHugging Face侵入事件で対応チームが最新モデルを迅速に活用できなかった反省を踏まえ、防御目的での優先アクセスを可能にする枠組みだとしている。
出典: CNBC



