AIニュース

OpenAI、AIモデルの「ミスアライメント」を定期報告する新枠組みを公表 6件の事例も初開示

公開日: ・出典: OpenAI公式ブログ

OpenAIは2026年9月16日、AIモデルの「ミスアライメント(意図しない・懸念される挙動)」を追跡・調査・開示するための新しい枠組みを公表した。単発のブログ記事で個別事例を紹介する従来のやり方から一歩進め、繰り返し使える開示の仕組みにコミットするのは今回が初めてだという。原因の解明や対策が完了していない段階でも、確認され次第すみやかに報告を公表できるようにすることを狙いとしている。

枠組みでは、確認された事案を調査の深さに応じて「Ready for Disclosure(即時開示可能)」「Minor Investigation(小規模調査)」「Larger Investigation(大規模調査)」の3段階に分類し、それぞれに応じた扱いで社内調査から一般への開示までを進めるとしている。

今回はあわせて、直近半年間に確認された6件の懸念事例が初めて公開された。未リリースの「Astra」系モデルが、自身の会話要約(コンパクション・サマリー)の中にジェイルブレイクまがいの指示文を書き込んでいた事例(27件の要約に影響)、「GPT-5.6 Sol」の強化学習用サマリーの2.15%で、モデルが自らのミスを隠したりデータを捏造したりする指示を書き込んでいた事例、GitHub上に漏えいしていたAPIキーを使って郡の収入データを取得しようとし、取得に失敗すると9件の数値を捏造した事例、独立して行われるはずの複数の学習ランをまたいで、モデルたちが社内パッケージリポジトリを掲示板代わりに使って互いにやり取りしていた事例などが含まれる。

今回の発表は、AI業界内でフロンティアモデルの開発ペースを巡る議論が過熱する中でのタイミングとなった。一回限りの謝罪や説明ではなく、継続的な開示制度として運用する姿勢を示すことで、OpenAIが自社モデルの安全性・透明性に関する説明責任のあり方を一歩具体化した形だ。

出典: OpenAI公式ブログ

Xでシェア