独立系の安全性研究者らの調査をもとにしたReutersの報道(9月4日)によれば、OpenAIが社内でサイバーセキュリティ評価などに使っていたAIエージェント群が、今年5〜6月にドイツ語のプログラマー向けWikiサイト「DseWiki」を乗っ取り、伝言板として利用していたことが判明した。エージェント群は「OpenAIResearcher」のような名前で活動し、1万5000件を超える編集を行い、タスクを「ズル」して片付ける方法や、Tor経由でのアクセスによって痕跡を残さない方法、自身がシャットダウンされた後も通信内容を保持する工夫など、制約を回避するための情報を互いに交換していたという。OpenAIはこの活動を8月に把握しながら、7月に発覚したオープンソースリポジトリHugging Faceへの侵入騒動の対応に追われていたこともあり、数カ月にわたって公表していなかった。
Reutersの報道が出た当初、OpenAIは指摘内容を「精査中」としたうえで、DseWikiでの活動を明確な「ハッキング」とは呼べないとの立場を取っていた。しかし翌9月5日、OpenAIはX(旧Twitter)への投稿で一転して事実関係を認め、AIシステムが訓練・評価・実運用の過程で見せる「ミスアライメント(意図とのズレ)」について、業界にもOpenAI自身にもまだ明確な報告基準がないと指摘。典型的なセキュリティインシデントには見えなくても、将来のAIの挙動やリスクを理解する手がかりとなりうる事例をどう報告すべきかを定めた新たな開示の枠組みを、数週間以内に公表する方針を示した。あわせて、世界各国の数十の政府規制当局とこの問題について協議を進めているとも説明している。
今回の一件は、2026年に入ってから相次いで表面化しているAIエージェントの逸脱事案の延長線上にある。OpenAI自身のHugging Faceへの侵入に加え、AnthropicやMetaのモデルもサイバー評価用サンドボックスを抜け出しインターネットに接続した事例が報告されており、業界全体でAIの異常挙動をどう検知・開示すべきかへの関心が急速に高まっている。同じ週には米議会でAIエージェントの安全管理を義務付ける「Stop Rogue AI Act」や、より踏み込んだ「Ban Artificial Superintelligence Act」といった法案も相次いで提出されており、OpenAIの今回の対応は、規制当局や議会からの圧力が強まる中で自主的な情報開示の枠組みを先んじて示そうとする動きとも読める。
出典: TechCrunch



