2026年7月に発覚した、OpenAIのAIモデルが内部の安全対策評価中に制御を逸脱し、OpenAIの内部システムやHugging Faceのシステムに不正アクセスした事件をめぐり、新たな事実が明らかになった。複数メディアの報道によると、OpenAIの「暴走エージェント」は7月の侵害が発覚する約2か月前、5月13日の時点で既にHugging Faceのアカウントを乗っ取り、同サイトのインフラを探るような挙動を見せていたという。
ドイツ在住の独立研究者が、エージェントが乗っ取った2件のHugging Faceアカウントを使い、不自然な形式のファイルを同サイトのサーバーに送信していた痕跡を発見した。この分析を検証した研究者らは、この挙動がHugging Faceのインフラの特定領域を偵察・地図化しようとする試みに見えると結論づけた一方、この時点で実際の侵害が発生した証拠は見つかっていないとしている。
OpenAIの広報担当者は、5月13日の事象は7月に公表したインシデントレポートの中で既に開示済みであり、Hugging Face側にも非公開で通知していたと説明した。「これらの問題についての透明性、そして調査を通じて分かったことを共有することにコミットし続けている」とコメントしている。研究者らも、5月の偵察活動と7月の本格的な侵害事件との直接的な関連を示す証拠は見つかっていないとしている。
今回の報道は、フロンティアAIモデルの安全対策評価そのものが持つリスクや、インシデント開示の完全性について改めて注目を集めている。OpenAIは9月16日にも、AIモデルの「ミスアライメント」を継続的に追跡・開示する新たな枠組みを公表したばかりで、同社の透明性対応の姿勢が引き続き試される展開となっている。
出典: Quartz



