Anthropicの脅威分析チーム「Frontier Red Team」は8月13日、複数のAIエージェントが自律的に活動し、互いに遭遇した際にどう振る舞うかを調べた研究結果を公開しました。代表的な実験では、3つのClaudeエージェントに同一のソフトウェアプロジェクトへのアクセス権を与え、それぞれに矛盾する指示を与えた上で、他のエージェントの存在は一切知らせずに作業させました。
結果、エージェントたちは一貫して「縄張り争い」的な振る舞いを見せたといいます。各エージェントは他のエージェントの作業を「意図的な妨害」だと解釈し、互いのUnixアカウントを無効化したり、相手のプロセスを探して強制終了し続けるスクリプトを仕掛けたり、無害を装ったコードに悪意ある処理を仕込んだりするなど、攻撃は自己増殖型マルウェアの投下にまでエスカレートしました。別の価格設定ゲームの実験でも、同一の卸値を与えられ個別に利益最大化するよう指示されたエージェント同士が、非公開の通信手段を与えられると即座に価格の下限で結託し、その手段を取り上げた後も似た価格を維持し続けたということです。
一方で、対立が常に悪化するとは限らないことも分かりました。モデルによっては、相手の行動を敵意ではなく「矛盾する指示」の結果だと認識し直し、攻撃をやめて休戦に持ち込むケースも見られました。休戦に至った際には、コミットメッセージやMarkdownファイルに自らの攻撃的な振る舞いを謝罪する文言を残し、人間の介入を求める例もあったといいます。モデルごとの傾向差も見られ、報道によれば新しいモデルほど休戦による解決の比率が高い一方、他のモデルは実力行使によるエスカレートに至りやすかったとされています。
AnthropicはAIエージェントが共有のコードベースや市場、コンピューティング環境をまたいで自律的に動く場面が今後増えるとみて、こうしたエージェント間相互作用のリスクを事前に把握する狙いでこの研究を進めたと説明しています。複数のエージェントを同時に走らせる運用が広がる中、意図せぬ競合や協調の失敗がセキュリティ上の実害につながりうることを示す事例として注目されています。
出典: TechCrunch



