AIニュース

Google DeepMind、フロンティアAIモデル初の「二重盲検」評価を試験導入

公開日: ・出典: Google DeepMind公式ブログ

Google DeepMindは8月27日、公式ブログで独自開発の商用フロンティアAIモデルとして初となる「二重盲検」評価の試験導入を発表しました。背景にあるのは「ベンチマーク汚染」と呼ばれる問題で、モデルが学習過程で評価用の設問を目にしていた場合、そのベンチマークの結果は額面通りには信頼できなくなります。同社が引用する研究では、調査対象31モデルのうち約半数でベンチマーク流出の兆候が確認されており、特に大規模なモデルほど汚染によってスコアが底上げされやすいとする別の調査結果もあるといいます。

今回の仕組みでは、Google Cloudの機密コンピューティング機能「Confidential Space」を活用し、外部の評価データと自社の非公開モデルの双方が互いに非公開のまま保たれることを暗号技術で検証します。評価を実施する側はGeminiのモデル重みを見ることができず、Google側も評価者が用意した設問の中身を見ることができない仕組みです。

今回のパイロットでは、シンガポールAI安全機構、OpenMined、AVERI、MLCommonsの4団体と協力し、Geminiの軽量モデル(Flash Lite系)を対象に、各団体が保有する非公開ベンチマークで評価を実施しました。Googleはこの結果を新たなGeminiのスコアとして誇示するのではなく、評価そのものがどのように実施されたか、双方が互いのデータに一切アクセスできない形で運用できたかという「評価プロセスの信頼性」に主眼を置いていると説明しています。

AIモデルの性能主張を巡っては、開発企業自身が発表するベンチマークスコアの信頼性がたびたび議論の的となってきました。今回のような第三者による非公開ベンチマーク評価の枠組みが業界標準として広がれば、モデル間の性能比較や安全性評価の信頼性向上につながる可能性があります。

出典: Google DeepMind公式ブログ

Xでシェア