フランスのAIスタートアップMistral AIは、コンテンツの安全性を判定する軽量モデル「Shieldstral」を発表し、Hugging Face上でApache 2.0ライセンスの下オープンウェイトとして公開しました。パラメータ数は30億とコンパクトながら、16GBのGPU1枚で動作する設計です。
従来の安全性判定モデルの多くは、あらかじめ定義された有害カテゴリーの分類器として学習されており、判定基準を変えるにはモデルの再学習が必要でした。Shieldstralはこれとは異なり、「この内容は特定のポリシーに違反しているか」という質問と評価対象(プロンプト、応答、あるいは画像とテキストの組み合わせ)を入力として与える方式を採用し、開発者が自然言語で書いたポリシーをその場で適用できます。これにより、サービスごとに異なる利用規約への対応や、ルール変更への追従が容易になります。
Mistralによれば、Shieldstralはテキストの安全性判定において、自身の7倍規模のオープンモデルと同等かそれを上回る精度を達成し、マルチモーダル(画像を含む)安全性判定でも既存のオープンモデル群を上回るスコアを記録したといいます。AIの出力を監視する「ガードレール」モデルは、生成AIの実運用における重要な基盤技術として注目度を増しており、大手クローズドモデルだけでなく安全性周辺技術でもオープンソース陣営の存在感が高まっていることを示す事例です。
出典: Mistral AI公式ブログ



