AIニュース

Google、Gemini Flash系列に動画を自律的に解析する「Agentic Video Understanding」を導入 トークン消費を最大88%削減

公開日: ・出典: officechai

Googleは9月1日、Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Liteの3モデルに、動画を自律的に解析する新機能「Agentic Video Understanding(エージェント型動画理解)」を導入したと発表した。従来の動画解析は動画を一定間隔でサンプリングし常に全フレームを処理する固定フレームレート方式が中心だったが、新方式ではモデル自身がGeminiのネイティブな動画ツールを使い、必要な区間を動的にスキャンして解析対象を選び取る。

Google公式の発表によれば、この方式変更により長尺動画を扱う際のトークン消費量を最大88%、解析コストを最大66%削減できるとしている。同時に精度も最大7%向上するとしており、瞬間的な出来事を秒単位で検索する「モーメント検索」や、より正確な異常検知、精密なカウントなど、これまで長尺動画では処理コストの高さから実用が難しかった用途にも道を開くという。

現時点ではGoogle AI StudioやGemini Enterprise Agent Platform経由のGemini APIから、動画アップロードおよびYouTube動画を対象に利用可能。一般消費者向けのGeminiアプリへの提供は「近日中」としており、YouTubeの「Ask YouTube」機能への搭載は数カ月後を見込むとしている。

出典: officechai

Xでシェア

動画解析方式の変化(固定フレームレート方式→Agentic Video Understanding)

Google公式発表の内容をもとに、これまでの固定フレームレート方式と新しい「Agentic Video Understanding」方式を比較します。

項目 従来の固定フレームレート方式 Agentic Video Understanding
処理方式 動画を一定間隔でサンプリングし、常に全フレームを解析 モデルが動画区間を動的にスキャンし、必要な部分だけを解析
長尺動画解析時のトークン消費量 動画が長くなるほど比例して増大 従来方式比で最大88%削減
解析コスト 動画の長さに比例して増大 従来方式比で最大66%削減

※出典: Google公式ブログ / officechai