NVIDIAは9月23日、音声中の「誰がいつ話したか」を識別する話者分離(スピーカーダイアライゼーション)向けのオープンウェイトAIモデル「Nemotron 3 Diarization」を公開した。パラメータ数は約1億と比較的小規模ながら、最大8人の話者を重複発話も含めてリアルタイムに識別できるのが特徴。言語に依存しない設計で、ストリーミング・オフラインの両モードに対応し、GPUメモリが4GB程度あれば動作するという。
NVIDIA自身の技術ブログによると、従来社内で使っていた4話者対応の「Streaming Sortformer」を基準とした場合、新モデルは1.04秒のレイテンシで平均41%の話者分離誤り率(DER)削減を達成したとしている。第三者評価であるVoiceArenaの診断ベンチマークでも、12システム・17構成中で最高となる14.72%のDER(次点は19.3%)を記録したとの報告もある。
モデルの重みはNVIDIAの「OpenMDW 1.1」ライセンスのもとHugging Faceで公開され、同社のNeMoフレームワークからも利用できる。BasetenやDeepInfraといった推論プロバイダー経由でもすでに提供が始まっており、構成によっては音声1時間あたり1セント程度という低コストでの利用も可能とされている。会議の自動議事録作成や字幕生成など、発話者を区別する必要がある音声AIアプリケーションへの組み込みが見込まれる。
出典: NVIDIA公式ブログ



