Microsoft AIは9月3日、新しい音声認識(音声のテキスト化)モデル「MAI-Transcribe-2」を発表した。同社は「世界で最も高速・高精度・低価格な音声認識モデル」とうたっており、価格は音声1時間あたり0.10ドルという導入価格を2026年内の期間限定で提示している。対応言語は60言語に達し、話者分離(ダイアライゼーション)や書き起こしスタイルの設定、単語単位のタイムスタンプ付与といった機能も備える。Microsoft Foundryでパブリックプレビューとして提供が始まった。
Microsoftによれば、MAI-Transcribe-2は60言語を対象にした音声認識ベンチマーク「FLEURS」で平均単語誤り率(WER)5.2%を記録し首位に立ったという。速度面でもOpenAIの「GPT-Transcribe」の10倍、ElevenLabsの「Scribe v2」の7倍、Googleの「Gemini 3.5 Transcribe」の5倍の速さだと主張している。同社が示した試算では、コールセンター音声を年間10万時間処理するような企業の場合、書き起こしコストが年3万6000ドルから1万ドルへ下がる計算になるという。
MAI-Transcribeシリーズはこれで3世代目となる。約5カ月前に投入された初代モデルは1時間あたり0.36ドルの価格設定だったが、今回はそこから約7割の値下げとなる。また今年6月に投入された中間バージョン「MAI-Transcribe-1.5」では対応言語が25言語から43言語に拡大されており、今回の60言語対応はそこからさらに拡大した形となる。音声認識分野ではOpenAI・Google・ElevenLabsなどとの競争が激化しており、Microsoftは短い間隔でのモデル更新によって価格と性能の両面で優位性を打ち出そうとしている。
出典: VentureBeat



