xAIは2026年9月18日、音声認識(文字起こし)モデルの最新版「Grok Voice Transcribe 2.0」を発表した。同社の音声基盤モデル「Grok Voice」をベースにしており、料金を据え置いたまま、旧版の「Grok Voice Transcribe 1.0」の約2倍の精度を実現したとしている。
xAIによれば、公開されているArtificial Analysisのリーダーボードでは、ストリーミング対応モデル32種の中で精度1位にランクインしたという。特に多言語での精度向上が今回の改良の目玉としている。料金体系は旧版と同一で、バッチ処理が音声1時間あたり0.10ドル、ストリーミングが1時間あたり0.20ドル。話者分離やタイムスタンプ、キーワード抽出も引き続き含まれる。
xAIは、Grok Voice Transcribe 2.0を近くSpeech-to-Text APIの既定モデルに切り替え、数週間以内に1.0を廃止する予定であることも明らかにした。移行期間中も旧版を使い続けたい利用者は、リクエストで「grok-voice-transcribe-1.0」を明示的に指定することで対応できるという。Grok Voiceは既に1日あたり数万件規模のカスタマーサポート通話や、数百万時間分の動画ナレーションの文字起こしに使われているほか、テスラ車載の音声アシスタントなど物理製品にも組み込まれている。
出典: xAI公式



