OpenAIは9月10日、開発者向けAPIで新しい音声モデル「GPT-Live-1」の提供を開始したと発表しました。相手の発話が終わるのを待ってから応答する従来型の音声対話とは異なり、人の発話中でも同時に聞き取りながら話せる「フルデュプレックス」方式を採用しているのが特徴です。ChatGPTの音声機能を支えてきた会話システムを外部の開発者にも開放するもので、音声認識・応答生成・音声合成をそれぞれ別のモデルでつなぎ合わせていた従来型のパイプラインを置き換えることを狙っています。
料金体系も簡素化されました。音声レイヤー部分は再生時間に応じて1分あたり0.05ドルの定額制となり(バックエンドのモデルが行う推論のトークン利用料は別途課金)、これまでのRealtime API群のように音声の入出力トークンを細かく計測してキャッシュ効率まで見積もる必要があった課金方式に比べ、料金体系が分かりやすくなったとしています。
性能面では、発話への割り込みや相づちへの反応などを測る独自ベンチマーク「Full Duplex Bench」で、旧モデル「GPT-Realtime-2.1」から大幅な向上を公表しています。声のバリエーションも12種類に拡充されたほか、銀行窓口業務を想定した97件のタスクや、航空・小売・通信分野の顧客対応タスクでの性能評価も公開されており、電話応対や金融機関向けの音声窓口といった実務用途を強く意識した内容になっています。



