商用の拡散言語モデル(diffusion LLM, dLLM)を手がける米新興企業Inceptionは9月8日、新モデル「Mercury 2.5」を発表しました。従来のTransformer系モデルのようにトークンを一つずつ逐次生成するのではなく、出力全体の粗い下書きを作った上で並列に精緻化していく拡散モデル方式を採用しており、標準的なGPU上で毎秒1,100トークンを超える生成速度を維持しながら、知能面のベンチマークスコアを前モデル「Mercury 2」比で約40%引き上げたとしています。
コンテキストウィンドウは「Mercury 2」の12万8000トークンから26万トークンへと倍増したほか、推論の強さを調整できる機能や、複数のツールを並列に呼び出す機能、スキーマに沿ったJSON出力への対応も追加されました。価格はAPI経由で入力100万トークンあたり0.20ドル・出力0.75ドルに設定されており、発売記念として当面は8割引の0.04ドル・0.15ドルで利用できるとしています。
Inceptionのモデルは同社独自のAPIに加え、OpenRouterやBasetenといった外部プラットフォーム経由でも利用可能です。検索・音声対話・コーディングエージェントなど低遅延が求められる用途で、逐次生成型の主要モデルに対する速度面の優位性を維持しつつ知能面の底上げを図る動きといえます。
出典: Inception



