AIニュース

GitHub、Copilot向けにマルチモデル・オーケストレーション「HydraFusion」を研究プレビュー公開

公開日: ・出典: GitHub公式ブログ

GitHubは9月4日、コーディングタスクの内容に応じて複数のAIモデルを実行時に組み合わせる新機能「Project HydraFusion」を、GitHub Copilotの研究プレビューとして公開した。公式ブログによると、単一モデルにタスク全体を任せるのではなく、簡易なモデルにまず下書きをさせて品質ゲートで判定し必要に応じてより高性能なモデルへエスカレーションする「カスケード」方式や、別系統のモデルが下書きを批評したうえで1回だけ修正する「クリティーク」方式など、タスクごとに最適な組み合わせを選ぶ仕組みだ。

名称の由来は、Microsoftの研究者が発表したルーティング手法の研究「HyDRA(Hybrid Dynamic Routing Architecture)」にある。現時点ではGitHub Copilot CLIの実験的フラグを通じてすべてのCopilotプランの開発者が利用でき、課金は組み合わせた各モデルの標準トークン料金に基づいて行われる。

公式ベンチマークでは、エージェント型タスクを評価する「TerminalBench 2.1」において、Claude Opus 5を単独利用した場合と比べて検証済みタスクの精度を4.9ポイント改善しつつ、推定コストを67%削減したという。より大規模なリポジトリを扱うソフトウェア工学タスクを評価する「DeepSWE」でも、精度はOpus 5に1.5ポイント差まで迫りながら、コストは36%削減したとしている。

一方でVentureBeatなどの報道は、コスト削減効果はすべてのベンチマークで確認できたものの、品質面で単一モデルに完全に並んだのは一部の評価にとどまると指摘しており、複数モデルの組み合わせによる効果は評価軸によって濃淡があることもうかがえる。

出典: GitHub公式ブログ

Xでシェア

単一モデル(Claude Opus 5)利用時との比較

GitHubが公開したベンチマーク結果によると、HydraFusionはコストを抑えつつ、評価によっては精度も上回るとしている。

評価項目 Claude Opus 5単独 HydraFusion
TerminalBench 2.1の検証済みタスク精度 基準 4.9ポイント向上
TerminalBench 2.1の推定コスト 基準 67%削減
DeepSWEの精度 基準 1.5ポイント差まで接近
DeepSWEの推定コスト 基準 36%削減

※出典: GitHub公式ブログ