GitHubは9月4日、コーディングタスクの内容に応じて複数のAIモデルを実行時に組み合わせる新機能「Project HydraFusion」を、GitHub Copilotの研究プレビューとして公開した。公式ブログによると、単一モデルにタスク全体を任せるのではなく、簡易なモデルにまず下書きをさせて品質ゲートで判定し必要に応じてより高性能なモデルへエスカレーションする「カスケード」方式や、別系統のモデルが下書きを批評したうえで1回だけ修正する「クリティーク」方式など、タスクごとに最適な組み合わせを選ぶ仕組みだ。
名称の由来は、Microsoftの研究者が発表したルーティング手法の研究「HyDRA(Hybrid Dynamic Routing Architecture)」にある。現時点ではGitHub Copilot CLIの実験的フラグを通じてすべてのCopilotプランの開発者が利用でき、課金は組み合わせた各モデルの標準トークン料金に基づいて行われる。
公式ベンチマークでは、エージェント型タスクを評価する「TerminalBench 2.1」において、Claude Opus 5を単独利用した場合と比べて検証済みタスクの精度を4.9ポイント改善しつつ、推定コストを67%削減したという。より大規模なリポジトリを扱うソフトウェア工学タスクを評価する「DeepSWE」でも、精度はOpus 5に1.5ポイント差まで迫りながら、コストは36%削減したとしている。
一方でVentureBeatなどの報道は、コスト削減効果はすべてのベンチマークで確認できたものの、品質面で単一モデルに完全に並んだのは一部の評価にとどまると指摘しており、複数モデルの組み合わせによる効果は評価軸によって濃淡があることもうかがえる。
出典: GitHub公式ブログ



