AIニュース

コーディング評価「Real-SWE」、AnthropicのFable 5.1がGPT-6 Astra・Gemini 3.8 Flashを上回る

公開日: ・出典: Specific Labs (Real-SWE Benchmark)

Y Combinator出身のスタートアップSpecific Labsが、コーディングエージェント向けの新しいベンチマーク「Real-SWE」の結果を公開しました。公開済みの問題セットを使う従来の評価と異なり、実在の企業からライセンスを受けた非公開の本番コードベースをタスクに使うことで、モデルが事前に問題を学習してしまう「ベンチマーク汚染」を避ける狙いがあるといいます。評価はタスクごとに8回試行した際の解決率(pass@1)の平均で、対象タスクは平均11ファイルの編集を伴う規模とされています。

結果は、AnthropicのFable 5.1をClaude Code経由で動かした場合が解決率38.8%で最高となり、OpenAIのGPT-6 Astraが33.8%、GoogleのGemini 3.8 FlashをGemini CLI経由で動かした場合が31.2%で続きました。

一方でコスト面では傾向が異なります。Specific Labsの試算では、Fable 5.1は1回の実行あたり6.96ドルかかり、解決1件あたりでは約17.94ドルに達するのに対し、Gemini 3.8 Flashは1回あたり2.50ドルと安く、解決1件あたりでは約8.01ドルにとどまるとされ、精度とコストのトレードオフが浮き彫りになりました。

なお、コスト試算の具体的な算出方法についてSpecific Labsは詳細を明らかにしておらず、あくまで一民間スタートアップによる独自ベンチマークである点には留意が必要です。

出典: Specific Labs (Real-SWE Benchmark)

Xでシェア

Real-SWEベンチマークで確認できたモデル比較

Specific LabsのReal-SWEベンチマークが公開した数値のうち、解決率とコストの両方が確認できた2モデルを比較します(GPT-6 Astraはコスト試算の公開情報が確認できなかったため対象外)。

モデル 実行環境 解決率(pass@1) 解決1件あたりのコスト
Fable 5.1 Claude Code 38.8% 約17.94ドル
Gemini 3.8 Flash Gemini CLI 31.2% 約8.01ドル

※出典: Real-SWE Benchmark (Specific Labs)