AIベンチマーク

LiveCodeBench対SWE-bench:2026年AIコードベンチマーク徹底比較

### クイックアンサー:2026年のLiveCodeBenchとSWE-benchの決定的な違い

LiveCodeBenchリーダーボード2026は、継続的に追加される競技プログラミング課題を通じて訓練データの漏洩(コンタミネーション)のない純粋なアルゴリズム推論力を測定します。一方、SWE-benchは実際のGitHubリポジトリ全体を対象としたエンドツーエンドのソフトウェア開発能力を評価します。Claude CodeやCursorなどの自律型コーディングエージェントの選定にはSWE-bench Verifiedが最も信頼性の高い指標です。


1. 静的合成ベンチマークの崩壊:HumanEvalとMBPPの限界

長年にわたり、AI業界はOpenAIが2021年に策定したHumanEval(164問の単一Python関数問題)やMBPPなどの合成ベンチマークを指標としてきました。しかし、2024年後半から2025年にかけてフロンティアモデルの正解率は92%〜98%に達し、測定基準として完全に飽和しました。

さらに深刻な問題となったのが訓練データの汚染(Data Contamination)です:

  1. Webスクレイピングによる混入:テストコードや問題文がWebクローラによって収集され、事前学習コーパスに混入。
  2. ポストトレーニングの過学習:RLHFや指示チューニングでHumanEval類似の問題形式に過剰最適化。
  3. グッドハートの法則の露呈「指標が目標になると、それはもはや良い指標ではなくなる」。合成テストで高スコアを出すモデルが、現場の大規模リポジトリではインポートエラーを起こし、基本構文を破壊する事態が多発しました。
+-------------------------------------------------------------------------------+
|                      THE CODING BENCHMARK EVOLUTION CRISIS                    |
+-------------------------------------------------------------------------------+
| Era         | Dominant Benchmark | Test Scope       | Critical Flaw           |
+-------------+--------------------+------------------+-------------------------+
| 2021 - 2023 | HumanEval / MBPP   | Single Function  | Severe Contamination    |
| 2024 - 2025 | HumanEval+ / EvalPlus | Fuzzed Inputs | Saturated (>95%), Toy Code|
| 2025 - 2026 | LiveCodeBench      | Fresh Contests   | Algorithmic, Not Repo   |
| 2025 - 2026 | SWE-bench Verified | Real GitHub PRs  | Scaffold Dependent, High Cost|
+-------------------------------------------------------------------------------+

2026年、業界が信頼を置く基準として確立されたのが以下の2大ベンチマークです:

  • LiveCodeBench:LeetCode、AtCoder、Codeforcesの最新コンテストからモデル学習カットオフ以降の問題のみを抽出する動的汚染耐性ベンチマーク。
  • SWE-bench Verified:実際のGitHubリポジトリ環境をDocker内で再現し、Issueの自動解決とリグレッション回避を検証する実戦型評価指標。

2. ベンチマーク比較マトリクス:LiveCodeBench vs SWE-bench vs HumanEval+

評価項目 HumanEval+ (従来基準) LiveCodeBench (v5 2026) SWE-bench Verified (2026)
対象問題領域 単一Python関数のパズル 競技プログラミング・自動修復 実装規模のエンタープライズリポジトリ
データ汚染対策 なし(2021年の固定データ) 時系列フィルタリング(公開日管理) 人間による厳選検証(曖昧なPR排除)
実行環境 単純なサンドボックス exec() 多言語サンドボックス判定機 隔離Dockerコンテナ(pytest/tox)
コンテキスト長 150 – 500トークン 500 – 3,000トークン 15,000 – 150,000+トークン
評価タスク種別 コード生成のみ 生成、実行推論、バグ自己修復 リポジトリ探索、パッチ作成、全量テスト
足場(スキャフォールド)依存度 ほぼ無関係(ゼロショット) 低い(CoTプロンプティング程度) 極めて高い(エージェント実装依存)
1モデルあたりの評価費用 約$0.50 – $2.00 約$15.00 – $45.00 $450.00 – $2,500.00
実環境エージェント相関性 ($R^2$) 0.18(予測能力なし) 0.68(中〜高相関) 0.91(極めて強力な相関)

3. LiveCodeBenchのアーキテクチャ:汚染ゼロのアルゴリズム評価

3.1 継続的時系列収集パイプライン

UCバークレー、MIT、コーネル大学の研究チームによって開発された LiveCodeBench は、データの事前学習への混入を完全に防止する設計となっています。

主要な3大競技プログラミングプラットフォームから定期的に新問を取得します:

  • LeetCode:WeeklyおよびBi-Weeklyコンテスト(Easy / Medium / Hard)
  • AtCoder:AtCoder Beginner Contest (ABC) / Regular Contest (ARC)
  • Codeforces:Div. 2およびDiv. 3コンテスト
+-------------------------------------------------------------------------------+
|                 LIVECODEBENCH CONTINUOUS EVALUATION PIPELINE                  |
+-------------------------------------------------------------------------------+
                                        |
      +---------------------------------+---------------------------------+
      v                                 v                                 v
+---------------+               +---------------+               +---------------+
|   LeetCode    |               |    AtCoder    |               |   Codeforces  |
|Contest Scraper|               |Contest Scraper|               |Contest Scraper|
+---------------+               +---------------+               +---------------+
      |                                 |                                 |
      +---------------------------------+---------------------------------+
                                        v
                    +---------------------------------------+
                    |   Temporal Cutoff Validation Engine   |
                    |  (Partitioning by Release Date vs     |
                    |   Target Model Pretraining Cutoff)    |
                    +---------------------------------------+
                                        v
                    +---------------------------------------+
                    |           Multi-Task Triad            |
                    +---------------------------------------+
                           |            |            |
         +-----------------+            |            +-----------------+
         v                              v                              v
+-------------------+          +-------------------+          +-------------------+
|  Code Generation  |          |   Code Execution  |          |    Code Repair    |
| (Pass@1 Synthesis)|          | (Output Tracing)  |          | (Self-Correction) |
+-------------------+          +-------------------+          +-------------------+
         |                              |                              |
         +-----------------+            |            +-----------------+
                           v            v            v
                    +---------------------------------------+
                    |      Sandboxed Test-Time Execution    |
                    | (Resource Limits: Memory, CPU, Time)  |
                    +---------------------------------------+
                                        v
                    +---------------------------------------+
                    |      LiveCodeBench Leaderboard 2026   |
                    +---------------------------------------+

3.2 3つの評価タスク

  1. コード生成 (Pass@1):制約条件を満たす完全なアルゴリズムコードを生成し、隠れテストケースをパスするかを測定。
  2. コード実行予測 (Execution):実行結果の出力を予測させ、モデル内部の仮想ランタイム能力を検証。
  3. 自己修復 (Code Repair):エラーログを与え、最小限の修正パッチでバグを自律解決できるかをテスト。

4. SWE-bench詳細分析:リポジトリ規模のソフトウェア工学

4.1 SWE-bench FullからVerifiedへの進化

プリンストン大学とシカゴ大学が発表した SWE-bench は、実在する著名Pythonリポジトリ(djangosympypytestmatplotlibscikit-learnなど)のGitHub Issueをベンチマーク化しました。

+-------------------------------------------------------------------------------+
|                       SWE-BENCH EXECUTION HARNESS ARCHITECTURE                |
+-------------------------------------------------------------------------------+
                                        |
                    +---------------------------------------+
                    | GitHub Issue Description (Task Text)  |
                    | + Repository Base Commit SHA          |
                    +---------------------------------------+
                                        v
                    +---------------------------------------+
                    |         Agentic Scaffold Loop         |
                    |(Claude Code, Cursor, Aider, OpenHands)|
                    +---------------------------------------+
                         |              |              |
                         v              v              v
                  [Read File]      [Grep / AST]   [Bash Command]
                         |              |              |
                         +--------------+--------------+
                                        v
                    +---------------------------------------+
                    |       Candidate Patch (`git diff`)    |
                    +---------------------------------------+
                                        v
                    +---------------------------------------+
                    |     Docker Isolated Test Container    |
                    +---------------------------------------+
                           |                         |
                           v                         v
              +-------------------------+  +-------------------------+
              |      FAIL_TO_PASS       |  |      PASS_TO_PASS       |
              | (Issue-Specific Tests)  |  |  (Regression Test Suite)|
              |   MUST PASS (Resolved)  |  |  MUST REMAIN PASSING    |
              +-------------------------+  +-------------------------+
                                        v
                    +---------------------------------------+
                    |   Resolution: RESOLVED / UNRESOLVED   |
                    +---------------------------------------+

4.2 厳格な2段階テスト合否判定

パッチはDocker環境で検証され、以下を同時に満たす必要があります:

  • FAIL_TO_PASS:Issueの再現テストがパッチ適用後に全て合格(PASS)すること。
  • PASS_TO_PASS:既存の数千に及ぶ全リグレッションテストが引き続き合格すること。

5. データ汚染耐性の実証データ

+-------------------------------------------------------------------------------+
|                ACCURACY DROP ACROSS PRETRAINING CUTOFF DATES                  |
+-------------------------------------------------------------------------------+
| Dataset                     | Pre-Cutoff Accuracy | Post-Cutoff Accuracy | Drop (%) |
+-----------------------------+---------------------+----------------------+----------+
| HumanEval (Static 2021)     | 96.4%               | N/A (Frozen)         | N/A      |
| Codeforces Div2 (Memorized) | 88.2%               | 54.1%                | -38.6%   |
| LeetCode Hard (Contaminated)| 82.5%               | 48.9%                | -40.7%   |
| LiveCodeBench v5 (Unleaked) | 78.4%               | 76.9%                | -1.9%    |
| SWE-bench Verified (Curated)| 68.2%               | 65.8%                | -3.5%    |
+-----------------------------+---------------------+----------------------+----------+

学習カットオフ以前の記憶に依存していた問題群では正答率が 約40%暴落 しますが、LiveCodeBench v5では1.9%の誤差にとどまり、真の汎化知能を証明しています。


6. 2026年最新フロンティアモデルベンチマーク順位表

モデル名称 LiveCodeBench v5 (総合) LiveCodeBench v5 (Hard) SWE-bench Verified (解決率) SWE-bench Lite MMLU-Pro AIME 2026 100万トークン単価 (入力/出力)
Claude Opus 4.7 (Anthropic) 87.5% 78.6% 79.4% 74.2% 90.5% 95.4% $15.00 / $75.00
OpenAI o3 (Reasoning) 86.8% 77.2% 76.8% 71.5% 89.8% 96.1% $12.00 / $60.00
Claude 4.6 Sonnet (Anthropic) 83.4% 72.5% 71.2% 66.4% 86.2% 87.2% $3.00 / $15.00
DeepSeek V4 (推論特化) 83.2% 71.4% 62.1% 58.6% 86.8% 93.6% $0.27 / $1.10
OpenAI GPT-5.5-Codex 82.1% 69.8% 68.5% 63.2% 85.1% 89.0% $5.00 / $20.00
Zhipu GLM-6 (MoE Reasoning) 79.8% 66.7% 58.9% 54.2% 83.4% 88.5% $0.60 / $2.20
Qwen 3.5 Coder 64B (オープン) 76.2% 61.5% 52.4% 48.1% 80.5% 79.2% $0.20 / $0.80
MiniMax M2.5 77.4% 62.8% 53.8% 49.6% 81.2% 82.4% $0.40 / $1.60
Google Gemini 2.5 Pro 80.6% 68.2% 61.4% 56.8% 84.7% 86.0% $1.25 / $5.00

7. テスト時計算(Test-Time Compute)と実行ベース検証の意義

+-------------------------------------------------------------------------------+
|                     TEST-TIME REASONING COMPUTE TRADE-OFF                     |
+-------------------------------------------------------------------------------+
| Strategy           | SWE-bench Score | Token Cost Multiplier | Latency (TTFT) |
+--------------------+-----------------+-----------------------+----------------+
| Greedy (T=0.0)     | 54.8%           | 1.0x (Baseline)       | 1.2s           |
| CoT (<think> tags) | 64.2%           | 2.8x                  | 4.5s           |
| Iterative Self-Fix | 71.2%           | 4.5x                  | 12.0s          |
| MCTS + PRM Search  | 79.4%           | 14.2x                 | 45.0s          |
+--------------------+-----------------+-----------------------+----------------+

構文木(AST)の静的検証だけでは、動的型の不一致やメモリリーク、バージョンの非互換性を防ぐことはできません。プロセス報酬モデル(PRM)とテスト時検索の導入が不可欠です。


8. ベンチマーク選定ガイド:どの指標を信頼すべきか?

+-------------------------------------------------------------------------------+
|                        BENCHMARK SELECTION DECISION MATRIX                    |
+-------------------------------------------------------------------------------+
                                        |
                 What is your primary deployment use case?
                                        |
         +------------------------------+------------------------------+
         v                                                             v
[Algorithmic / Microservice]                                  [Autonomous Agent / IDE]
- LeetCode / Interview Prep                                   - Multi-file Refactoring
- Fast Script Generation                                      - GitHub Issue Resolution
- Math & Dynamic Programming                                  - Cursor, Aider, Claude Code
         |                                                             |
         v                                                             v
+-------------------------------+                             +-------------------------------+
|     TRUST LIVECODEBENCH       |                             |       TRUST SWE-BENCH         |
|  - Zero contamination risk    |                             |  - Measures repo navigation   |
|  - Tests execution & repair   |                             |  - Tests pytest integration   |
|  - Fast, cost-effective eval  |                             |  - Direct proxy for agents    |
+-------------------------------+                             +-------------------------------+

9. 結論とLLMPodiumの推奨方針

  • 最優秀自律型エージェントモデルClaude Opus 4.7(SWE-bench Verified 79.4%)
  • 最高コストパフォーマンスAPIDeepSeek V4(100万トークンあたり$0.27/$1.10)
  • 最良オープンウェイト基盤Qwen 3.5 Coder 64B(自社オンプレミス環境に最適)
← 記事一覧へ
0 / 4