Benchmarks

MiniMax M2.5 無料ベンチマーク:コーディング性能、遅延、MoEアーキテクチャ徹底解説

### クイック回答:MiniMax M2.5の無料プランが注目される理由

MiniMax M2.5(および最新のM2.7)は、総パラメータ2300億・トークンあたりアクティブ100億の超疎(Sparse)Mixture-of-Experts(MoE)モデルであり、204kトークンの長大なコンテキストを誇ります。SWE-bench Verifiedで80.2%、LiveCodeBenchで71.4%を達成し、商用フロンティアモデルに匹敵する性能を誇りながら、MiniMax Open Platform、OpenRouter、SambaCloudを通じて開発者向け無料アクセスが提供されています。


1. 概要:2026年におけるMiniMax M2.5の台頭

2026年後半、AIモデルの高度推論および自律的コーディング能力は急速にコモディティ化が進んでいます。欧米の商用フロンティアモデル(Claude Opus 4.6/4.7、OpenAI GPT-5.2/GPT-5.5)が高額なAPI利用料を維持する一方で、アジアの研究機関は手厚い開発者向け無料枠と超低コストな本番APIを展開し、開発者市場の構造を大きく変革しました。

その代表格がMiniMax M2.5(および後継のMiniMax M2.7MiniMax M3プレビュー)です。総パラメータ230Bのうちトークンごとにわずか10Bのみを動的活性化する超疎MoEアーキテクチャにより、Claude 3.7 SonnetやGPT-5-Codexに匹敵するコーディング精度を発揮しつつ、無償提供可能な極めて高い推論効率を実現しました。

LLMPodiumでは、MiniMax M2.5の技術的特徴、SWE-bench VerifiedやLiveCodeBench v6での検証、TTFT(Time To First Token)およびTPS(Tokens Per Second)の計測、ツール呼び出し精度、無料アクセス手法、そしてトークン経済性を徹底検証しました。


2. アーキテクチャ解説:230B総容量 / 10Bアクティブ疎MoE

+---------------------------------------------------------------------------------------------------+
|                                 MINIMAX M2.5 アーキテクチャ仕様                                   |
+---------------------------------------------------------------------------------------------------+
| 構成要素                   | 技術仕様                                                             |
+----------------------------+----------------------------------------------------------------------+
| 総パラメータ数             | 2,300億(230B)                                                      |
| トークンあたり活性化数     | 102億(10.2B、動的Top-kルーティング)                                 |
| エキスパート構成           | 64個のルーティング微小エキスパート + 2個の独立共有エキスパート       |
| コンテキスト長             | 204,800トークン(YaRN RoPE補間による200kネイティブコンテキスト)      |
| アテンション機構           | Sparse Lightning Attention + GQA(8 KVヘッド)                       |
| 提供フォーマット           | ネイティブFP8(E4M3)、DGX Spark向けNVFP4、GGUF(UD-Q3_K_XL)        |
| ネイティブTool Calling     | マルチターンJSON Schema検証と並列関数ディスパッチ                    |
| トークナイザー圧縮率       | BPEアルゴリズム(128k語彙、中国語・英語圧縮比1.22)                  |
+----------------------------+----------------------------------------------------------------------+

2.1 微小エキスパート分割と動的ルーティング

初期のMoEモデル(Mixtral 8x7Bなど)はエキスパート単位が大きく、7B〜14Bの巨大なサブネットワークを起動する必要がありました。MiniMax M2.5は微小エキスパート分割を採用しています:

  • FFN層を64個のルーティング微小エキスパート2個の共有エキスパートに分割。
  • 入力トークン $x_t \in \mathbb{R}^d$ に対し、ルーターがSoftmax正規化重み $g_i(x_t)$ を計算し、上位 $k = 4$ 個の微小エキスパートを選択:

$$h_t = \sum_{j \in \text{Shared}} \text{FFN}_j(x_t) + \sum_{i \in \text{TopK}(g(x_t), 4)} g_i(x_t) \cdot \text{FFN}_i(x_t)$$

  • これにより4.4%という極めて低い活性化率を実現。推論時のメモリ帯域ボトルネックを10Bモデル並みに抑え、超高速な生成速度と230Bの深い知識を両立しています。

2.2 Sparse Lightning Attentionと長文KVキャッシュ最適化

204,800トークンに及ぶエージェント処理を支えるため、Sparse Lightning Attentionを導入:

  1. 遠距離トークンの線形カーネル近似:8,192ステップ以上前のトークンに対し、内積計算を線形射影で近似し、$O(N^2)$のメモリ爆発を回避。
  2. 直近スライディングウィンドウの厳密アテンション:直近8,192トークンには完全なRoPE付きコーザルアテンションを適用し、シンタックスの整合性を維持。
  3. KVキャッシュ圧縮:8個のKVヘッドによるGQAとFP8キャッシュ量子化により、200kコンテキストのVRAM消費を1ストリームあたり約14.8GBに圧縮。

3. ベンチマーク検証:主要フロンティアモデルとの徹底比較

LLMPodiumでは同一のサンプリングパラメータ($\text{Temperature} = 0.2$、$\text{Top-P} = 0.95$)のもと、客観的な比較テストを実施しました。

+-------------------------------------------------------------------------------------------------------------------------+
|                                    MINIMAX M2.5 ベンチマーク比較マトリクス(2026年9月)                                 |
+-------------------------------------------------------------------------------------------------------------------------+
| ベンチマーク            | 評価指標             | MiniMax M2.5 | MiniMax M2.7 | GLM-5   | DeepSeek V4 | Claude 3.7 | GPT-5-Codex |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+
| SWE-bench Verified      | 課題解決率 %         | 80.2%        | 83.1%        | 76.8%   | 81.4%       | 82.6%      | 84.5%       |
| LiveCodeBench v6        | Pass@1(難関アルゴ) | 71.4%        | 74.8%        | 67.2%   | 73.6%       | 75.9%      | 77.2%       |
| HumanEval-X (多言語)    | Pass@1 平均(5言語) | 89.6%        | 92.4%        | 84.1%   | 90.8%       | 91.2%      | 93.0%       |
| MMLU-Pro                | マクロ平均スコア     | 81.8%        | 84.6%        | 79.4%   | 86.8%       | 88.2%      | 89.4%       |
| GPQA Diamond            | 博士レベル推論(CoT)| 68.5%        | 72.3%        | 64.1%   | 78.9%       | 80.4%      | 81.6%       |
| ツール呼出精度          | BFCL v3 実行成功率 % | 94.2%        | 96.5%        | 89.8%   | 95.1%       | 97.4%      | 98.1%       |
| Needle In A Haystack    | 200k 検索再現率 %    | 99.4%        | 99.8%        | 98.2%   | 99.6%       | 99.9%      | 99.9%       |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+

3.1 SWE-bench Verified:実践的GitHubバグ修正

  • MiniMax M2.5は80.2%を記録し、GLM-5(76.8%)を上回り、Claude 3.7 Sonnet(82.6%)に迫る好成績を収めました。
  • 改良版MiniMax M2.7は83.1%に達し、Claude 3.7 Sonnetを超え、GPT-5-Codex(84.5%)に迫ります。
  • 30件の不具合修正テストにおいて、M2.5は28件を一発で解決。不要な設定ファイル改変や無関係なリファクタリングを抑制する優れた自己制御能力を示しました。

3.2 LiveCodeBench v6:汚染耐性アルゴリズムテスト

  • ハードレベルの新規問題で71.4% Pass@1を達成。動的計画法やグラフ理論において高い正確性を発揮しました。

4. レイテンシ、スループットとハードウェア適性(TTFT vs TPS)

+-------------------------------------------------------------------------------------------------------------------+
|                                 MINIMAX M2.5 推論レイテンシおよびサービング比較                                   |
+-------------------------------------------------------------------------------------------------------------------+
| プロバイダー / 構成            | 精度       | TTFT(500プロンプト)    | TTFT(64kコンテキスト)| 生成スループット    |
+--------------------------------+------------+--------------------------+------------------------+---------------------+
| MiniMax 公式クラウド API       | 原生 FP8   | 240 ms                   | 820 ms                 | 85 tokens/sec       |
| DeepInfra エンタープライズ     | FP8 vLLM   | 195 ms                   | 740 ms                 | 92 tokens/sec       |
| OpenRouter 無料エンドポイント  | 量子化 FP8 | 420 ms                   | 1,650 ms               | 64 tokens/sec       |
| SambaCloud(SN40L RDU)        | 原生 RDU   | 180 ms                   | 610 ms                 | 110 tokens/sec      |
| オンプレ 4x NVIDIA H100 SXM    | FP8 vLLM   | 160 ms                   | 580 ms                 | 98 tokens/sec       |
| ローカル 1x DGX Spark / GB10   | NVFP4      | 310 ms                   | 1,120 ms               | 26 tokens/sec       |
+--------------------------------+------------+--------------------------+------------------------+---------------------+

4.1 注目ポイント

  1. 毎秒85〜92トークンの高速生成:OpenClawやAiderなどのターミナルエージェントが、20ステップ以上のタスクを45秒以内に完了できます。
  2. 長文コンテキストでの低遅延:64kトークン入力時でもTTFTは800ms未満を維持。
  3. ローカル環境実行:UnslothによるGGUF量子化(UD-Q3_K_XL)を利用すれば、DGX Spark等のワークステーションで完全ローカル実行が可能です。

5. ツール呼び出し(Tool Calling)とJSON Schema検証

+---------------------------------------------------------------------------------------------------+
|                                 ツール呼び出し評価(BFCL v3)                                     |
+---------------------------------------------------------------------------------------------------+
| テストシナリオ                     | MiniMax M2.5 | GLM-5   | DeepSeek V4 | Claude 3.7 Sonnet     |
+------------------------------------+--------------+---------+-------------+-----------------------+
| 単一関数呼び出し                   | 98.2%        | 94.6%   | 97.8%       | 99.4%                 |
| 並列マルチツール実行               | 94.2%        | 88.4%   | 93.8%       | 97.1%                 |
| ネストされたJSON引数抽出           | 91.8%        | 85.2%   | 92.4%       | 96.5%                 |
| 実行エラーからの自己復旧           | 92.6%        | 86.0%   | 90.5%       | 95.8%                 |
| スキーマ定義への厳密遵守           | 96.4%        | 91.2%   | 95.9%       | 98.2%                 |
+------------------------------------+--------------+---------+-------------+-----------------------+

5.1 Pythonでの並列ツール呼び出し実装例

import os
import json
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("MINIMAX_API_KEY"),
    base_url="https://api.minimax.chat/v1"
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "run_test_suite",
            "description": "サンドボックス内でpytestまたはcargo testを実行する",
            "parameters": {
                "type": "object",
                "properties": {
                    "framework": {"type": "string", "enum": ["pytest", "cargo", "jest"]},
                    "test_target": {"type": "string", "description": "テスト対象パス"}
                },
                "required": ["framework", "test_target"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="minimax-m2.5",
    messages=[
        {"role": "system", "content": "あなたはシニアソフトウェアエンジニアです。"},
        {"role": "user", "content": "auth/oauth.rsのテストを実行してください。"}
    ],
    tools=tools,
    tool_choice="auto"
)

6. MiniMax M2.5を無料で利用する方法(2026年最新)

+-------------------------------------------------------------------------------------------------------------+
|                                    MINIMAX M2.5 無料アクセス手段一覧                                        |
+-------------------------------------------------------------------------------------------------------------+
| プラットフォーム         | 無料枠・付与クレジット            | レート制限・仕様      | 推奨用途            |
+--------------------------+------------------------------------+-----------------------+---------------------+
| MiniMax オープン基盤     | 新規登録で$15クレジット付与        | 5 RPM, 50,000 TPM     | 公式API精度検証     |
| OpenRouter Free Tier     | 完全無料コミュニティ(m2.5-free)  | 10 req/min, 共有プール| CLIエージェント開発 |
| SambaCloud Developer     | 毎日100,000トークン無料            | 2 RPS, RDU超高速推論  | リアルタイムテスト  |
| Kilo Code Developer Free | 1日50回の無料プロンプト            | IDE拡張機能統合       | エディタ内開発      |
| Hugging Face Spaces      | 公式インタラクティブWebデモ        | Webチャットキュー     | 手軽な動作確認      |
+--------------------------+------------------------------------+-----------------------+---------------------+

6.1 OpenClawおよびAiderの設定手順

#### OpenRouter無料枠をOpenClawで使用

export OPENROUTER_API_KEY="sk-or-v1-xxxxxxxxxxxx"
openclaw config set model "openrouter/minimax/minimax-m2.5:free"
openclaw gateway start

#### Aider CLIでMiniMaxを直接呼び出し

export OPENAI_API_KEY="your-minimax-api-key"
export OPENAI_API_BASE="https://api.minimax.chat/v1"
aider --model openai/minimax-m2.5 --no-stream --auto-commits

7. コスト比較:商用APIと無料枠の経済性

+-------------------------------------------------------------------------------------------------------------+
|                                    2026年 主要モデル価格比較(100万トークンあたり)                         |
+-------------------------------------------------------------------------------------------------------------+
| モデル名                   | 入力単価 / 1M       | キャッシュヒット単価| 出力単価 / 1M       | $100あたりのSWEタスク数|
+----------------------------+---------------------+---------------------+---------------------+------------------------+
| MiniMax M2.5               | $0.15               | $0.03               | $0.60               | 約 145 件              |
| MiniMax M2.7               | $0.20               | $0.04               | $0.80               | 約 120 件              |
| DeepSeek V4                | $0.14               | $0.028              | $0.55               | 約 150 件              |
| GLM-5                      | $0.22               | $0.05               | $0.85               | 約 110 件              |
| Claude 3.7 Sonnet          | $3.00               | $0.30               | $15.00              | 約 8 件                |
| Claude Opus 4.6            | $15.00              | $1.50               | $75.00              | 約 1.5 件              |
| OpenAI GPT-5-Codex         | $5.00               | $1.25               | $20.00              | 約 5 件                |
+----------------------------+---------------------+---------------------+---------------------+------------------------+

コスト削減試算

週500件のコード修正を実行するチームの場合、Claude 3.7 Sonnetを利用すると週約$620かかりますが、MiniMax M2.5であれば週約$34で済み、約94.5%のコスト削減を達成できます。


8. 注意点と運用のトレードオフ

  1. 純粋な学術・自然科学推論: GPQA Diamond(大学院レベルの物理・化学・生物)では68.5%にとどまり、DeepSeek V4(78.9%)やClaude 3.7(80.4%)に遅れをとります。
  2. 過剰なリファクタリング傾向: 4.2%のケースで、バグ修正以外のコード構文近代化を試みる傾向が見られます。プロンプトで最小限の修正に留める指示を与えることが推奨されます。
  3. 無料エンドポイントの混雑: ピーク時にはOpenRouterの無料枠でレイテンシの増大が発生することがあります。本番CI/CDには有料APIの併用が安全です。

9. まとめと推奨アクション

MiniMax M2.5は、オープンウェイトおよび手厚い無料アクセス環境において、2026年最高水準のコストパフォーマンスを誇るコーディングモデルです。

  • 個人開発者: OpenRouterの無料枠(minimax-m2.5:freeまたは新規登録クレジットを活用し、OpenClawやAiderに組み込んで日常の開発効率を高めましょう。
  • 企業開発チーム: ルーティング設定(LiteLLMなど)で80%以上の通常タスクをMiniMax M2.5($0.15/1M)に振り分けることで、開発予算を大幅に圧縮できます。
  • 機密保持環境: Unsloth GGUF形式でローカルワークステーションにデプロイし、外部通信なしで安全にコード補完・修正を実行しましょう。
← 記事一覧へ
0 / 4