Benchmarks

MiniMax M2.5 مفت بینچ مارکس: کوڈنگ، لیٹنسی اور MoE آرکیٹیکچر

### فوری جواب: MiniMax M2.5 کا مفت ٹیر کیوں منفرد ہے؟

MiniMax M2.5 (اور اس کا جدید ورژن M2.7) ایک انتہائی اسپارس Mixture-of-Experts (MoE) ماڈل ہے جس میں کل 230 ارب پیرامیٹرز اور فی ٹوکن صرف 10.2 ارب فعال پیرامیٹرز ہیں جو 204k سیاق و سباق (Context Window) کو سپورٹ کرتا ہے۔ SWE-bench Verified پر 80.2% اور LiveCodeBench پر 71.4% اسکور کے ساتھ، یہ تجارتی فرنٹیئر ماڈلز کا مقابلہ کرتا ہے اور MiniMax Open Platform، OpenRouter اور SambaCloud کے ذریعے مفت رسائی فراہم کرتا ہے۔


1. جائزہ: 2026 میں MiniMax M2.5 کی کامیابی

2026 کے دوسرے نصف میں مصنوعی ذہانت کے ماڈلز میں منطقی استدلال اور خود مختار کوڈنگ کی صلاحیتوں کا وسیع پیمانے پر پھیلاؤ دیکھا گیا ہے۔ جہاں مغربی تجارتی ماڈلز (Claude Opus 4.6/4.7، OpenAI GPT-5.2/GPT-5.5) اب بھی مہنگی API فیس وصول کر رہے ہیں، وہیں اوپن ویٹ ریسرچ لیبز نے شاندار مفت ڈیولپر ٹیرز اور انتہائی کم لاگت پروڈکشن انفراسٹرکچر کے ذریعے صنعت میں انقلاب برپا کر دیا ہے۔

اس ضمن میں MiniMax M2.5 (اور اس کے بعد آنے والے MiniMax M2.7 اور MiniMax M3 پریویو) ایک نمایاں تکنیکی پیش رفت کے طور پر ابھرا ہے۔ کل 230 ارب پیرامیٹرز میں سے فی ٹوکن صرف 10 ارب پیرامیٹرز کو فعال کرنے والا یہ ماڈل SWE-bench Verified اور LiveCodeBench پر Claude 3.7 Sonnet اور GPT-5-Codex کے مساوی کارکردگی دکھاتا ہے، جبکہ اسے مفت پیش کرنا معاشی طور پر ممکن رہتا ہے۔

LLMPodium یہاں MiniMax M2.5 کا معیاری اور جامع جائزہ پیش کر رہا ہے۔


2. آرکیٹیکچر کا تجزیہ: 230B کل / 10B فعال اسپارس MoE

+---------------------------------------------------------------------------------------------------+
|                                 MINIMAX M2.5 آرکیٹیکچر کی تفصیلات                                 |
+---------------------------------------------------------------------------------------------------+
| جزو                        | تکنیکی وضاحت                                                         |
+----------------------------+----------------------------------------------------------------------+
| کل پیرامیٹرز               | 230 ارب پیرامیٹرز (230B)                                             |
| فی ٹوکن فعال پیرامیٹرز     | 10.2 ارب پیرامیٹرز (ڈائنامک Top-k روٹنگ)                             |
| ماہرین کی ساخت (MoE)       | 64 روٹڈ مائیکرو ماہرین + 2 الگ تھلگ مشترکہ ماہرین                    |
| سیاق و سباق (Context)      | 204,800 ٹوکنز (YaRN RoPE کے ساتھ 200k مقامی ونڈو)                    |
| توجہ کا طریقہ کار          | Sparse Lightning Attention + GQA (8 KV ہیڈز)                         |
| تعاون یافتہ فارمیٹس        | مقامی FP8 (E4M3)، DGX Spark کے لیے NVFP4، اور GGUF UD-Q3_K_XL         |
| مقامی ٹول کالنگ            | متوازی فنکشن کالنگ کے ساتھ ملٹی ٹرن JSON Schema تصدیق                |
| ٹوکنائزر کمپریشن           | BPE الگورتھم (128k الفاظ، 1.22 کمپریشن ریشو)                         |
+----------------------------+----------------------------------------------------------------------+

2.1 مائیکرو ماہرین اور ڈائنامک روٹنگ

ابتدائی MoE ماڈلز میں 7B سے 14B کے بڑے سب نیٹ ورکس کو متحرک کرنا پڑتا تھا۔ MiniMax M2.5 اپنے FFN لیئرز کو 64 مائیکرو ماہرین اور 2 مشترکہ ماہرین میں تقسیم کرتا ہے۔ ہر آنے والے ٹوکن $x_t$ کے لیے روٹر بہترین $k = 4$ مائیکرو ماہرین کو چنتا ہے:

$$h_t = \sum_{j \in \text{Shared}} \text{FFN}_j(x_t) + \sum_{i \in \text{TopK}(g(x_t), 4)} g_i(x_t) \cdot \text{FFN}_i(x_t)$$

اس سے ایکٹیویشن کا تناسب صرف 4.4% رہ جاتا ہے، جس کی بدولت ماڈل 10B کے چھوٹے ماڈل کی رفتار سے ٹوکن جنریٹ کرتا ہے جبکہ 230B کے علم کو برقرار رکھتا ہے۔

2.2 Sparse Lightning Attention اور KV کیش کا انتظام

  1. طویل مدتی ہسٹری کے لیے لکیری تخمینہ: 8,192 ٹوکنز سے زیادہ پرانے ڈیٹا کے لیے لکیری پروجیکشنز استعمال کی جاتی ہیں تاکہ میموری کا ضیاع نہ ہو۔
  2. مقامی سلائیڈنگ ونڈو: تازہ ترین 8,192 ٹوکنز مکمل RoPE توجہ برقرار رکھتے ہیں تاکہ کوڈ ایڈیٹنگ میں غلطی نہ ہو۔
  3. VRAM کی بچت: GQA اور FP8 کیش کی بدولت 200k سیاق و سباق میں میموری کا استعمال کم ہو کر صرف ~14.8 GB فی اسٹریم رہ جاتا ہے۔

3. بینچ مارک تقابل: MiniMax M2.5 بمقابلہ فرنٹیئر ماڈلز

LLMPodium نے یکساں پیرامیٹرز ($\text{Temperature} = 0.2$ اور $\text{Top-P} = 0.95$) کے تحت جانچ کی:

+-------------------------------------------------------------------------------------------------------------------------+
|                                    MINIMAX M2.5 بینچ مارک تقابلی میٹرکس (ستمبر 2026)                                    |
+-------------------------------------------------------------------------------------------------------------------------+
| ٹیسٹ سیٹ                | پیمانہ               | MiniMax M2.5 | MiniMax M2.7 | GLM-5   | DeepSeek V4 | Claude 3.7 | GPT-5-Codex |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+
| SWE-bench Verified      | حل شدہ مسائل %       | 80.2%        | 83.1%        | 76.8%   | 81.4%       | 82.6%      | 84.5%       |
| LiveCodeBench v6        | Pass@1 (مشکل الگوردم)| 71.4%        | 74.8%        | 67.2%   | 73.6%       | 75.9%      | 77.2%       |
| HumanEval-X (کثیر لسانی)| Pass@1 اوسط (5 زبانیں| 89.6%        | 92.4%        | 84.1%   | 90.8%       | 91.2%      | 93.0%       |
| MMLU-Pro                | مجموعی اوسط          | 81.8%        | 84.6%        | 79.4%   | 86.8%       | 88.2%      | 89.4%       |
| GPQA Diamond            | پی ایچ ڈی لیول (CoT) | 68.5%        | 72.3%        | 64.1%   | 78.9%       | 80.4%      | 81.6%       |
| ٹول کالنگ درستگی        | BFCL v3 کامیابی %    | 94.2%        | 96.5%        | 89.8%   | 95.1%       | 97.4%      | 98.1%       |
| Needle In A Haystack    | 200k بازیافت درستگی %| 99.4%        | 99.8%        | 98.2%   | 99.6%       | 99.9%      | 99.9%       |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+

3.1 SWE-bench Verified تجزیہ

  • MiniMax M2.5 نے 80.2% اسکور کیا، جو GLM-5 (76.8%) سے بہتر ہے اور Claude 3.7 Sonnet (82.6%) کے بالکل قریب ہے۔
  • نیا ورژن MiniMax M2.7 بڑھ کر 83.1% تک پہنچ گیا اور Claude 3.7 Sonnet سے آگے نکل گیا۔
  • 30 حقیقی بگ فکسنگ ٹیسٹس میں M2.5 نے پہلی ہی کوشش میں 28 بگ کامیابی سے حل کیے۔

4. لیٹنسی اور تھرو پٹ (TTFT بمقابلہ TPS)

+-------------------------------------------------------------------------------------------------------------------+
|                                 MINIMAX M2.5 کی انفرینس لیٹنسی اور رفتار کے نتائج                                 |
+-------------------------------------------------------------------------------------------------------------------+
| فراہم کنندہ / انفراسٹرکچر     | درستگی     | پہلے ٹوکن کا وقت (500 پرامپٹ)| پہلے ٹوکن کا وقت (64k سیاق)| رفتار (TPS)         |
+--------------------------------+------------+------------------------------+----------------------------+---------------------+
| MiniMax Official Cloud API     | نیٹو FP8   | 240 ms                       | 820 ms                     | 85 tokens/sec       |
| DeepInfra Enterprise API       | FP8 vLLM   | 195 ms                       | 740 ms                     | 92 tokens/sec       |
| OpenRouter (Free Tier Endpoint)| Quant FP8  | 420 ms                       | 1,650 ms                   | 64 tokens/sec       |
| SambaCloud (SN40L RDU Tier)    | نیٹو RDU   | 180 ms                       | 610 ms                     | 110 tokens/sec      |
| لوکل سرور 4x H100 SXM          | FP8 vLLM   | 160 ms                       | 580 ms                     | 98 tokens/sec       |
| ورک اسٹیشن DGX Spark           | NVFP4      | 310 ms                       | 1,120 ms                   | 26 tokens/sec       |
+--------------------------------+------------+------------------------------+----------------------------+---------------------+

5. Python میں ٹول کالنگ کی مثال

import os
import json
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("MINIMAX_API_KEY"),
    base_url="https://api.minimax.chat/v1"
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "run_test_suite",
            "description": "علیحدہ سینڈ باکس میں ٹیسٹ چلائیں",
            "parameters": {
                "type": "object",
                "properties": {
                    "framework": {"type": "string", "enum": ["pytest", "cargo", "jest"]},
                    "test_target": {"type": "string", "description": "ٹیسٹ کا راستہ"}
                },
                "required": ["framework", "test_target"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="minimax-m2.5",
    messages=[
        {"role": "system", "content": "آپ ایک سینئر سافٹ ویئر انجینئر ہیں۔"},
        {"role": "user", "content": "auth/oauth.rs کے لیے ٹیسٹ چلائیں۔"}
    ],
    tools=tools,
    tool_choice="auto"
)

6. 2026 میں MiniMax M2.5 مفت کیسے حاصل کریں

+-------------------------------------------------------------------------------------------------------------+
|                                    MINIMAX M2.5 کے لیے مفت رسائی کے چینلز                                   |
+-------------------------------------------------------------------------------------------------------------+
| پلیٹ فارم / سروس         | مفت کوٹہ / سہولت                   | حدود اور تفصیلات      | بہترین استعمال      |
+--------------------------+------------------------------------+-----------------------+---------------------+
| MiniMax Open Platform    | رجسٹریشن پر $15 کریڈٹ             | 5 RPM, 50,000 TPM     | آفیشل ٹیسٹنگ        |
| OpenRouter Free Tier     | کمیونٹی فری اینڈ پوائنٹ (m2.5)     | 10 درخواستیں فی منٹ   | CLI کوڈنگ ایجنٹس    |
| SambaCloud Developer     | روزانہ 100,000 ٹوکن مفت            | 2 RPS، تیز رفتار RDU  | کم لیٹنسی ٹیسٹ      |
| Kilo Code Developer Free | روزانہ 50 مفت پرامپٹس              | IDE ایکسٹینشن         | روزمرہ کوڈنگ        |
| Hugging Face Spaces      | پبلک ویب ڈیمو                      | ویب قطار سسٹم         | فوری ٹیسٹ           |
+--------------------------+------------------------------------+-----------------------+---------------------+

OpenClaw اور Aider میں سیٹ اپ

# OpenRouter Free کو OpenClaw میں چلائیں
export OPENROUTER_API_KEY="sk-or-v1-xxxxxxxxxxxx"
openclaw config set model "openrouter/minimax/minimax-m2.5:free"
openclaw gateway start

# Aider CLI میں براہ راست MiniMax
export OPENAI_API_KEY="آپکی-api-کی"
export OPENAI_API_BASE="https://api.minimax.chat/v1"
aider --model openai/minimax-m2.5 --no-stream --auto-commits

7. لاگت کا موازنہ: کمرشل بمقابلہ مفت ماڈل

+-------------------------------------------------------------------------------------------------------------+
|                                    فی 10 لاکھ ٹوکنز قیمت کا موازنہ (2026)                                   |
+-------------------------------------------------------------------------------------------------------------+
| ماڈل                       | ان پٹ قیمت / 1M     | کیش ان پٹ قیمت      | آؤٹ پٹ قیمت / 1M    | SWE کام فی $100     |
+----------------------------+---------------------+---------------------+---------------------+---------------------+
| MiniMax M2.5               | $0.15               | $0.03               | $0.60               | ~145 کام            |
| MiniMax M2.7               | $0.20               | $0.04               | $0.80               | ~120 کام            |
| DeepSeek V4                | $0.14               | $0.028              | $0.55               | ~150 کام            |
| GLM-5                      | $0.22               | $0.05               | $0.85               | ~110 کام            |
| Claude 3.7 Sonnet          | $3.00               | $0.30               | $15.00              | ~8 کام              |
| Claude Opus 4.6            | $15.00              | $1.50               | $75.00              | ~1.5 کام            |
| OpenAI GPT-5-Codex         | $5.00               | $1.25               | $20.00              | ~5 کام              |
+----------------------------+---------------------+---------------------+---------------------+---------------------+

ہفتے میں 500 ری فیکٹرنگ ٹاسک چلانے والی ڈیولپمنٹ ٹیم Claude 3.7 Sonnet کی جگہ MiniMax M2.5 کا انتخاب کر کے 94.5% تک لاگت بچا سکتی ہے۔


8. تکنیکی حدود اور سفارشات

  1. خالص سائنسی استدلال: GPQA Diamond میں اس کا اسکور 68.5% ہے، جو DeepSeek V4 (78.9%) سے قدرے کم ہے۔
  2. اضافی کوڈ تبدیل کرنے کا رجحان: 4.2% معاملات میں یہ پرانے کوڈ اسٹائل کو غیر ضروری طور پر جدید بنانے کی کوشش کرتا ہے، اس لیے سسٹم پرامپٹ میں واضح ہدایات دینا ضروری ہے۔
  3. فری ٹیر پر رش: رش کے اوقات میں OpenRouter Free پر تاخیر ہو سکتی ہے۔

9. نتیجہ

MiniMax M2.5 اپنی شاندار کوڈنگ صلاحیت (80.2% SWE-bench)، 85 سے زائد ٹوکن فی سیکنڈ کی رفتار اور مفت دستیابی کے ساتھ 2026 کے بہترین ماڈلز میں شامل ہے۔

  • انفرادی ڈیولپرز: OpenClaw یا Aider میں روزمرہ کے کام کے لیے OpenRouter Free کا استعمال کریں۔
  • کارپوریٹ ٹیمیں: اپنے بنیادی روٹنگ گیٹ وے میں MiniMax M2.5 کو شامل کر کے 85% عام کام کم سے کم لاگت میں مکمل کریں۔
→ تمام مضامین
0 / 4