فوری جواب: 2026 میں مقامی اوپن سورس LLM کا انتخاب آپ کی یونیفائیڈ VRAM پر منحصر ہے: 16GB Mac پر Qwen 2.5 Coder 7B / 14B Q4_K_M (45–65 tps) بہترین ہیں۔ 32GB–64GB Mac/RTX پر Qwen 2.5 Coder 32B Q4_K_M اور Llama 3.3 70B IQ3_XXS اعلیٰ درجے کی کوڈنگ اور منطقی صلاحیت فراہم کرتے ہیں۔ 128GB یونیفائیڈ میموری کے ساتھ DeepSeek R1 / V3 اور Llama 3.3 70B Q8 بغیر کسی کلاؤڈ فیس کے چلائے جا سکتے ہیں۔
1. تعارف: 2026 میں اوپن ویٹ ماڈلز کا مقامی انقلاب
2026 میں، اپنے ہارڈویئر پر اعلیٰ درجے کے لارج لینگویج ماڈلز (LLMs) کو چلانا محض چند شوقین ڈویلپرز تک محدود نہیں رہا بلکہ یہ کارپوریٹ اداروں کے لیے ایک لازمی حکمت عملی بن چکا ہے۔ سافٹ ویئر انجینئرز، مالیاتی ماہرین اور ڈیٹا پرائیویسی کے خواہاں ادارے تجارتی کلاؤڈ APIs (OpenAI, Anthropic, Google) سے خود میزبان اوپن ویٹ ماڈلز کی طرف منتقل ہو رہے ہیں۔
اس منتقلی کی بنیادی وجوہات درج ذیل ہیں:
- ڈیٹا کی خودمختاری اور ضوابط کی پابندی: سخت قوانین (GDPR, HIPAA, SOC 2) اندرونی کوڈ بیس اور حساس کسٹمر ڈیٹا کو تیسرے فریق کے سرورز پر بھیجنے کی سختی سے ممانعت کرتے ہیں۔
- Apple Silicon کی یونیفائیڈ میموری آرکیٹیکچر (UMA): روایتی سسٹمز میں تیز رفتار VRAM محدود کارڈز تک محدود ہوتی ہے (صارفین کے لیے RTX 4090 / 5090 پر زیادہ سے زیادہ 24GB)، جبکہ Apple M-سیریز چپس (M3/M4 Pro, Max اور Ultra) میں 128GB سے 192GB تک کی مشترکہ LPDDR5X میموری براہ راست گرافکس کورز کو 400 سے 800+ GB/s کی رفتار سے دستیاب ہوتی ہے۔
- کوانٹائزیشن میں نمایاں پیش رفت (GGUF, EXL2, AWQ, MLX): جدید الگورتھمز (k-quants اور
imatrixIQ2/IQ3/IQ4) کے ذریعے 70 ارب پیرامیٹرز کے ماڈلز کو 38GB سے کم ریم میں بغیر کسی نمایاں کارکردگی کے نقصان (<0.15 پوائنٹس) کے چلایا جا سکتا ہے۔
اس تکنیکی گائیڈ میں Apple Silicon (16GB سے 128GB) اور NVIDIA RTX سسٹمز پر نمایاں ماڈلز کی رفتار، VRAM کے تخمینے اور SWE-bench نتائج کا موازنہ کیا گیا ہے۔
2. ہارڈویئر کا موازنہ: Apple یونیفائیڈ میموری بمقابلہ NVIDIA RTX
ماڈل کے پیرامیٹرز اور کوانٹائزیشن کی سطح کا انتخاب کرنے کے لیے میموری کے ڈھانچے کو سمجھنا ضروری ہے۔
+-----------------------------------------------------------------------------------------+
| ہارڈویئر میموری کا تقابلی جائزہ |
+---------------------------------------------------+-------------------------------------+
| Apple Silicon یونیفائیڈ میموری (UMA) | روایتی ڈیسک ٹاپ (x86_64 + NVIDIA) |
+---------------------------------------------------+-------------------------------------+
| CPU اور GPU ایک ہی LPDDR5X میموری استعمال کرتے ہیں| سسٹم ریم (DDR5) اور VRAM الگ ہوتی ہیں|
| PCIe بس پر ڈیٹا ٹرانسفر کا کوئی تعطل نہیں ہوتا | PCIe بس کے ذریعے ڈیٹا منتقلی |
| میموری کی گنجائش: 16GB سے 192GB (M4 Ultra) | VRAM حد: 16GB–24GB (ایک RTX کارڈ) |
| بینڈوڈتھ: 150 GB/s (Base) سے 800+ GB/s (Ultra) | بینڈوڈتھ: 1,008 GB/s (RTX 4090) |
| Metal Performance Shaders اور MLX ایکسلریشن | CUDA Cores، Tensor Cores اور FlashAttn|
| کم لاگت میں زیادہ سے زیادہ سیاق و سباق کی گنجائش | سنگل فلو میں تیز ترین ٹوکن اسپیڈ |
+---------------------------------------------------+-------------------------------------+
مقامی LLMs کے لیے VRAM کا حسابی فارمولا
کسی کریش یا ڈسک سویپنگ کے بغیر ماڈل چلانے کے لیے VRAM کی ضرورت اس فارمولے سے معلوم کی جا سکتی ہے:
$$\text{کل VRAM (GB)} = \left( \frac{\text{پیرامیٹرز (ارب)} \times \text{بٹس فی ویٹ}}{8} \times 1.15 \right) + \text{KV کیش (GB)} + \text{آپریٹنگ سسٹم اوورہیڈ (GB)}$$
اہم اجزاء:
- پیرامیٹرز (ارب): ماڈل کا حجم (مثلاً 7B, 14B, 32B, 70B)۔
- بٹس فی ویٹ: FP16 کے لیے 16، Q8_0 کے لیے 8، Q4_K_M کے لیے 4.5، IQ3_M کے لیے 3.2۔
- 1.15 ضرب کنندہ: حساب کتاب کے لیے 15 فیصد اضافی حفاظتی مارجن۔
- KV کیش کا حجم: $\text{KV کیش} = 2 \times \text{لیئرز} \times \text{ہیڈز} \times \text{ہیڈ ڈائمینشن} \times \text{سیاق کی لمبائی} \times \text{بائٹس فی ایلیمنٹ}$۔ 70B ماڈل میں 8k سیاق کے لیے FP16 کیش تقریباً 2.5GB لیتا ہے؛ 4-بٹ کیش اسے 0.7GB تک کم کر دیتا ہے۔
- آپریٹنگ سسٹم اوورہیڈ: macOS عام طور پر 4GB سے 6GB میموری ریزرو رکھتا ہے۔ ہیڈ لیس لینکس کو صرف 1.2GB کی ضرورت ہوتی ہے۔
3. جامع بینچ مارک تقابل: 2026 کے نمایاں ماڈلز
ہم نے کوڈنگ، منطق، ٹول کالنگ اور ٹوکن جنریشن کی بنیاد پر ماڈلز کی جانچ کی ہے۔
ٹیسٹ ہارڈویئر:
- ریگ A (Apple Silicon Ultra): Mac Studio M3/M4 Ultra، 128GB میموری، 800 GB/s بینڈوڈتھ۔
- ریگ B (Apple Silicon Max): MacBook Pro M4 Max، 48GB میموری، 410 GB/s بینڈوڈتھ۔
- ریگ C (Apple Silicon Pro): MacBook Pro M4 Pro، 24GB میموری، 273 GB/s بینڈوڈتھ۔
- ریگ D (Dual NVIDIA RTX): 2x NVIDIA GeForce RTX 4090 24GB (کل 48GB VRAM)، AMD Ryzen 9 9950X۔
| ماڈل | فن تعمیر اور پیرامیٹرز | کوانٹائزیشن فارمیٹ | کم از کم VRAM | SWE-bench Verified | LiveCodeBench v4 | MMLU-Pro | رفتار (Mac Studio 128GB) | رفتار (Dual RTX 4090) |
|---|---|---|---|---|---|---|---|---|
| Qwen 2.5 Coder 32B | ڈینس / 32.5B | Q4_K_M (19.8 GB) | 24 GB UMA / VRAM | 43.6% | 51.2% | 68.4% | 38.2 tps | 76.4 tps |
| Llama 3.3 70B Instruct | ڈینس / 70.6B | Q4_K_M (42.5 GB) | 48 GB UMA / Dual GPU | 41.2% | 48.7% | 73.1% | 18.5 tps | 42.1 tps |
| DeepSeek R1 Distill 32B | ڈینس منطقی / 32B | Q4_K_M (20.1 GB) | 24 GB UMA / VRAM | 42.8% | 49.5% | 71.8% | 37.8 tps | 74.2 tps |
| DeepSeek Coder V2.5 | MoE (21B فعال / 236B) | IQ3_XXS (88.4 GB) | 96 GB–128 GB UMA | 39.4% | 46.8% | 66.2% | 14.2 tps | PCIe بس رکاوٹ |
| Qwen 2.5 Coder 14B | ڈینس / 14.7B | Q4_K_M (9.2 GB) | 16 GB UMA / VRAM | 33.8% | 40.1% | 58.6% | 62.4 tps | 112.5 tps |
| Qwen 2.5 Coder 7B | ڈینس / 7.6B | Q8_0 (8.1 GB) | 12 GB UMA / VRAM | 27.4% | 34.2% | 51.3% | 94.1 tps | 168.0 tps |
| GLM-4 9B Chat | ڈینس / 9.2B | Q4_K_M (5.8 GB) | 10 GB UMA / VRAM | 26.8% | 32.7% | 54.2% | 86.5 tps | 148.2 tps |
| Llama 3.2 3B | ڈینس / 3.2B | FP16 (6.4 GB) | 8 GB UMA / VRAM | 16.2% | 21.4% | 39.8% | 145.0 tps | 240.0 tps |
4. ہارڈویئر کے مطابق ماڈل کے انتخاب کی گائیڈ
درجہ 1: 16GB یونیفائیڈ میموری (MacBook Air اور بنیادی Pro)
- ماڈل کے لیے دستیاب VRAM: 11GB–12GB۔
- بہترین انتخاب: Qwen 2.5 Coder 7B (Q8_0 یا Q4_K_M) یا Qwen 2.5 Coder 14B (Q3_K_M / Q4_K_S)۔
- تیز رفتار معاون: گٹ میسجز اور چھوٹے کاموں کے لیے Llama 3.2 3B (Q8_0)۔
- رفتار: 55–90 ٹوکن فی سیکنڈ۔ کوڈ آٹو کمپلیٹ کے لیے انتہائی موزوں۔
درجہ 2: 24GB سے 36GB یونیفائیڈ میموری (M3/M4 Pro اور بنیادی Max، سنگل RTX 3090/4090)
- ماڈل کے لیے دستیاب VRAM: 18GB–28GB۔
- بہترین انتخاب: Qwen 2.5 Coder 32B Instruct (Q4_K_M) — مقامی کوڈنگ کا بہترین معیار۔
- منطقی ماڈل: پیچیدہ حساب اور ڈیزائن کے لیے DeepSeek R1 Distill Qwen 32B (Q4_K_M)۔
- رفتار: Mac پر 28–38 tps؛ RTX 4090 پر 70–80 tps۔ متعدد فائلوں کے مسائل حل کرنے کے قابل۔
درجہ 3: 48GB سے 64GB یونیفائیڈ میموری (M3/M4 Max 48GB/64GB، Dual RTX 3090/4090)
- ماڈل کے لیے دستیاب VRAM: 38GB–52GB۔
- بہترین انتخاب: Llama 3.3 70B Instruct (Q4_K_M) اور Qwen 2.5 Coder 32B (Q8_0)۔
- بڑی دستاویزات کے لیے: 128k سیاق کی حامل Command R+ (Q3_K_S)۔
- رفتار: M4 Max پر 16–22 tps؛ دوہری RTX 4090 پر 40–48 tps۔ تجارتی ماڈلز کے برابر سمجھ بوجھ۔
درجہ 4: 96GB سے 128GB+ یونیفائیڈ میموری (Mac Studio Ultra، Mac Pro)
- ماڈل کے لیے دستیاب VRAM: 80GB–110GB۔
- بہترین انتخاب: Llama 3.3 70B Instruct (Q8_0)، DeepSeek Coder V2.5 MoE (IQ3_M / Q4_K_M) اور DeepSeek R1 671B (IQ1_S / IQ2_XXS)۔
- رفتار: بھاری MoE سسٹمز پر 14–20 tps۔ میموری ختم ہوئے بغیر 64k سے زائد سیاق کو سنبھالنے کی صلاحیت۔
5. اہم ماڈلز کا تفصیلی تجزیہ
5.1 Qwen 2.5 Coder 32B: مقامی کوڈنگ کا بے تاج بادشاہ
علی بابا کا یہ ماڈل 5.5 ٹریلین ٹوکنز اور 92 زبانوں پر تربیت یافتہ ہے۔
- آرکیٹیکچرل خوبی: 1M پر ٹیون شدہ RoPE فریکوئنسی طویل سیاق و سباق میں معلومات کو درست طریقے سے تلاش کرتی ہے۔
- SWE-bench Verified: 43.6% (ابتدائی GPT-4 اور Claude 3 Sonnet سے بہتر)۔
- ٹول کالنگ: سخت JSON اسٹرکچر پر عمل درآمد، جو Cline، Roo Code اور OpenCode میں بہترین نتائج دیتا ہے۔
5.2 Llama 3.3 70B Instruct: میٹا کا فلیگ شپ اوپن ماڈل
یہ ماڈل پچھلے 405B ماڈل کی صلاحیتیں انتہائی کم ہارڈویئر ضروریات کے ساتھ فراہم کرتا ہے۔
- آرکیٹیکچرل خوبی: 8 ہیڈز والا Grouped-Query Attention (GQA) کیش میموری میں 75 فیصد بچت کرتا ہے۔
- MMLU-Pro: 73.1%، انجینئرنگ اور منطقی مباحث میں Claude 3.5 Sonnet کے ہم پلہ۔
- کوانٹائزیشن پر استحکام: Q4_K_M پر اصل FP16 معیار کا 99.1% برقرار رکھتا ہے۔
5.3 DeepSeek R1 Distill Qwen 32B: ڈیسک ٹاپ پر منطقی سوچ
ری انفورسمنٹ لرننگ کے تحت حاصل کردہ سوچ کے مراحل () اس ماڈل میں محفوظ ہیں۔
- خوبی: پیچیدہ الگورتھمز اور ملٹی تھریڈڈ مسائل کی تصدیق میں ماہر۔
- ضرورت: سوچنے کے عمل میں زیادہ ٹوکن خرچ ہوتے ہیں، اس لیے کم از کم 30 tps اسپیڈ ہونی چاہیے۔
6. انفیرنس انجن کا موازنہ: Ollama، llama.cpp، vLLM اور MLX
مناسب انجن کا انتخاب آپ کے سسٹم سے بہترین پیداواری صلاحیت حاصل کرنے کے لیے ضروری ہے۔
+-----------------------------------------------------------------------------------------+
| انفیرنس انجن تقابل |
+-------------------+-------------------+------------------------+------------------------+
| انجن | پلیٹ فارم | خاصیت | بہترین استعمال |
+-------------------+-------------------+------------------------+------------------------+
| **Ollama** | macOS, Linux, Win | آسان CLI اور REST API | ڈویلپمنٹ ماحول |
| **llama.cpp** | تمام پلیٹ فارمز | خالص C++ کارکردگی | اعلیٰ کوانٹائزیشن |
| **vLLM** | Linux / NVIDIA | PagedAttention رفتار | پروڈکشن سرورز |
| **MLX / LM-Studio**| Apple Silicon Mac | Metal پر براہ راست عمل | گرافیکل UI اور Mac UMA |
+-------------------+-------------------+------------------------+------------------------+
عملی طریقہ کار: Ollama کے ذریعے Qwen 2.5 Coder 32B چلانا
32k سیاق اور 4-بٹ KV کیش کے ساتھ ماڈل فائل بنانا:
# 1. macOS یا Linux پر Ollama انسٹال کریں
curl -fsSL https://ollama.com/install.sh | sh
# 2. Qwen 2.5 Coder 32B ڈاؤن لوڈ کریں
ollama run qwen2.5-coder:32b-instruct-q4_K_M
# 3. سیاق و سباق کے لیے Modelfile بنائیں
cat << 'EOF' > Modelfile-Coder
FROM qwen2.5-coder:32b-instruct-q4_K_M
PARAMETER num_ctx 32768
PARAMETER num_predict 4096
PARAMETER stop "<|im_end|>"
PARAMETER temperature 0.2
PARAMETER top_p 0.95
EOF
ollama create local-coder-32k -f Modelfile-Coder
ollama serve
Apple Metal کے ذریعے تیز رفتار عمل درآمد: Apple MLX
Apple Silicon پر زیادہ سے زیادہ رفتار حاصل کرنے کا طریقہ:
# MLX-LM لائبریری انسٹال کریں
pip install mlx-lm
# Qwen 2.5 Coder 32B 4-bit کو مقامی طور پر چلائیں
python -m mlx_lm.generate --model mlx-community/Qwen2.5-Coder-32B-Instruct-4bit --prompt "Write a high-concurrency Rust actor pattern using Tokio." --max-tokens 2048 --temp 0.2
7. لاگت اور منافع کا تخمینہ: مقامی ہارڈویئر بمقابلہ کلاؤڈ APIs
کیا $3,999 کا Mac Studio یا $3,500 کا ڈیسک ٹاپ خریدنا تجارتی APIs پر مسلسل ادائیگی سے بہتر ہے؟
+-----------------------------------------------------------------------------------------+
| 24 ماہ میں مجموعی اخراجات |
| |
| $15,000 | کلاؤڈ APIs (بڑے ایجنٹس) |
| | .................../ |
| $10,000 | ............./ |
| | ............./ |
| $5,000 | ............/ مقامی Mac Studio M4 Ultra ($3,999) |
| | ----/------------------------------------------------------------------------ |
| $0 +------------------------------------------------------------------------------ |
| مہینہ 0 مہینہ 6 مہینہ 12 مہینہ 18 مہینہ 24 |
+-----------------------------------------------------------------------------------------+
| ٹیم کا حجم | ماہانہ ٹوکن کھپت | کلاؤڈ API اخراجات (Sonnet/o3) | Mac Studio 128GB کی لاگت | سرمایہ واپسی کی مدت (ROI) |
|---|---|---|---|---|
| انفرادی انجینئر | 15 ملین ٹوکن/ماہ | $85 / ماہ | $3,999 خریداری + $8/ماہ بجلی | 48 ماہ |
| چھوٹی ٹیم (5 افراد) | 120 ملین ٹوکن/ماہ | $680 / ماہ | $3,999 خریداری + $18/ماہ بجلی | 5.8 ماہ |
| آئی ٹی ڈپارٹمنٹ (20 افراد) | 850 ملین ٹوکن/ماہ | $4,850 / ماہ | دو Mac Studio کلستر ($7,998) | 1.7 ماہ |
معاشی تجزیہ: کبھی کبھار استعمال کے لیے کلاؤڈ APIs سستے ہیں۔ لیکن خودکار ایجنٹس (Cline, Roo Code, Aider) پر مسلسل کام کرنے والی ٹیموں کے لیے مقامی ہارڈویئر کے اخراجات 6 ماہ کے اندر پورے ہو جاتے ہیں اور ڈیٹا مکمل طور پر محفوظ رہتا ہے۔
8. انٹرپرائز نفاذ کے لیے مفید مشورے
- 16GB سسٹمز کے لیے: Qwen 2.5 Coder 14B Q4_K_M یا 7B Q8_0 پر انحصار کریں۔ 16GB پر 32B ماڈل ہرگز نہ چلائیں ورنہ سست روی پیدا ہوگی۔
- 32GB–48GB سسٹمز کے لیے: روزمرہ کوڈنگ کے لیے Qwen 2.5 Coder 32B Instruct (Q4_K_M) اور آرکیٹیکچر کے لیے Llama 3.3 70B (IQ3_XXS) استعمال کریں۔
- KV کیش کا بہتر انتظام: طویل سیاق و سباق میں 3GB سے 8GB میموری بچانے کے لیے 4-بٹ کیشنگ (
q4_0) فعال کریں۔ - ایجنٹس سے ربط: مکمل طور پر آف لائن ماحول میں کام کے لیے اپنے مقامی Ollama اینڈپوائنٹ کو VS Code سے منسلک کریں۔
9. عام طور پر پوچھے جانے والے سوالات (FAQ)
کیا Apple Silicon M4 Pro پر Llama 3.3 70B ماڈل چل سکتا ہے؟
24GB یا 36GB M4 Pro پر 70B ماڈل مناسب رفتار کے ساتھ نہیں چل سکتا۔ ڈسک سویپنگ کی وجہ سے رفتار 1 tps سے کم ہو جائے گی۔ Q4_K_M فارمیٹ میں 18–22 tps رفتار حاصل کرنے کے لیے کم از کم 48GB سے 64GB میموری درکار ہے۔
70B سے بڑے ماڈلز کے لیے Apple یونیفائیڈ میموری NVIDIA سے بہتر کیوں ہے؟
میموری کی گنجائش اور کم قیمت کی وجہ سے۔ 70B ماڈل کو مکمل چلانے کے لیے 60GB سے 120GB VRAM چاہیے ہوتی ہے، جس کے لیے PC میں کئی مہنگے کارڈز (A100/H100) درکار ہوتے ہیں جن کی قیمت $6,000 سے $30,000 سے زائد ہوتی ہے۔ Mac Studio یہ کام $4,000 سے کم میں بغیر کسی شور اور حرارت کے کر دیتا ہے۔
مقامی کوڈنگ کے لیے سب سے بہترین ماڈل کون سا ہے؟
Qwen 2.5 Coder 32B Instruct اس وقت بہترین انتخاب ہے۔ یہ SWE-bench Verified پر 43.6% کارکردگی دکھاتا ہے، ٹول کالنگ کو درست سنبھالتا ہے اور Q4_K_M کوانٹائزیشن میں 24GB میموری کے اندر باآسانی کام کرتا ہے۔