Local AI & Hardware

Mac Studio پر DeepSeek Coder چلائیں: VRAM، Metal اور TPS گائیڈ

فوری جواب: ایپل سلیکون پر لوکل کوڈنگ LLM چلانے کے لیے Mac Studio (M2/M3/M4 Max یا Ultra) اور Qwen 2.5 Coder 32B یا DeepSeek Coder V2.5 کا امتزاج بہترین ہے۔ Metal ایکسلریشن اور Q4_K_M کوانٹائزیشن کے ساتھ MLX یا llama.cpp استعمال کرنے پر Max پر 32–42 tps اور Ultra پر 65–78 tps رفتار ملتی ہے۔


1. تعارف: ایپل سلیکون پر لوکل کوڈنگ کا انقلاب

پیشہ ور سافٹ ویئر انجینئرز کے لیے کمرشل کلاؤڈ API جیسے Claude 3.7 Sonnet یا OpenAI o3 پر انحصار کرنا ریٹ لمیٹ، انٹرنیٹ تاخیر، اور کوڈ کے اخراج کے سیکیورٹی خدشات پیدا کرتا ہے۔

Mac Studio کے Unified Memory Architecture (UMA) کی مدد سے Qwen 2.5 Coder 32B اور DeepSeek Coder V2.5 MoE کو مکمل طور پر لوکل VRAM میں بغیر کسی ماہانہ فیس کے چلایا جا سکتا ہے۔


2. ہارڈ ویئر موازنہ: Mac Studio بمقابلہ ڈسکریٹ GPU

عام پی سی کے گرافکس کارڈ میں صرف 24GB VRAM ہوتی ہے، جبکہ Mac Studio میں 32GB سے 192GB تک تیز رفتار مشترکہ میموری دستیاب ہوتی ہے جو بغیر PCIe رکاوٹ کے کام کرتی ہے۔

# macOS میں Metal GPU میموری کی حد بڑھائیں (64GB کے لیے 56GB مختص کریں)
sudo sysctl -w iogpu.wired_mem_limit=57344

# 128GB کے لیے 116GB مختص کریں
sudo sysctl -w iogpu.wired_mem_limit=118784

3. ماڈل موازنہ اور سیٹ اپ

+------------------------------------+--------------------------------+------------------------------+
| خصوصیت                             | Qwen 2.5 Coder 32B Instruct    | DeepSeek Coder V2.5 MoE      |
+------------------------------------+--------------------------------+------------------------------+
| کل پیرامیٹرز                        | 32.5 ارب (32.5B)               | 236 ارب (236B)               |
| فعال پیرامیٹرز                     | 32.5 ارب (32.5B)               | 21 ارب (21B)                 |
| SWE-bench Verified اسکور           | 43.6%                          | 41.8%                        |
| LiveCodeBench v4 Pass@1            | 51.2%                          | 49.6%                        |
| تجویز کردہ کوانٹائزیشن             | Q4_K_M (19.8 GB) / Q8_0 (34 GB)| IQ3_M (82 GB) / Q4_K_M (96GB)|
| تجویز کردہ Mac Studio              | 32GB یا 64GB Max               | 128GB یا 192GB Ultra         |
+------------------------------------+--------------------------------+------------------------------+
# Metal کے ساتھ llama.cpp چلائیں
git clone https://github.com/ggerganov/llama.cpp.git && cd llama.cpp
cmake -B build -DGGML_METAL=ON -DGGML_METAL_EMBED_LIBRARY=ON
cmake --build build --config Release -j$(sysctl -n hw.ncpu)

./build/bin/llama-server \
  --model ~/models/qwen2.5-coder-32b-instruct-q4_k_m.gguf \
  --host 127.0.0.1 --port 8080 \
  --n-gpu-layers 99 --ctx-size 32768 \
  --flash-attn --cache-type-k q4_0 --cache-type-v q4_0

VS Code میں Cline یا Roo Code کو http://127.0.0.1:8080/v1 سے جوڑ کر مکمل خود مختار ڈویلپمنٹ حاصل کریں۔

→ تمام مضامین
0 / 4