Local AI & Hardware

Mac Studio-তে DeepSeek Coder চালান: VRAM, Metal ও TPS গাইড

দ্রুত উত্তর: Apple Silicon-এ সেরা লোকাল কোডিং LLM চালানোর জন্য Mac Studio (M2/M3/M4 Max বা Ultra) এবং Qwen 2.5 Coder 32B অথবা DeepSeek Coder V2.5-এর সমন্বয় সবচেয়ে কার্যকর। Metal এক্সিলারেশন ও Q4_K_M কোয়ান্টাইজেশনে MLX বা llama.cpp ব্যবহার করলে Max চিপে 32–42 tps এবং Ultra-তে 65–78 tps গতি পাওয়া যায়।


1. ভূমিকা: ২০২৬ সালে Apple Silicon-এ লোকাল কোডিং বিপ্লব

পেশাদার ডেভেলপারদের জন্য সম্পূর্ণ ক্লাউড API-এর ওপর নির্ভর করা অনেক সমস্যার সৃষ্টি করে: রেট লিমিট, অপ্রত্যাশিত লেটেন্সি, প্রতি মাসে বিপুল খরচ এবং গোপনীয় কোড ক্লাউডে পাঠানোর নিরাপত্তা ঝুঁকি।

Apple Silicon-এর ইউনিফায়েড মেমরি আর্কিটেকচার (UMA) এবং Mac Studio-এর সহায়তায় Qwen 2.5 Coder 32B Instruct এবং DeepSeek Coder V2.5 MoE-এর মতো সেরা মডেলগুলো সম্পূর্ণ স্থানীয়ভাবে VRAM-এ চালানো সম্ভব।


2. হার্ডওয়্যার তুলনা: Mac Studio বনাম ডেডিকেটেড GPU

সাধারণ পিসির গ্রাফিক্স কার্ডে (যেমন RTX 4090) VRAM মাত্র 24GB থাকে, যেখানে Mac Studio-তে 32GB থেকে 192GB পর্যন্ত হাই-স্পিড শেয়ার্ড মেমরি পাওয়া যায়। ফলে PCIe বাসের ডেটা স্থানান্তরের কোনো জটিলতা থাকে না।

# macOS-এ Metal GPU-এর মেমরি সীমা বৃদ্ধি (64GB ডিভাইসের জন্য 56GB বরাদ্দ)
sudo sysctl -w iogpu.wired_mem_limit=57344

# 128GB ডিভাইসের জন্য 116GB বরাদ্দ
sudo sysctl -w iogpu.wired_mem_limit=118784

3. কোডিং মডেল নির্বাচন

+------------------------------------+--------------------------------+------------------------------+
| বৈশিষ্ট্য                           | Qwen 2.5 Coder 32B Instruct    | DeepSeek Coder V2.5 MoE      |
+------------------------------------+--------------------------------+------------------------------+
| মোট প্যারামিটার                    | ৩২.৫ বিলিয়ন (32.5B)           | ২৩৬ বিলিয়ন (236B)           |
| সক্রিয় প্যারামিটার                | ৩২.৫ বিলিয়ন (32.5B)           | ২১ বিলিয়ন (21B)              |
| SWE-bench Verified সমাধান হার      | 43.6%                          | 41.8%                        |
| লাইভ কোডবেঞ্চ v4                   | 51.2%                          | 49.6%                        |
| প্রস্তাবিত কোয়ান্টাইজেশন          | Q4_K_M (19.8 GB) / Q8_0 (34 GB)| IQ3_M (82 GB) / Q4_K_M (96GB)|
| আদর্শ Mac Studio কনফিগারেশন        | 32GB বা 64GB M2/M3/M4 Max      | 128GB বা 192GB M2/M4 Ultra   |
+------------------------------------+--------------------------------+------------------------------+

4. বেঞ্চমার্ক ও ইনস্টলেশন

4-বিট KV ক্যাশ ব্যবহারের মাধ্যমে ৩২k কনটেক্সটে মেমরি ৮.৫৮ জিবি থেকে কমে মাত্র ২.১৫ জিবি হয়ে যায়।

# llama.cpp Metal বিল্ড ও রান
git clone https://github.com/ggerganov/llama.cpp.git && cd llama.cpp
cmake -B build -DGGML_METAL=ON -DGGML_METAL_EMBED_LIBRARY=ON
cmake --build build --config Release -j$(sysctl -n hw.ncpu)

./build/bin/llama-server \
  --model ~/models/qwen2.5-coder-32b-instruct-q4_k_m.gguf \
  --host 127.0.0.1 --port 8080 \
  --n-gpu-layers 99 --ctx-size 32768 \
  --flash-attn --cache-type-k q4_0 --cache-type-v q4_0

VS Code-এ Cline বা Roo Code এক্সটেনশন যুক্ত করুন http://127.0.0.1:8080/v1 ঠিকানায়। মাসে $425 ক্লাউড খরচ বাঁচিয়ে Mac Studio মাত্র ৫.২ মাসে লাভজনক হয়ে ওঠে।

← সব নিবন্ধ
0 / 4