দ্রুত উত্তর: Apple Silicon-এ সেরা লোকাল কোডিং LLM চালানোর জন্য Mac Studio (M2/M3/M4 Max বা Ultra) এবং Qwen 2.5 Coder 32B অথবা DeepSeek Coder V2.5-এর সমন্বয় সবচেয়ে কার্যকর। Metal এক্সিলারেশন ও Q4_K_M কোয়ান্টাইজেশনে MLX বা llama.cpp ব্যবহার করলে Max চিপে 32–42 tps এবং Ultra-তে 65–78 tps গতি পাওয়া যায়।
1. ভূমিকা: ২০২৬ সালে Apple Silicon-এ লোকাল কোডিং বিপ্লব
পেশাদার ডেভেলপারদের জন্য সম্পূর্ণ ক্লাউড API-এর ওপর নির্ভর করা অনেক সমস্যার সৃষ্টি করে: রেট লিমিট, অপ্রত্যাশিত লেটেন্সি, প্রতি মাসে বিপুল খরচ এবং গোপনীয় কোড ক্লাউডে পাঠানোর নিরাপত্তা ঝুঁকি।
Apple Silicon-এর ইউনিফায়েড মেমরি আর্কিটেকচার (UMA) এবং Mac Studio-এর সহায়তায় Qwen 2.5 Coder 32B Instruct এবং DeepSeek Coder V2.5 MoE-এর মতো সেরা মডেলগুলো সম্পূর্ণ স্থানীয়ভাবে VRAM-এ চালানো সম্ভব।
2. হার্ডওয়্যার তুলনা: Mac Studio বনাম ডেডিকেটেড GPU
সাধারণ পিসির গ্রাফিক্স কার্ডে (যেমন RTX 4090) VRAM মাত্র 24GB থাকে, যেখানে Mac Studio-তে 32GB থেকে 192GB পর্যন্ত হাই-স্পিড শেয়ার্ড মেমরি পাওয়া যায়। ফলে PCIe বাসের ডেটা স্থানান্তরের কোনো জটিলতা থাকে না।
# macOS-এ Metal GPU-এর মেমরি সীমা বৃদ্ধি (64GB ডিভাইসের জন্য 56GB বরাদ্দ)
sudo sysctl -w iogpu.wired_mem_limit=57344
# 128GB ডিভাইসের জন্য 116GB বরাদ্দ
sudo sysctl -w iogpu.wired_mem_limit=118784
3. কোডিং মডেল নির্বাচন
+------------------------------------+--------------------------------+------------------------------+
| বৈশিষ্ট্য | Qwen 2.5 Coder 32B Instruct | DeepSeek Coder V2.5 MoE |
+------------------------------------+--------------------------------+------------------------------+
| মোট প্যারামিটার | ৩২.৫ বিলিয়ন (32.5B) | ২৩৬ বিলিয়ন (236B) |
| সক্রিয় প্যারামিটার | ৩২.৫ বিলিয়ন (32.5B) | ২১ বিলিয়ন (21B) |
| SWE-bench Verified সমাধান হার | 43.6% | 41.8% |
| লাইভ কোডবেঞ্চ v4 | 51.2% | 49.6% |
| প্রস্তাবিত কোয়ান্টাইজেশন | Q4_K_M (19.8 GB) / Q8_0 (34 GB)| IQ3_M (82 GB) / Q4_K_M (96GB)|
| আদর্শ Mac Studio কনফিগারেশন | 32GB বা 64GB M2/M3/M4 Max | 128GB বা 192GB M2/M4 Ultra |
+------------------------------------+--------------------------------+------------------------------+
4. বেঞ্চমার্ক ও ইনস্টলেশন
4-বিট KV ক্যাশ ব্যবহারের মাধ্যমে ৩২k কনটেক্সটে মেমরি ৮.৫৮ জিবি থেকে কমে মাত্র ২.১৫ জিবি হয়ে যায়।
# llama.cpp Metal বিল্ড ও রান
git clone https://github.com/ggerganov/llama.cpp.git && cd llama.cpp
cmake -B build -DGGML_METAL=ON -DGGML_METAL_EMBED_LIBRARY=ON
cmake --build build --config Release -j$(sysctl -n hw.ncpu)
./build/bin/llama-server \
--model ~/models/qwen2.5-coder-32b-instruct-q4_k_m.gguf \
--host 127.0.0.1 --port 8080 \
--n-gpu-layers 99 --ctx-size 32768 \
--flash-attn --cache-type-k q4_0 --cache-type-v q4_0
VS Code-এ Cline বা Roo Code এক্সটেনশন যুক্ত করুন http://127.0.0.1:8080/v1 ঠিকানায়। মাসে $425 ক্লাউড খরচ বাঁচিয়ে Mac Studio মাত্র ৫.২ মাসে লাভজনক হয়ে ওঠে।