Local AI & Hardware

สุดยอดโมเดล Open Source LLM สำหรับรันในเครื่อง (2026): คู่มือ Mac VRAM และ RTX

คำตอบด่วน: การเลือกโอเพนซอร์ส LLM รันในเครื่องปี 2026 ขึ้นอยู่กับ Unified VRAM ของคุณ: สำหรับ Mac 16GB แนะนำ Qwen 2.5 Coder 7B / 14B Q4_K_M (45–65 tps) ส่วนเครื่อง 32GB–64GB Mac/RTX รุ่น Qwen 2.5 Coder 32B Q4_K_M และ Llama 3.3 70B IQ3_XXS ให้ประสิทธิภาพการโค้ดและการใช้เหตุผลระดับพรีเมียม และบน 128GB Unified Memory ของ Mac Studio สามารถรัน DeepSeek R1 / V3 และ Llama 3.3 70B Q8 ได้อย่างลื่นไหลโดยไม่ต้องจ่ายค่าคลาวด์


1. บทนำ: การปฏิวัติโมเดล Open-Weight บนเครื่องส่วนตัวปี 2026

ในปี 2026 การรันโมเดลภาษาขนาดใหญ่ (LLMs) ระดับเรือธงบนฮาร์ดแวร์ของตัวเองไม่ได้เป็นเพียงงานอดิเรกของโปรแกรมเมอร์เฉพาะกลุ่มอีกต่อไป แต่กลายเป็นกลยุทธ์สำคัญขององค์กร วิศวกรซอฟต์แวร์ นักวิเคราะห์เชิงปริมาณ และองค์กรที่ให้ความสำคัญกับความปลอดภัยของข้อมูล กำลังย้ายออกจากคลาวด์ API แบบปิด (OpenAI, Anthropic, Google) หันมาใช้งานโมเดลโอเพนซอร์สที่โฮสต์เองในองค์กร

ปัจจัยหลัก 3 ประการที่ขับเคลื่อนการเปลี่ยนแปลงนี้คือ:

  1. อำนาจอธิปไตยของข้อมูลและการปฏิบัติตามกฎหมาย: ข้อกำหนดเข้มงวด (GDPR, HIPAA, SOC 2 Type II) ห้ามส่งซอร์สโค้ดภายในและข้อมูลลูกค้าไปยังเซิร์ฟเวอร์ภายนอก
  2. สถาปัตยกรรมหน่วยความจำรวม Apple Silicon (UMA): ต่างจากพีซีทั่วไปที่ VRAM ถูกจำกัดอยู่บนการ์ดจอ PCIe (สูงสุด 24GB บน RTX 4090 / 5090) ชิป Apple M (M3/M4 Pro, Max และ Ultra) สามารถรวม LPDDR5X แบนด์วิดท์สูง 128GB ถึง 192GB ให้คอร์ GPU เข้าถึงได้โดยตรงด้วยความเร็ว 400 ถึง 800+ GB/s
  3. ความก้าวหน้าด้านการควอนไทเซชัน (GGUF, EXL2, AWQ, MLX): อัลกอริทึมสมัยใหม่ (k-quants และ imatrix IQ2/IQ3/IQ4) ทำให้โมเดลขนาด 70,000 ล้านพารามิเตอร์ทำงานได้ใน RAM ไม่ถึง 38GB โดยสูญเสียความแม่นยำน้อยมาก (<0.15 จุดบน Wikitext-2)

คู่มือนี้จะเปรียบเทียบโมเดลโอเพนซอร์สชั้นนำบน Apple Silicon (16GB ถึง 128GB) และการ์ดจอ NVIDIA RTX พร้อมสูตรคำนวณ VRAM ความเร็วการสร้างโทเค็นจริง และผลทดสอบ SWE-bench และ LiveCodeBench


2. การเปรียบเทียบฮาร์ดแวร์: Apple Unified Memory ปะทะ NVIDIA RTX

การทำความเข้าใจโครงสร้างหน่วยความจำเป็นพื้นฐานสำคัญในการเลือกขนาดโมเดลและรูปแบบการควอนไทเซชันที่เหมาะสม

+-----------------------------------------------------------------------------------------+
|                                 โครงสร้างหน่วยความจำฮาร์ดแวร์                            |
+---------------------------------------------------+-------------------------------------+
| Apple Silicon Unified Memory (UMA)                | พีซีแบบดั้งเดิม (x86_64 + NVIDIA)   |
+---------------------------------------------------+-------------------------------------+
| CPU และ GPU ใช้หน่วยความจำ LPDDR5X ร่วมกัน        | แรมระบบ (DDR5) แยกจากการ์ดจอ (VRAM) |
| ไม่มีปัญหาคอขวดในการส่งข้อมูลผ่านบัส PCIe         | ต้องส่งข้อมูลผ่าน PCIe Bus (32-64GB/s)|
| ขนาดหน่วยความจำ: 16GB ถึง 192GB (M4 Ultra)        | ขีดจำกัด VRAM: 16GB–24GB (การ์ดเดี่ยว)|
| แบนด์วิดท์: 150 GB/s (Base) ถึง 800+ GB/s (Ultra) | แบนด์วิดท์: 1,008 GB/s (RTX 4090)   |
| เร่งความเร็วด้วย Metal Shaders และ MLX             | CUDA Cores, Tensor Cores & FlashAttn|
| รองรับ Context Window สูงสุดต่อเม็ดเงินที่จ่าย    | สร้างโทเค็นเดี่ยวได้เร็วที่สุด (TPS)|
+---------------------------------------------------+-------------------------------------+

สูตรคำนวณ VRAM ทางคณิตศาสตร์สำหรับโมเดล Local LLM

เพื่อคำนวณขนาดหน่วยความจำที่ต้องการโดยไม่เกิดข้อผิดพลาดหน่วยความจำเต็มหรือการ Swap ลงดิสก์:

$$\text{VRAM ทั้งหมด (GB)} = \left( \frac{\text{พารามิเตอร์ (พันล้าน)} \times \text{บิตต่อค่าน้ำหนัก}}{8} \times 1.15 \right) + \text{KV Cache (GB)} + \text{OS Overhead (GB)}$$

คำอธิบายตัวแปร:

  • พารามิเตอร์ (พันล้าน): ขนาดโมเดล (เช่น 7B, 14B, 32B, 70B)
  • บิตต่อค่าน้ำหนัก: 16 สำหรับ FP16, 8 สำหรับ Q8_0, 4.5 สำหรับ Q4_K_M, 3.2 สำหรับ IQ3_M
  • ตัวคูณ 1.15: กันพื้นที่เผื่อความปลอดภัย 15% สำหรับ Activation Tensors
  • ขนาด KV Cache: $\text{KV Cache} = 2 \times \text{จำนวนเลเยอร์} \times \text{จำนวนเฮด} \times \text{มิติของเฮด} \times \text{ความยาวคอนเทกต์} \times \text{ไบต์ต่อองค์ประกอบ}$ สำหรับบริบท 8k บนโมเดล 70B แคชแบบ FP16 จะใช้ 2.5GB แต่ถ้าใช้ 4-bit KV Cache (--cache-type-k q4_0 --cache-type-v q4_0) จะลดเหลือเพียง 0.7GB
  • OS Overhead: macOS สำรองไว้ประมาณ 4GB–6GB สำหรับ WindowServer และการทำงานพื้นหลัง ลินุกซ์แบบ Headless ใช้ประมาณ 1.2GB

3. ตารางเปรียบเทียบมาตรฐานประสิทธิภาพโมเดลปี 2026

เราได้ทดสอบโมเดลชั้นนำในการเขียนโค้ด การคิดเชิงตรรกะ การเรียกใช้ฟังก์ชัน และความเร็วในการประมวลผล

เครื่องทดสอบ:

  • Rig A (Apple Silicon Ultra): Mac Studio M3/M4 Ultra, 128GB Unified Memory, แบนด์วิดท์ 800 GB/s
  • Rig B (Apple Silicon Max): MacBook Pro M4 Max, 48GB Unified Memory, แบนด์วิดท์ 410 GB/s
  • Rig C (Apple Silicon Pro): MacBook Pro M4 Pro, 24GB Unified Memory, แบนด์วิดท์ 273 GB/s
  • Rig D (Dual NVIDIA RTX): 2x NVIDIA GeForce RTX 4090 24GB (รวม 48GB VRAM), AMD Ryzen 9 9950X
ชื่อโมเดล สถาปัตยกรรมและพารามิเตอร์ รูปแบบควอนไทเซชัน VRAM ขั้นต่ำที่ต้องใช้ SWE-bench Verified LiveCodeBench v4 MMLU-Pro ความเร็ว (Mac Studio 128GB) ความเร็ว (Dual RTX 4090)
Qwen 2.5 Coder 32B Dense / 32.5B Q4_K_M (19.8 GB) 24 GB UMA / VRAM 43.6% 51.2% 68.4% 38.2 tps 76.4 tps
Llama 3.3 70B Instruct Dense / 70.6B Q4_K_M (42.5 GB) 48 GB UMA / การ์ดคู่ 41.2% 48.7% 73.1% 18.5 tps 42.1 tps
DeepSeek R1 Distill 32B Dense ให้เหตุผล / 32B Q4_K_M (20.1 GB) 24 GB UMA / VRAM 42.8% 49.5% 71.8% 37.8 tps 74.2 tps
DeepSeek Coder V2.5 MoE (21B แอคทีฟ / 236B) IQ3_XXS (88.4 GB) 96 GB–128 GB UMA 39.4% 46.8% 66.2% 14.2 tps ข้อจำกัดบัส PCIe
Qwen 2.5 Coder 14B Dense / 14.7B Q4_K_M (9.2 GB) 16 GB UMA / VRAM 33.8% 40.1% 58.6% 62.4 tps 112.5 tps
Qwen 2.5 Coder 7B Dense / 7.6B Q8_0 (8.1 GB) 12 GB UMA / VRAM 27.4% 34.2% 51.3% 94.1 tps 168.0 tps
GLM-4 9B Chat Dense / 9.2B Q4_K_M (5.8 GB) 10 GB UMA / VRAM 26.8% 32.7% 54.2% 86.5 tps 148.2 tps
Llama 3.2 3B Dense / 3.2B FP16 (6.4 GB) 8 GB UMA / VRAM 16.2% 21.4% 39.8% 145.0 tps 240.0 tps

4. แนวทางการเลือกใช้งานตามสเปกเครื่องของคุณ

กลุ่มที่ 1: Unified Memory 16GB (MacBook Air และรุ่นเริ่มต้น M2/M3/M4 Pro)

  • VRAM ใช้งานได้จริงสำหรับโมเดล: 11GB–12GB (macOS กันไว้ราว 4GB)
  • โมเดลที่แนะนำ: Qwen 2.5 Coder 7B (Q8_0 หรือ Q4_K_M) หรือ Qwen 2.5 Coder 14B (Q3_K_M / Q4_K_S)
  • โมเดลเสริมทำงานเร็ว: Llama 3.2 3B (Q8_0) สำหรับงานเขียนข้อความ Git commit และงานขนาดเล็ก
  • ความเร็ว: 55–90 โทเค็น/วินาที เหมาะสำหรับการทำ Code Autocomplete และการ Refactor ฟังก์ชันเดี่ยว

กลุ่มที่ 2: Unified Memory 24GB ถึง 36GB (M3/M4 Pro, Max รุ่นเริ่มต้น, RTX 3090/4090 เดี่ยว)

  • VRAM ใช้งานได้จริงสำหรับโมเดล: 18GB–28GB
  • โมเดลที่แนะนำ: Qwen 2.5 Coder 32B Instruct (Q4_K_M) — จุดสมดุลที่ดีที่สุดสำหรับการเขียนโค้ด
  • โมเดลคิดวิเคราะห์: DeepSeek R1 Distill Qwen 32B (Q4_K_M) สำหรับโจทย์ตรรกะที่ซับซ้อนและการออกแบบระบบ
  • ความเร็ว: 28–38 tps บน Mac; 70–80 tps บน RTX 4090 สามารถแก้บั๊กที่กระจายหลายไฟล์ได้อย่างแม่นยำ

กลุ่มที่ 3: Unified Memory 48GB ถึง 64GB (M3/M4 Max 48GB/64GB, การ์ดคู่ RTX 3090/4090)

  • VRAM ใช้งานได้จริงสำหรับโมเดล: 38GB–52GB
  • โมเดลที่แนะนำ: Llama 3.3 70B Instruct (Q4_K_M) และ Qwen 2.5 Coder 32B (Q8_0)
  • การอ่านเอกสารขนาดยักษ์: Command R+ (Q3_K_S) สำหรับการจัดการข้อมูล 128k คอนเทกต์
  • ความเร็ว: 16–22 tps บน M4 Max; 40–48 tps บน RTX 4090 คู่ ให้ระดับการคิดวิเคราะห์ใกล้เคียงโมเดลเชิงพาณิชย์บนคลาวด์

กลุ่มที่ 4: Unified Memory 96GB ถึง 128GB+ (Mac Studio M2/M3/M4 Ultra, Mac Pro)

  • VRAM ใช้งานได้จริงสำหรับโมเดล: 80GB–110GB
  • โมเดลที่แนะนำ: Llama 3.3 70B Instruct (Q8_0), DeepSeek Coder V2.5 MoE (IQ3_M / Q4_K_M) และ DeepSeek R1 671B (IQ1_S / IQ2_XXS)
  • ความเร็ว: 14–20 tps บนสถาปัตยกรรม MoE ขนาดใหญ่ สามารถรองรับบริบท 64k+ ได้โดยไม่ต้องกังวลเรื่องหน่วยความจำไม่เพียงพอ

5. เจาะลึกโมเดลยอดนิยม

5.1 Qwen 2.5 Coder 32B: มาตรฐานระดับทองสำหรับการเขียนโค้ด

พัฒนาโดย Alibaba ด้วยชุดข้อมูลโค้ด 5.5 ล้านล้านโทเค็น ครอบคลุม 92 ภาษาโปรแกรม

  • ข้อได้เปรียบทางสถาปัตยกรรม: ปรับความถี่ RoPE เป็น 1M ช่วยให้การค้นหาข้อมูลในบริบท 32k ถึง 128k มีความแม่นยำสูง
  • คะแนน SWE-bench Verified: 43.6% (สูงกว่า GPT-4 และ Claude 3 Sonnet เวอร์ชันแรก)
  • ความเข้ากันได้กับ Agent: ทำตามคำสั่งโครงสร้าง JSON ได้อย่างแม่นยำและรองรับการเรียกใช้ฟังก์ชันใน Cline, Roo Code, OpenCode

5.2 Llama 3.3 70B Instruct: โมเดลหลักจากค่าย Meta

ให้ความสามารถเทียบเท่ารุ่น 405B เดิมโดยลดความต้องการด้านฮาร์ดแวร์ลงอย่างมหาศาล

  • ข้อได้เปรียบทางสถาปัตยกรรม: สถาปัตยกรรม Grouped-Query Attention (GQA) พร้อม 8 KV Heads ลดการใช้หน่วยความจำแคชลง 75%
  • คะแนน MMLU-Pro: 73.1% เทียบเคียง Claude 3.5 Sonnet ในด้านวิศวกรรมระบบและตรรกศาสตร์
  • ความทนทานต่อการควอนไทเซชัน: รักษาประสิทธิภาพได้ถึง 99.1% ของโมเดลเดิม FP16 เมื่อย่อขนาดเป็น Q4_K_M (42.5GB)

5.3 DeepSeek R1 Distill Qwen 32B: ระบบคิดวิเคราะห์บนโต๊ะทำงาน

ผสานกระบวนการคิดวิเคราะห์จากการเรียนรู้แบบเสริมกำลัง (...) เข้ากับโมเดลขนาดกะทัดรัด

  • จุดเด่น: มีความสามารถยอดเยี่ยมในการหา Race Condition ในโค้ดแบบอะซิงโครนัสและการตรวจสอบอัลกอริทึม
  • ข้อสังเกต: มีการสร้างโทเค็นภายในเพื่อคิดวิเคราะห์จำนวนมาก แนะนำให้ใช้กับเครื่องที่ทำความเร็วได้ 30+ tps ขึ้นไป

6. เปรียบเทียบรันไทม์การรันโมเดล: Ollama vs llama.cpp vs vLLM vs MLX

การเลือกเฟรมเวิร์กมีผลอย่างมากต่อปริมาณโทเค็นที่ได้ ความหน่วง และความสะดวกในการเชื่อมต่อระบบ

+-----------------------------------------------------------------------------------------+
|                                    ตารางเปรียบเทียบรันไทม์                               |
+-------------------+-------------------+------------------------+------------------------+
| รันไทม์           | แพลตฟอร์มหลัก     | จุดเด่น                | กรณีการใช้งานที่ดีที่สุด|
+-------------------+-------------------+------------------------+------------------------+
| **Ollama**        | macOS, Linux, Win | ใช้งานง่ายผ่าน CLI/API | สภาพแวดล้อมการพัฒนาทั่วไป|
| **llama.cpp**     | ข้ามแพลตฟอร์ม C++ | ประสิทธิภาพและความยืดหยุ่น| การปรับแต่งละเอียด     |
| **vLLM**          | Linux / NVIDIA    | PagedAttention และความเร็ว| เซิร์ฟเวอร์รองรับโหลดสูง|
| **MLX / LM-Studio**| Apple Silicon Mac | ปรับแต่งตรงสำหรับ Metal| ใช้งานบน Mac GUI      |
+-------------------+-------------------+------------------------+------------------------+

ตัวอย่างการติดตั้งจริง: รัน Qwen 2.5 Coder 32B ด้วย Ollama

การตั้งค่าสำหรับบริบท 32k และ 4-bit KV Cache:

# 1. ติดตั้ง Ollama บน macOS หรือ Linux
curl -fsSL https://ollama.com/install.sh | sh

# 2. ดาวน์โหลด Qwen 2.5 Coder 32B Q4_K_M
ollama run qwen2.5-coder:32b-instruct-q4_K_M

# 3. สร้าง Modelfile สำหรับ 32k คอนเทกต์
cat << 'EOF' > Modelfile-Coder
FROM qwen2.5-coder:32b-instruct-q4_K_M
PARAMETER num_ctx 32768
PARAMETER num_predict 4096
PARAMETER stop "<|im_end|>"
PARAMETER temperature 0.2
PARAMETER top_p 0.95
EOF

ollama create local-coder-32k -f Modelfile-Coder
ollama serve

การเร่งประสิทธิภาพ Metal บน Mac: รันด้วย Apple MLX

หากต้องการดึงประสิทธิภาพสูงสุดบน Apple Silicon:

# ติดตั้ง MLX-LM
pip install mlx-lm

# รัน Qwen 2.5 Coder 32B 4-bit แบบเนทีฟ
python -m mlx_lm.generate   --model mlx-community/Qwen2.5-Coder-32B-Instruct-4bit   --prompt "Write a high-concurrency Rust actor pattern using Tokio."   --max-tokens 2048   --temp 0.2

7. การวิเคราะห์ต้นทุนและความคุ้มค่า: ฮาร์ดแวร์ในเครื่องเทียบกับ Cloud APIs

การซื้อ Mac Studio ($3,999) หรือเวิร์กสเตชันการ์ดจอ RTX 4090 คู่ ($3,500) คุ้มค่ากว่าการจ่ายค่า API ของ Claude 3.7 Sonnet หรือ OpenAI o3 หรือไม่?

+-----------------------------------------------------------------------------------------+
|                                ค่าใช้จ่ายสะสมตลอด 24 เดือน                              |
|                                                                                         |
| $15,000 |                                                Cloud APIs (ใช้งานเชิงรุก)     |
|         |                                                .................../           |
| $10,000 |                                  ............./                               |
|         |                    ............./                                             |
|  $5,000 |      ............/                      Local Mac Studio M4 Ultra ($3,999)     |
|         | ----/------------------------------------------------------------------------ |
|      $0 +------------------------------------------------------------------------------ |
|         เดือน 0            เดือน 6            เดือน 12           เดือน 18      เดือน 24 |
+-----------------------------------------------------------------------------------------+
ลักษณะการใช้งาน ปริมาณโทเค็นต่อเดือน ค่าใช้จ่าย Cloud API (Sonnet/o3) ค่าใช้จ่าย Mac Studio 128GB จุดคุ้มทุน (ROI)
นักพัฒนาคนเดียว 15M โทเค็น/เดือน $85 / เดือน $3,999 ครั้งแรก + ค่าไฟ $8/เดือน 48 เดือน
ทีมขนาดเล็ก (5 คน) 120M โทเค็น/เดือน $680 / เดือน $3,999 ครั้งแรก + ค่าไฟ $18/เดือน 5.8 เดือน
ฝ่ายวิศวกรรม (20 คน) 850M โทเค็น/เดือน $4,850 / เดือน คลัสเตอร์ Mac Studio 2 เครื่อง ($7,998) 1.7 เดือน

ข้อสรุปเชิงเศรษฐศาสตร์: สำหรับการใช้งานเป็นครั้งคราว Cloud API ยังคงประหยัดกว่า แต่สำหรับทีมวิศวกรที่ใช้งาน Coding Agents ประจำ (Cline, Roo Code, Aider ซึ่งใช้ 500k ถึง 2M โทเค็นต่องาน) ฮาร์ดแวร์ในเครื่องจะคืนทุนภายในเวลาไม่ถึง 6 เดือน พร้อมทั้งรักษาความปลอดภัยของข้อมูลได้ 100%


8. คำแนะนำการนำไปปรับใช้ในองค์กร

  1. สำหรับแล็ปท็อปขนาด 16GB: ใช้ Qwen 2.5 Coder 14B Q4_K_M หรือ 7B Q8_0 เท่านั้น ไม่ควรฝืนรัน 32B บนเครื่อง 16GB เพราะจะเกิดการ Swap ส่งผลให้ความเร็วลดลงเหลือต่ำกว่า 2 tps และทำให้ SSD เสื่อมสภาพเร็ว
  2. สำหรับเครื่อง 32GB ถึง 48GB: ใช้ Qwen 2.5 Coder 32B Instruct (Q4_K_M) เป็นหลักในการเขียนโค้ด และใช้ Llama 3.3 70B (IQ3_XXS) สำหรับการคิดโครงสร้างระบบ
  3. เปิดใช้การควอนไทซ์ KV Cache แบบ 4-bit: ตั้งค่า q4_0 ใน llama.cpp และ Ollama เพื่อประหยัดพื้นที่ VRAM ได้ 3GB ถึง 8GB เมื่อทำงานกับข้อมูลยาวเกิน 32k
  4. เชื่อมต่อกับระบบ AI Agent: ต่อ Ollama Endpoint ภายในเครื่อง (http://localhost:11434/v1) เข้ากับส่วนขยายใน VS Code เพื่อการพัฒนาซอฟต์แวร์แบบออฟไลน์ที่ปลอดภัยสมบูรณ์แบบ

9. คำถามที่พบบ่อย (FAQ)

ชิป Apple Silicon M4 Pro สามารถรัน Llama 3.3 70B ได้หรือไม่?

ชิป M4 Pro ที่มีแรม 24GB หรือ 36GB ไม่สามารถรัน Llama 3.3 70B ได้อย่างมีประสิทธิภาพ แม้จะควอนไทซ์ขั้นรุนแรง (IQ2_XXS) ระบบก็จะเกิดดิสก์สวอปจนความเร็วเหลือต่ำกว่า 1 tps หากต้องการความเร็ว 18–22 tps บนรูปแบบ Q4_K_M จำเป็นต้องมี Unified Memory 48GB ถึง 64GB ขึ้นไป

ทำไม Apple Unified Memory จึงได้เปรียบ NVIDIA สำหรับโมเดลขนาด 70B+?

เพราะข้อได้เปรียบด้านต้นทุนต่อขนาดหน่วยความจำ การรันโมเดล 70B แบบ Q8 หรือโมเดล MoE ขนาดใหญ่ต้องใช้ VRAM ถึง 60GB–120GB หากใช้พีซีจะต้องซื้อการ์ดจอระดับมืออาชีพหลายใบ (A100/H100) ซึ่งมีราคาสูงถึง $6,000 ถึงกว่า $30,000 ขณะที่ Mac Studio 128GB ให้ความจุระดับนี้ได้ในตัวเครื่องที่เงียบสนิทและประหยัดพลังงานในราคาต่ำกว่า $4,000

โมเดลตัวไหนเหมาะสมที่สุดสำหรับ Coding Agent บนเครื่องตัวเองในปี 2026?

Qwen 2.5 Coder 32B Instruct คือตัวเลือกอันดับหนึ่งอย่างแท้จริง ทำคะแนนได้ 43.6% บน SWE-bench Verified รองรับการเรียกใช้ฟังก์ชันตามโครงสร้าง JSON ได้อย่างแม่นยำ สามารถทำงานร่วมกับพื้นที่ VRAM 24GB ในรูปแบบ Q4_K_M ได้อย่างลงตัว

← บทความทั้งหมด
0 / 4