Benchmarks

GPT-OSS 120B vs Gemini 3 Pro: เบนช์มาร์กและต้นทุน

### สรุปคำตอบด่วน: GPT-OSS 120B vs Gemini 3 Pro

Gemini 3 Pro ครองความเป็นผู้นำในการคิดเชิงเหตุผลหลายรูปแบบที่ซับซ้อนและบริบทขนาดมหึมา 2 ล้านโทเค็น โดยชนะใน HLE (32.4%) และ GPQA Diamond (79.2%) ส่วน GPT-OSS 120B โมเดลเปิดน้ำหนักของ OpenAI (รวม 117B, ใช้งาน 24B MoE) ชนะเลิศด้านการรักษาอธิปไตยของข้อมูล ไม่มีค่าธรรมเนียมส่งถ่ายข้อมูล และมีความหน่วงต่ำกว่า 15 ms บนเครื่อง H100 สองตัวในระดับความแม่นยำ FP8 ผ่าน vLLM


1. ภาพรวมสถาปัตยกรรม: MoE แบบเปิดน้ำหนัก ปะทะ เมกะซิสเต็มกรรมสิทธิ์

ในปี 2026 วงการ AI ได้เดินทางมาถึงจุดเปลี่ยนครั้งสำคัญ OpenAI ได้เปิดตัว GPT-OSS 120B โมเดล Mixture-of-Experts (MoE) แบบเปิดน้ำหนักเรือธง ท้าชนระบบปิดของ Google อย่าง Gemini 3 Pro และรุ่นประหยัดพลังงาน Gemini 2.5 Flash โดยทีมวิศวกรองค์กรต่างนำโมเดลทั้งสองมาเทียบชั้นกับ GPT 5.2

ประเด็นสำคัญไม่ใช่เพียงแค่คะแนนทดสอบเท่านั้น แต่เป็นข้อแลกเปลี่ยนระหว่าง อธิปไตยของโมเดลอย่างสมบูรณ์ (ติดตั้งภายในองค์กร, ตรวจสอบน้ำหนักได้, ไม่มีความเสี่ยงข้อมูลรั่วไหล, ความหน่วงที่ควบคุมได้) กับ โครงสร้างพื้นฐานคลาวด์ขนาดมหาศาล (บริบท 2 ล้านโทเค็นแบบเนทีฟมัลติโมดัล, การประมวลผลขั้นสูงในเวลาทดสอบ และไม่มีภาระในการดูแลคลัสเตอร์)

+-----------------------------------------------------------------------------------------+
|                              การเปรียบเทียบสถาปัตยกรรมปี 2026                           |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (เปิดน้ำหนัก Mixture-of-Experts)                                         |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | รวม 116.8B พารามิเตอร์| ---> | Top-2 เราเตอร์คัดเลือก| ---> | 23.8B พารามิเตอร์ทำงาน|   |
|   | 16 ผู้เชี่ยวชาญ MoE  |      | รันบน FP8 เนทีฟ     |      | 128K หน้าต่างบริบท  |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> ติดตั้งเองบน 2x H100 / 4x L40S <---------------+                |
|                                                                                         |
|   GEMINI 3 PRO (ระบบมัลติโมดัลเนทีฟแบบปิดกรรมสิทธิ์)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | ไฮบริด Dense-MoE    | ---> | Gemini Deep Thought | ---> | เนทีฟเสียงและวิดีโอ  |    |
|   | Google TPU v6e      |      | คำนวณทดสอบไดนามิก   |      | 2 ล้านโทเค็นบริบท    |    |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

2. โครงสร้างโมเดลและความต้องการหน่วยความจำ VRAM

  • พารามิเตอร์ทั้งหมด: 116.8 พันล้านพารามิเตอร์ (ทำงานจริง 23.8 พันล้านพารามิเตอร์ต่อโทเค็น)
  • ข้อจำกัด VRAM: แม้จะเปิดใช้งานเพียง 23.8B แต่น้ำหนักทั้งหมด 116.8B ต้องอยู่ใน VRAM ของ GPU เสมอเพื่อป้องกันคอขวดบนบัส PCIe
  • การรัน FP8: ต้องการ VRAM 136 GB (แนะนำ 2x NVIDIA H100 80GB SXM5) โดยให้ความเร็วสร้างโทเค็นประมาณ 76 tokens/s

3. สรุปผลการทดสอบเบนช์มาร์กหลัก

เบนช์มาร์กและตัวชี้วัด GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (อ้างอิง)
Humanity's Last Exam (HLE) 24.8% 32.4% 18.6% 34.1%
GPQA Diamond (วิทยาศาสตร์ PhD) 68.4% 79.2% 62.8% 81.5%
MATH-500 (คณิตศาสตร์โอลิมปิก) 88.2% 94.6% 82.4% 95.8%
AIME 2026 (Pass@1) 64.0% 78.5% 52.0% 82.0%
SWE-bench Verified (แก้โค้ด) 56.4% 68.2% 44.5% 71.8%
LiveCodeBench v6 (โค้ด 2026) 62.1% 72.8% 51.4% 74.5%
MMLU-Pro (การคิด CoT) 81.2% 89.5% 76.3% 90.4%
MMMU (มัลติโมดัลระดับมหาวิทยาลัย) 68.5% (ViT) 76.8% (เนทีฟ) 64.2% 78.2%
MathVista (คณิตศาสตร์เชิงภาพ) 71.2% 82.4% 69.1% 84.0%
NIAH (การค้นหาข้อมูล 2M) 99.8% (128k) 100.0% (2M) 99.9% (1M) 100.0% (256k)

4. สถาปัตยกรรมมัลติโมดัลและบริบท

  • Gemini 3 Pro (2,000,000 โทเค็น): รองรับซอร์สโค้ดทั้งคลังขององค์กร หรือวิดีโอระดับ 4K ความยาว 2 ชั่วโมงได้โดยตรงและแม่นยำ 100%
  • GPT-OSS 120B (128,000 โทเค็น): เพียงพอสำหรับงานวิศวกรรมซอฟต์แวร์ทั่วไป แต่สำหรับวิดีโอขนาดยาวจำเป็นต้องใช้ระบบ RAG ภายนอกเสริม

5. คู่มือการติดตั้งใช้งาน (vLLM Docker)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

6. การวิเคราะห์ต้นทุนและความคุ้มค่า

  • ราคา API: Gemini 3 Pro เฉลี่ย $2.19 ต่อ 1 ล้านโทเค็น
  • จุดคุ้มทุน: หากองค์กรของคุณใช้งานมากกว่า 65 ล้านโทเค็นต่อวัน การเช่าเซิร์ฟเวอร์ 2x H100 เพื่อรัน GPT-OSS 120B จะประหยัดกว่าการจ่ายค่า API อย่างมาก
  • ข้อแนะนำ: เลือกใช้โครงสร้างแบบไฮบริด โดยใช้ GPT-OSS 120B ภายในสำหรับงานประจำวันและข้อมูลลับ ส่วนงานวิจัยระดับสูงหรือวิดีโอขนาดยาวให้ส่งไปยัง Gemini 3 Pro
← บทความทั้งหมด
0 / 4