Benchmarks

مقارنة GPT-OSS 120B و Gemini 3 Pro: اختبارات الأداء والتكلفة

### إجابة سريعة: GPT-OSS 120B مقابل Gemini 3 Pro

يتفوق Gemini 3 Pro في الاستدلال متعدد الوسائط المعقد وسياقات الوكلاء الضخمة حتى 2 مليون رمز، محققاً الصدارة في HLE (32.4%) و GPQA Diamond (79.2%). في المقابل، يتفوق نموذج GPT-OSS 120B مفتوح الأوزان من OpenAI (إجمالي 117B مع 24B نشط MoE) في السيادة الكاملة على البيانات، وانعدام رسوم نقل الرموز، وتحقيق زمن استجابة محلي أقل من 15 مللي ثانية على شريحتين H100 بدقة FP8 عبر vLLM.


1. نظرة معمارية عامة: أوزان MoE المفتوحة ضد الأنظمة السحابية الاحتكارية

في عام 2026، وصل مشهد الذكاء الاصطناعي الرائد إلى نقطة تحول تاريخية. أطلقت شركة OpenAI نموذجها الرائد مفتوح الأوزان GPT-OSS 120B القائم على معمارية خليط الخبراء (MoE)، ليدخل في منافسة مباشرة مع نظام Google المغلق Gemini 3 Pro والنسخة الاقتصادية Gemini 2.5 Flash. في الوقت ذاته، تقارن فرق المؤسسات بين كلا النموذجين والنموذج المرجعي GPT 5.2.

لم يعد المعيار مقتصراً على درجات الاختبارات فقط، بل أصبح خياراً استراتيجياً بين السيادة الكاملة على النموذج (الاستضافة الذاتية، فحص الأوزان، منع تسريب البيانات، زمن استجابة حتمي) والبنية التحتية السحابية فائقة التوسع (سياق أصلي متعدد الوسائط يصل إلى 2 مليون رمز، وحسابات اختبارية ديناميكية، وانعدام تكاليف صيانة الخوادم).

+-----------------------------------------------------------------------------------------+
|                               مقارنة الأنماط المعمارية لعام 2026                        |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (معمارية خليط الخبراء مفتوحة الأوزان)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B إجمالي المعالم| ---> | موجه Top-2 الديناميكي | ---> | 23.8B معالم نشطة    |     |
|   | 16 خبيراً متخصصاً   |      | تشغيل محلي بنظام FP8|      | نافذة سياق 128K     |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> استضافة ذاتية: 2x H100 / 4x L40S <-------------+                |
|                                                                                         |
|   GEMINI 3 PRO (نظام سحابي أصلي متعدد الوسائط ومغلق)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | هجين مكثف-موزع      | ---> | محرك تفكير Gemini   | ---> | دعم أصلي للصوت/فيديو|     |
|   | شرائح Google TPU v6e|      | معالجة ديناميكية    |      | سياق 2 مليون رمز    |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

2. بنية النموذج ومتطلبات ذاكرة VRAM

يتطلب تشغيل GPT-OSS 120B على الأجهزة المحلية فهماً دقيقاً لمعمارية MoE مقارنة ببنية TPU المدارة من Google:

المواصفات الفنية وخيارات التكميم

  • إجمالي المعالم: 116.8 مليار معيار (يتم تنشيط 23.8 مليار معيار لكل رمز).
  • حجم الذاكرة المطلوب: على الرغم من تنشيط 23.8B فقط، يجب أن تتواجد كافة الأوزان البالغة 116.8B في ذاكرة GPU لمنع اختناقات نقل البيانات عبر ناقل PCIe.
  • التشغيل بدقة FP8: يتطلب 136 جيجابايت من ذاكرة VRAM (يوصى ببطاقتي NVIDIA H100 80GB SXM5)، مما يوفر سرعة معالجة تصل إلى 76 رمزاً في الثانية.

3. نتائج اختبارات الأداء الميدانية

معيار الاختبار والمقياس GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (المرجع)
Humanity's Last Exam (HLE) 24.8% 32.4% 18.6% 34.1%
GPQA Diamond (علوم الدكتوراة) 68.4% 79.2% 62.8% 81.5%
MATH-500 (أولمبياد الرياضيات) 88.2% 94.6% 82.4% 95.8%
AIME 2026 (Pass@1) 64.0% 78.5% 52.0% 82.0%
SWE-bench Verified (حل المشاكل) 56.4% 68.2% 44.5% 71.8%
LiveCodeBench v6 (برمجة 2026) 62.1% 72.8% 51.4% 74.5%
MMLU-Pro (سلاسل التفكير) 81.2% 89.5% 76.3% 90.4%
MMMU (اختبارات جامعية) 68.5% (ViT) 76.8% (أصلي) 64.2% 78.2%
MathVista (رياضيات بصرية) 71.2% 82.4% 69.1% 84.0%
NIAH (البحث في 2M رمز) 99.8% (128k) 100.0% (2M) 99.9% (1M) 100.0% (256k)

أبرز الملاحظات التحليلية

  1. الريادة في التفكير العلمي: يتقدم Gemini 3 Pro بنسبة 7.6% في HLE و 10.8% في GPQA Diamond بفضل آلية Deep Thought التي تخصص آلاف الرموز للتحقق الاستدلالي.
  2. برمجة الأنظمة (SWE-bench): يتفوق Gemini 3 Pro بنسبة 68.2% مقابل 56.4% لنموذج GPT-OSS 120B. ومع ذلك، يمكن للضبط الدقيق الداخلي تقليص هذا الفارق إلى أقل من 4%.
  3. التفوق على Gemini 2.5 Flash: يتفوق GPT-OSS 120B على نموذج Flash في كافة الاختبارات المنطقية.
  4. إنجاز تاريخي للأوزان المفتوحة: GPT-OSS 120B هو أول نموذج مفتوح يتجاوز 88% في MATH-500 و 56% في SWE-bench Verified.

4. البنية متعددة الوسائط وأفق السياق

  • Gemini 3 Pro (2,000,000 رمز): يستوعب كود المستودعات الضخمة بالكامل، أو ساعتين من الفيديو فائق الدقة، أو عشرات التسجيلات الصوتية بدقة استرجاع 100%.
  • GPT-OSS 120B (128,000 رمز): كافٍ لأكثر من 95% من مهام تطوير البرمجيات والمحادثات اليومية، ولكنه يحتاج إلى نظام استرجاع خارجي (RAG) للفيديوهات الطويلة.

5. دليل النشر والتشغيل (vLLM Docker)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

6. التحليل المالي ونقطة التعادل

  • تسعير API: يبلغ متوسط تكلفة Gemini 3 Pro حوالي 2.19 دولار لكل مليون رمز.
  • نقطة التعادل (Break-Even): إذا تجاوز استهلاك مؤسستك 65 مليون رمز يومياً، فإن الاستضافة الذاتية لنموذج GPT-OSS 120B على بطاقتي H100 تكون أوفر بكثير من فواتير واجهة برمجة التطبيقات.
  • الخلاصة والتوصية: اعتمد بنية هجينة؛ استخدم GPT-OSS 120B محلياً للمهام الروتينية والبيانات الحساسة، واعتمد على Gemini 3 Pro (أو GPT 5.2) للبراهين الرياضية المعقدة ومعالجة الفيديوهات الطويلة.
→ كل المقالات
0 / 4