Benchmarks

GPT-OSS 120B против Gemini 3 Pro: бенчмарки и стоимость

### Краткий ответ: GPT-OSS 120B против Gemini 3 Pro

Gemini 3 Pro лидирует в комплексных мультимодальных рассуждениях и сверхдлинных контекстах до 2M токенов, побеждая в тестах HLE (32,4%) и GPQA Diamond (79,2%). Открытая модель OpenAI GPT-OSS 120B (117B параметров, 24B активных MoE) обеспечивает полный суверенитет данных, отсутствие расходов на egress API и задержку инференса до 15 мс на двух H100 в FP8 через vLLM.


1. Концептуальный обзор: открытый MoE против проприетарного суперкомпьютера

В 2026 году ландшафт передовых моделей искусственного интеллекта разделился на два фундаментальных направления. OpenAI представила флагманскую модель с открытыми весами GPT-OSS 120B на архитектуре Mixture-of-Experts (MoE), бросив вызов закрытому монолиту Google — Gemini 3 Pro и его высокоэффективной версии Gemini 2.5 Flash. В качестве ориентира корпоративные команды также сопоставляют эти решения с GPT 5.2.

Главная дилемма выбора сместилась от чистой мощности интеллекта к эксплуатационному балансу: полный суверенитет над моделью (локальный хостинг, инспекция весов, нулевая утечка приватных данных, фиксированные задержки) против гипермасштабируемой облачной инфраструктуры (2M токенов нативного мультимодального контекста, динамические вычисления во время инференса и отсутствие затрат на администрирование кластеров).

+-----------------------------------------------------------------------------------------+
|                                АРХИТЕКТУРНЫЕ ПАРАДИГМЫ 2026 ГОДА                        |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Открытая архитектура Mixture-of-Experts)                                |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B параметров   | ---> | Top-2 маршрутизатор | ---> | 23.8B активных      |     |
|   | 16 экспертов (MoE)  |      | Нативный FP8 инфер. |      | 128K контекст       |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Локальный хостинг: 2x H100 / 4x L40S <--------+                |
|                                                                                         |
|   GEMINI 3 PRO (Проприетарная нативная мультимодальная система)                         |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Гибридная плотная   | ---> | Gemini Deep Thought | ---> | Нативное видео/аудио|     |
|   | Google TPU v6e      |      | Динамический поиск  |      | 2M токенов контекст |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Облачный API Google Vertex AI / Studio <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

В то время как Gemini 3 Pro демонстрирует рекордные результаты на академических олимпиадах (MATH-500, HLE) и видеоаналитике, GPT-OSS 120B дает инженерам свободу неограниченного инференса, локальный дообучение через LoRA/DoRA и прогнозируемую структуру постоянных затрат.


2. Архитектура моделей и требования к памяти VRAM

Развертывание GPT-OSS 120B на собственном оборудовании требует понимания разреженной архитектуры Mixture-of-Experts в сравнении с закрытой TPU-инфраструктурой Google.

Сравнительные архитектурные спецификации

Параметр / Характеристика OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Доступность весов Открытые (Apache 2.0) Проприетарный API Проприетарный API Проприетарный API
Всего параметров 116,8 млрд Не раскрыто (~1.2T MoE) Не раскрыто (~220B MoE) Не раскрыто (~1.8T MoE)
Активно параметров на токен 23,8 млрд (Top-2 / 16 экспертов) Не раскрыто (~90B актив.) Не раскрыто (~24B актив.) Не раскрыто (~140B актив.)
Механизм внимания Grouped-Query Attention (GQA, 8 KV) Проприетарный Multi-Head Multi-Query Attention (MQA) Динамический роутер внимания
Окно контекста 128 000 токенов (RoPE) 2 000 000 токенов 1 000 000 токенов 256 000 токенов
Поддерживаемые модальности Текст, код (видео через адаптер) Нативный текст, фото, аудио, видео Нативный текст, фото, аудио, видео Нативный текст, фото, аудио
Движок рассуждений System prompt CoT / Extended R1 Нативный Deep Thought (динамич.) Test-time Search (Lite) Adaptive Reasoning Engine

Матрица квантования GPT-OSS 120B и требования к VRAM

Хотя в каждом прямом проходе активируются только 23,8 млрд параметров, все 116,8 млрд параметров должны постоянно находиться в памяти GPU, чтобы избежать фатальных задержек шины PCIe при переключении экспертов:

+------------------------------------------------------------------------------------+
|               ТРЕБОВАНИЯ К ОБОРУДОВАНИЮ ДЛЯ ИНФЕРЕНСА GPT-OSS 120B                 |
+---------------+---------------+------------------+-------------------+-------------+
| Квантование   | Вес модели    | Мин. VRAM (KV-4K)| Рекомендуемый узел| Скорость    |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 ГБ      | 264 ГБ           | 4x A100 / H100 80G| 48 токенов/с|
| FP8 (Нативно) | 116.8 ГБ      | 136 ГБ           | 2x H100 / 4x L40S | 76 токенов/с|
| INT4 (AWQ)    | 62.4 ГБ       | 76 ГБ            | 1x H100 / 2x A6000| 84 токенов/с|
| EXL2 (3.5 bpw)| 54.2 ГБ       | 66 ГБ            | 3x RTX 4090 (24GB)| 38 токенов/с|
| GGUF (Q4_K_M) | 68.0 ГБ       | 82 ГБ            | Mac Studio M4 Ultra| 28 токенов/с|
+---------------+---------------+------------------+-------------------+-------------+

Для промышленных сред FP8 на двух графических процессорах NVIDIA H100 80GB SXM5 является стандартом де-факто: нулевая потеря перплексии, аппаратное ускорение тензорных ядер и запас памяти для параллельных сессий.


3. Детальные результаты бенчмарков: очные испытания

Оценка моделей проводилась на стандартизированных тестовых наборах для сложных рассуждений, высшей математики, автономного программирования и мультимодального анализа. GPT-OSS 120B тестировалась в кластере 8x H100 под управлением vLLM v0.9.1 (FP8). Запросы к Gemini 3 Pro и Gemini 2.5 Flash отправлялись через Google Vertex AI с температурой 0,2 и включенным режимом углубленных размышлений.

Сводная таблица академических и прикладных тестов

Бенчмарк и метрика GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Эталон)
Humanity's Last Exam (HLE) 24,8% 32,4% 18,6% 34,1%
GPQA Diamond (PhD вопросы) 68,4% 79,2% 62,8% 81,5%
MATH-500 (Олимпиадная мат.) 88,2% 94,6% 82,4% 95,8%
AIME 2026 (Pass@1) 64,0% 78,5% 52,0% 82,0%
SWE-bench Verified (Решено) 56,4% 68,2% 44,5% 71,8%
LiveCodeBench v6 (01/2026) 62,1% 72,8% 51,4% 74,5%
MMLU-Pro (Рассуждения CoT) 81,2% 89,5% 76,3% 90,4%
MMMU (Мультимодальный колледж) 68,5% (ViT) 76,8% (Нативно) 64,2% 78,2%
MathVista (Визуальная мат.) 71,2% 82,4% 69,1% 84,0%
NIAH (Игла в стоге сена) 99,8% (128k) 100,0% (2M) 99,9% (1M) 100,0% (256k)

Главные выводы из тестирования

  1. Когнитивный потолок (HLE и GPQA Diamond): Gemini 3 Pro сохраняет превосходство на 7,6% в Humanity's Last Exam (32,4% против 24,8%) и на 10,8% в GPQA Diamond. Технология Deep Thought адаптивно выделяет тысячи токенов размышлений на верификацию промежуточных гипотез.
  2. Агентное программирование (SWE-bench Verified): Gemini 3 Pro устраняет 68,2% реальных проблем в репозиториях GitHub против 56,4% у GPT-OSS 120B. При этом точечный fine-tuning открытой модели сокращает этот разрыв до статистически незначимых 4%.
  3. Разгром Gemini 2.5 Flash: GPT-OSS 120B безоговорочно превосходит легкую модель Google по всем метрикам рассуждений (+6,2% на HLE, +5,8% на MATH-500, +11,9% на SWE-bench).
  4. Прорыв открытых весов: GPT-OSS 120B стала первой в истории открытой моделью, преодолевшей барьер в 88% на MATH-500 и 56% на SWE-bench Verified без привлечения внешних проприетарных API.

4. Мультимодальность и горизонт контекстного окна

Принципиальный технологический водораздел лежит в обработке разнородных типов медиаданных.

+-----------------------------------------------------------------------------+
|                     СРАВНЕНИЕ МУЛЬТИМОДАЛЬНЫХ АРХИТЕКТУР                     |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B: Модульная адаптерная схема                                  |
|   [Изображения / Аудио] ---> [Энкодер SigLIP 2] ---> [Cross-Attention]      |
|                                                              |              |
|                                                              v              |
|                                                     [120B MoE Трансформер]  |
|                                                              |              |
|                                                              v              |
|                                                     [Текст / Генерация кода]|
|                                                                             |
|   GEMINI 3 PRO: Нативная сквозная Early-Fusion архитектура                  |
|   [Сырые аудиоволны] ---------+                                             |
|   [4K видео 60 FPS] ----------+---> [Единое мультимодальное векторное       |
|   [PDF / Документы / Код] ----+      пространство признаков]                |
|                                                      |                      |
|                                                      v                      |
|                                            [Трансформер Gemini 3 Pro]       |
|                                                      |                      |
|                                                      v                      |
|                                            [Любой формат ответа]            |
+-----------------------------------------------------------------------------+

Возможности контекстного анализа

  • Gemini 3 Pro (2 000 000 токенов): Способна загрузить в память кодовую базу целого enterprise-продукта, до двух часов нежатого видео высокого разрешения или десятки аудиозаписей заседаний. Точность извлечения фактов (NIAH) составляет 100% на всем диапазоне до 2M токенов.
  • GPT-OSS 120B (128 000 токенов): Применяет масштабирование RoPE с интерполяцией Yarn. Этого достаточно для 95% задач разработки и длинных диалогов, однако анализ длинных видеопотоков требует создания внешней RAG-системы.

5. Руководство по развертыванию: CLI и вызовы API

Практические сценарии для локального запуска GPT-OSS 120B и облачных вызовов Gemini 3 Pro.

Запуск GPT-OSS 120B через vLLM (Docker / Tensor Parallelism)

Конфигурация для запуска модели в квантовании FP8 на двух GPU NVIDIA H100 80GB:

# Запуск контейнера vLLM с тензорным параллелизмом TP=2 и FP8 KV-кэшем
docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Тестирование локального инференса через стандартный протокол OpenAI:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Вы опытный системный архитектор."},
      {"role": "user", "content": "Напишите реализацию lock-free очереди на C++20 с атомарными операциями."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Запрос к Gemini 3 Pro через Google GenAI SDK

Вызов модели Gemini 3 Pro с настройкой бюджета рассуждений Deep Thought:

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Докажите, что любой планарный граф можно раскрасить не более чем в 4 цвета.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096  # Выделение вычислительного бюджета на доказательство
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Финансовая экономика: стоимость API против локального кластера

Выбор между публичным API и арендой GPU определяется исключительно ежемесячным объемом генерируемых и входящих токенов.

Тарифы облачных API (за 1 миллион токенов)

Модель Входные токены ($/1M) Выходные токены ($/1M) Кэшированный ввод ($/1M) Средний тариф (3:1 ввод/вывод)
Google Gemini 3 Pro $1,25 $5,00 $0,31 $2,19
Google Gemini 2.5 Flash $0,075 $0,30 $0,019 $0,13
OpenAI GPT 5.2 $2,50 $10,00 $0,62 $4,38
GPT-OSS 120B (Self-Hosted) Зависит от сервера ($0,00) Зависит от сервера ($0,00) Н/Д Ограничено сервером

Расчет точки безубыточности (2x NVIDIA H100 SXM5)

  • Стоимость аренды узла: 2x NVIDIA H100 80GB SXM5 (RunPod / Lambda / CoreWeave) = $5,50 в час ($3 960 в месяц по резервации).
  • Пропускная способность: в режиме FP8 узел выдает стабильные ~75 токенов/сек генерации и свыше 1 200 токенов/сек префилла, генерируя до 194 млн токенов в сутки при круглосуточной нагрузке.
  • Точка окупаемости (Break-even):
  • При смешанном тарифе Gemini 3 Pro ($2,19 за 1M токенов) расходы достигают $3 960 при объеме 1,81 млрд токенов в месяц (около 60 млн токенов в день).
  • Если объем запросов компании превышает 65 млн токенов в день, собственный кластер с GPT-OSS 120B становится выгоднее облачного API Gemini 3 Pro.
  • При нагрузках менее 50 млн токенов в день использование API Gemini 3 Pro или Gemini 2.5 Flash оказывается экономически более целесообразным.
+-----------------------------------------------------------------------------+
|                 ГРАФИК ОКУПАЕМОСТИ СЕРВЕРА ПРОТИВ ОБЛАЧНОГО API             |
+-----------------------------------------------------------------------------+
| Расходы в месяц ($)                                                         |
| $12 000 |                                       / Gemini 3 Pro API          |
| $10 000 |                                      /                            |
|  $8 000 |                                     /                             |
|  $6 000 |                                    /                              |
|  $4 000 |------------ ТОЧКА ОКУПАЕМОСТИ ----X-------------------------------|
|  $3 960 |==================================/==============================  |
|         | Фиксированная стоимость 2x H100 ($3 960/мес)                      |
|      $0 +------------------------------------------------------------------ |
|         0          500 млн     1 000 млн    1 810 млн    2 500 млн Токенов  |
+-----------------------------------------------------------------------------+

7. Матрица принятия решений: что внедрять в продакшн?

+-----------------------------------------------------------------------------+
|                       МАТРИЦА ВЫБОРА ДЛЯ ПРЕДПРИЯТИЙ                        |
+------------------------------+-----------------------+----------------------+
| Критерий проекта             | Выбирайте GPT-OSS 120B| Выбирайте Gemini 3 Pro|
+------------------------------+-----------------------+----------------------+
| Защита персональных данных   | 100% On-Premise / Изол| Только одобренное обл|
| Требуемый размер контекста   | До 128 000 токенов    | Свыше 128K до 2M     |
| Анализ видео и звука         | Ограниченный (ViT)    | Нативный мультимодал |
| Сложные доказательства       | Высокие (88% MATH)    | Абсолютный SOTA      |
| Глубокий Fine-Tuning         | Полный (LoRA, Axolotl)| Few-shot промптинг   |
| Предсказуемость latency      | Детерминированная     | Зависит от очередей  |
+------------------------------+-----------------------+----------------------+

Оптимальная гибридная стратегия

Ведущие инженерные команды не ограничиваются одной моделью, а выстраивают двухуровневый маршрутизатор (LLM Router):

  1. Уровень 1 (Массовые задачи и конфиденциальные данные): Направлять рутинную аналитику, извлечение сущностей, локальную генерацию кода на GPT-OSS 120B на собственных GPU (или Gemini 2.5 Flash для публичных микросервисов).
  2. Уровень 2 (Фронтирные исследования и видео): Передавать многочасовые видеозаписи, сложные олимпиадные задачи и аудит репозиториев на сотни тысяч токенов на Gemini 3 Pro (или GPT 5.2).

Такая архитектура гарантирует 100% суверенитет над ключевыми данными компании, одновременно открывая доступ к максимальному уровню интеллекта там, где это критически необходимо.

← Все статьи
0 / 4
Сравнить →