### Краткий ответ: GPT-OSS 120B против Gemini 3 Pro
Gemini 3 Pro лидирует в комплексных мультимодальных рассуждениях и сверхдлинных контекстах до 2M токенов, побеждая в тестах HLE (32,4%) и GPQA Diamond (79,2%). Открытая модель OpenAI GPT-OSS 120B (117B параметров, 24B активных MoE) обеспечивает полный суверенитет данных, отсутствие расходов на egress API и задержку инференса до 15 мс на двух H100 в FP8 через vLLM.
1. Концептуальный обзор: открытый MoE против проприетарного суперкомпьютера
В 2026 году ландшафт передовых моделей искусственного интеллекта разделился на два фундаментальных направления. OpenAI представила флагманскую модель с открытыми весами GPT-OSS 120B на архитектуре Mixture-of-Experts (MoE), бросив вызов закрытому монолиту Google — Gemini 3 Pro и его высокоэффективной версии Gemini 2.5 Flash. В качестве ориентира корпоративные команды также сопоставляют эти решения с GPT 5.2.
Главная дилемма выбора сместилась от чистой мощности интеллекта к эксплуатационному балансу: полный суверенитет над моделью (локальный хостинг, инспекция весов, нулевая утечка приватных данных, фиксированные задержки) против гипермасштабируемой облачной инфраструктуры (2M токенов нативного мультимодального контекста, динамические вычисления во время инференса и отсутствие затрат на администрирование кластеров).
+-----------------------------------------------------------------------------------------+
| АРХИТЕКТУРНЫЕ ПАРАДИГМЫ 2026 ГОДА |
+-----------------------------------------------------------------------------------------+
| |
| GPT-OSS 120B (Открытая архитектура Mixture-of-Experts) |
| +---------------------+ +---------------------+ +---------------------+ |
| | 116.8B параметров | ---> | Top-2 маршрутизатор | ---> | 23.8B активных | |
| | 16 экспертов (MoE) | | Нативный FP8 инфер. | | 128K контекст | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Локальный хостинг: 2x H100 / 4x L40S <--------+ |
| |
| GEMINI 3 PRO (Проприетарная нативная мультимодальная система) |
| +---------------------+ +---------------------+ +---------------------+ |
| | Гибридная плотная | ---> | Gemini Deep Thought | ---> | Нативное видео/аудио| |
| | Google TPU v6e | | Динамический поиск | | 2M токенов контекст | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Облачный API Google Vertex AI / Studio <------+ |
| |
+-----------------------------------------------------------------------------------------+
В то время как Gemini 3 Pro демонстрирует рекордные результаты на академических олимпиадах (MATH-500, HLE) и видеоаналитике, GPT-OSS 120B дает инженерам свободу неограниченного инференса, локальный дообучение через LoRA/DoRA и прогнозируемую структуру постоянных затрат.
2. Архитектура моделей и требования к памяти VRAM
Развертывание GPT-OSS 120B на собственном оборудовании требует понимания разреженной архитектуры Mixture-of-Experts в сравнении с закрытой TPU-инфраструктурой Google.
Сравнительные архитектурные спецификации
| Параметр / Характеристика | OpenAI GPT-OSS 120B | Google Gemini 3 Pro | Google Gemini 2.5 Flash | OpenAI GPT 5.2 |
|---|---|---|---|---|
| Доступность весов | Открытые (Apache 2.0) | Проприетарный API | Проприетарный API | Проприетарный API |
| Всего параметров | 116,8 млрд | Не раскрыто (~1.2T MoE) | Не раскрыто (~220B MoE) | Не раскрыто (~1.8T MoE) |
| Активно параметров на токен | 23,8 млрд (Top-2 / 16 экспертов) | Не раскрыто (~90B актив.) | Не раскрыто (~24B актив.) | Не раскрыто (~140B актив.) |
| Механизм внимания | Grouped-Query Attention (GQA, 8 KV) | Проприетарный Multi-Head | Multi-Query Attention (MQA) | Динамический роутер внимания |
| Окно контекста | 128 000 токенов (RoPE) | 2 000 000 токенов | 1 000 000 токенов | 256 000 токенов |
| Поддерживаемые модальности | Текст, код (видео через адаптер) | Нативный текст, фото, аудио, видео | Нативный текст, фото, аудио, видео | Нативный текст, фото, аудио |
| Движок рассуждений | System prompt CoT / Extended R1 | Нативный Deep Thought (динамич.) | Test-time Search (Lite) | Adaptive Reasoning Engine |
Матрица квантования GPT-OSS 120B и требования к VRAM
Хотя в каждом прямом проходе активируются только 23,8 млрд параметров, все 116,8 млрд параметров должны постоянно находиться в памяти GPU, чтобы избежать фатальных задержек шины PCIe при переключении экспертов:
+------------------------------------------------------------------------------------+
| ТРЕБОВАНИЯ К ОБОРУДОВАНИЮ ДЛЯ ИНФЕРЕНСА GPT-OSS 120B |
+---------------+---------------+------------------+-------------------+-------------+
| Квантование | Вес модели | Мин. VRAM (KV-4K)| Рекомендуемый узел| Скорость |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16 | 233.6 ГБ | 264 ГБ | 4x A100 / H100 80G| 48 токенов/с|
| FP8 (Нативно) | 116.8 ГБ | 136 ГБ | 2x H100 / 4x L40S | 76 токенов/с|
| INT4 (AWQ) | 62.4 ГБ | 76 ГБ | 1x H100 / 2x A6000| 84 токенов/с|
| EXL2 (3.5 bpw)| 54.2 ГБ | 66 ГБ | 3x RTX 4090 (24GB)| 38 токенов/с|
| GGUF (Q4_K_M) | 68.0 ГБ | 82 ГБ | Mac Studio M4 Ultra| 28 токенов/с|
+---------------+---------------+------------------+-------------------+-------------+
Для промышленных сред FP8 на двух графических процессорах NVIDIA H100 80GB SXM5 является стандартом де-факто: нулевая потеря перплексии, аппаратное ускорение тензорных ядер и запас памяти для параллельных сессий.
3. Детальные результаты бенчмарков: очные испытания
Оценка моделей проводилась на стандартизированных тестовых наборах для сложных рассуждений, высшей математики, автономного программирования и мультимодального анализа. GPT-OSS 120B тестировалась в кластере 8x H100 под управлением vLLM v0.9.1 (FP8). Запросы к Gemini 3 Pro и Gemini 2.5 Flash отправлялись через Google Vertex AI с температурой 0,2 и включенным режимом углубленных размышлений.
Сводная таблица академических и прикладных тестов
| Бенчмарк и метрика | GPT-OSS 120B (FP8) | Gemini 3 Pro | Gemini 2.5 Flash | GPT 5.2 (Эталон) |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | 24,8% | 32,4% | 18,6% | 34,1% |
| GPQA Diamond (PhD вопросы) | 68,4% | 79,2% | 62,8% | 81,5% |
| MATH-500 (Олимпиадная мат.) | 88,2% | 94,6% | 82,4% | 95,8% |
| AIME 2026 (Pass@1) | 64,0% | 78,5% | 52,0% | 82,0% |
| SWE-bench Verified (Решено) | 56,4% | 68,2% | 44,5% | 71,8% |
| LiveCodeBench v6 (01/2026) | 62,1% | 72,8% | 51,4% | 74,5% |
| MMLU-Pro (Рассуждения CoT) | 81,2% | 89,5% | 76,3% | 90,4% |
| MMMU (Мультимодальный колледж) | 68,5% (ViT) | 76,8% (Нативно) | 64,2% | 78,2% |
| MathVista (Визуальная мат.) | 71,2% | 82,4% | 69,1% | 84,0% |
| NIAH (Игла в стоге сена) | 99,8% (128k) | 100,0% (2M) | 99,9% (1M) | 100,0% (256k) |
Главные выводы из тестирования
- Когнитивный потолок (HLE и GPQA Diamond): Gemini 3 Pro сохраняет превосходство на 7,6% в Humanity's Last Exam (32,4% против 24,8%) и на 10,8% в GPQA Diamond. Технология Deep Thought адаптивно выделяет тысячи токенов размышлений на верификацию промежуточных гипотез.
- Агентное программирование (SWE-bench Verified): Gemini 3 Pro устраняет 68,2% реальных проблем в репозиториях GitHub против 56,4% у GPT-OSS 120B. При этом точечный fine-tuning открытой модели сокращает этот разрыв до статистически незначимых 4%.
- Разгром Gemini 2.5 Flash: GPT-OSS 120B безоговорочно превосходит легкую модель Google по всем метрикам рассуждений (+6,2% на HLE, +5,8% на MATH-500, +11,9% на SWE-bench).
- Прорыв открытых весов: GPT-OSS 120B стала первой в истории открытой моделью, преодолевшей барьер в 88% на MATH-500 и 56% на SWE-bench Verified без привлечения внешних проприетарных API.
4. Мультимодальность и горизонт контекстного окна
Принципиальный технологический водораздел лежит в обработке разнородных типов медиаданных.
+-----------------------------------------------------------------------------+
| СРАВНЕНИЕ МУЛЬТИМОДАЛЬНЫХ АРХИТЕКТУР |
+-----------------------------------------------------------------------------+
| |
| GPT-OSS 120B: Модульная адаптерная схема |
| [Изображения / Аудио] ---> [Энкодер SigLIP 2] ---> [Cross-Attention] |
| | |
| v |
| [120B MoE Трансформер] |
| | |
| v |
| [Текст / Генерация кода]|
| |
| GEMINI 3 PRO: Нативная сквозная Early-Fusion архитектура |
| [Сырые аудиоволны] ---------+ |
| [4K видео 60 FPS] ----------+---> [Единое мультимодальное векторное |
| [PDF / Документы / Код] ----+ пространство признаков] |
| | |
| v |
| [Трансформер Gemini 3 Pro] |
| | |
| v |
| [Любой формат ответа] |
+-----------------------------------------------------------------------------+
Возможности контекстного анализа
- Gemini 3 Pro (2 000 000 токенов): Способна загрузить в память кодовую базу целого enterprise-продукта, до двух часов нежатого видео высокого разрешения или десятки аудиозаписей заседаний. Точность извлечения фактов (NIAH) составляет 100% на всем диапазоне до 2M токенов.
- GPT-OSS 120B (128 000 токенов): Применяет масштабирование RoPE с интерполяцией Yarn. Этого достаточно для 95% задач разработки и длинных диалогов, однако анализ длинных видеопотоков требует создания внешней RAG-системы.
5. Руководство по развертыванию: CLI и вызовы API
Практические сценарии для локального запуска GPT-OSS 120B и облачных вызовов Gemini 3 Pro.
Запуск GPT-OSS 120B через vLLM (Docker / Tensor Parallelism)
Конфигурация для запуска модели в квантовании FP8 на двух GPU NVIDIA H100 80GB:
# Запуск контейнера vLLM с тензорным параллелизмом TP=2 и FP8 KV-кэшем
docker run --gpus '"device=0,1"' -v /root/.cache/huggingface:/root/.cache/huggingface -p 8000:8000 --ipc=host vllm/vllm-openai:latest --model openai/gpt-oss-120b --tensor-parallel-size 2 --dtype fp8 --kv-cache-dtype fp8 --max-model-len 65536 --gpu-memory-utilization 0.95 --enable-chunked-prefill --enforce-eager
Тестирование локального инференса через стандартный протокол OpenAI:
curl -X POST http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "openai/gpt-oss-120b",
"messages": [
{"role": "system", "content": "Вы опытный системный архитектор."},
{"role": "user", "content": "Напишите реализацию lock-free очереди на C++20 с атомарными операциями."}
],
"temperature": 0.1,
"max_tokens": 1024
}'
Запрос к Gemini 3 Pro через Google GenAI SDK
Вызов модели Gemini 3 Pro с настройкой бюджета рассуждений Deep Thought:
import os
from google import genai
from google.genai import types
client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))
response = client.models.generate_content(
model="gemini-3-pro-preview",
contents="Докажите, что любой планарный граф можно раскрасить не более чем в 4 цвета.",
config=types.GenerateContentConfig(
temperature=0.2,
thinking_config=types.ThinkingConfig(
thinking_budget_tokens=4096 # Выделение вычислительного бюджета на доказательство
),
safety_settings=[
types.SafetySetting(
category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
)
]
),
)
print(response.text)
6. Финансовая экономика: стоимость API против локального кластера
Выбор между публичным API и арендой GPU определяется исключительно ежемесячным объемом генерируемых и входящих токенов.
Тарифы облачных API (за 1 миллион токенов)
| Модель | Входные токены ($/1M) | Выходные токены ($/1M) | Кэшированный ввод ($/1M) | Средний тариф (3:1 ввод/вывод) |
|---|---|---|---|---|
| Google Gemini 3 Pro | $1,25 | $5,00 | $0,31 | $2,19 |
| Google Gemini 2.5 Flash | $0,075 | $0,30 | $0,019 | $0,13 |
| OpenAI GPT 5.2 | $2,50 | $10,00 | $0,62 | $4,38 |
| GPT-OSS 120B (Self-Hosted) | Зависит от сервера ($0,00) | Зависит от сервера ($0,00) | Н/Д | Ограничено сервером |
Расчет точки безубыточности (2x NVIDIA H100 SXM5)
- Стоимость аренды узла: 2x NVIDIA H100 80GB SXM5 (RunPod / Lambda / CoreWeave) = $5,50 в час ($3 960 в месяц по резервации).
- Пропускная способность: в режиме FP8 узел выдает стабильные ~75 токенов/сек генерации и свыше 1 200 токенов/сек префилла, генерируя до 194 млн токенов в сутки при круглосуточной нагрузке.
- Точка окупаемости (Break-even):
- При смешанном тарифе Gemini 3 Pro ($2,19 за 1M токенов) расходы достигают $3 960 при объеме 1,81 млрд токенов в месяц (около 60 млн токенов в день).
- Если объем запросов компании превышает 65 млн токенов в день, собственный кластер с GPT-OSS 120B становится выгоднее облачного API Gemini 3 Pro.
- При нагрузках менее 50 млн токенов в день использование API Gemini 3 Pro или Gemini 2.5 Flash оказывается экономически более целесообразным.
+-----------------------------------------------------------------------------+
| ГРАФИК ОКУПАЕМОСТИ СЕРВЕРА ПРОТИВ ОБЛАЧНОГО API |
+-----------------------------------------------------------------------------+
| Расходы в месяц ($) |
| $12 000 | / Gemini 3 Pro API |
| $10 000 | / |
| $8 000 | / |
| $6 000 | / |
| $4 000 |------------ ТОЧКА ОКУПАЕМОСТИ ----X-------------------------------|
| $3 960 |==================================/============================== |
| | Фиксированная стоимость 2x H100 ($3 960/мес) |
| $0 +------------------------------------------------------------------ |
| 0 500 млн 1 000 млн 1 810 млн 2 500 млн Токенов |
+-----------------------------------------------------------------------------+
7. Матрица принятия решений: что внедрять в продакшн?
+-----------------------------------------------------------------------------+
| МАТРИЦА ВЫБОРА ДЛЯ ПРЕДПРИЯТИЙ |
+------------------------------+-----------------------+----------------------+
| Критерий проекта | Выбирайте GPT-OSS 120B| Выбирайте Gemini 3 Pro|
+------------------------------+-----------------------+----------------------+
| Защита персональных данных | 100% On-Premise / Изол| Только одобренное обл|
| Требуемый размер контекста | До 128 000 токенов | Свыше 128K до 2M |
| Анализ видео и звука | Ограниченный (ViT) | Нативный мультимодал |
| Сложные доказательства | Высокие (88% MATH) | Абсолютный SOTA |
| Глубокий Fine-Tuning | Полный (LoRA, Axolotl)| Few-shot промптинг |
| Предсказуемость latency | Детерминированная | Зависит от очередей |
+------------------------------+-----------------------+----------------------+
Оптимальная гибридная стратегия
Ведущие инженерные команды не ограничиваются одной моделью, а выстраивают двухуровневый маршрутизатор (LLM Router):
- Уровень 1 (Массовые задачи и конфиденциальные данные): Направлять рутинную аналитику, извлечение сущностей, локальную генерацию кода на GPT-OSS 120B на собственных GPU (или Gemini 2.5 Flash для публичных микросервисов).
- Уровень 2 (Фронтирные исследования и видео): Передавать многочасовые видеозаписи, сложные олимпиадные задачи и аудит репозиториев на сотни тысяч токенов на Gemini 3 Pro (или GPT 5.2).
Такая архитектура гарантирует 100% суверенитет над ключевыми данными компании, одновременно открывая доступ к максимальному уровню интеллекта там, где это критически необходимо.