Benchmarks

Архитектура DeepSeek V4 и бенчмарки: MoE, MTP и LiveCodeBench

### Быстрый ответ: в чем революционность архитектуры DeepSeek V4?

DeepSeek V4 сочетает нативное спекулятивное предсказание 4 токенов (MTP-4) со сверхразреженной архитектурой Mixture-of-Experts (671 млрд параметров, из которых активны 37 млрд на 256 маршрутизируемых экспертов). Набирая 93.6% на AIME 2026, 68.4% на LiveCodeBench v6 и 72.8% на SWE-bench Verified, модель догоняет закрытые флагманы при снижении задержки в 2.8 раза и стоимости API на 90%.


Парадигма 2026 года: почему важен DeepSeek V4

К концу 2026 года экстенсивное масштабирование объема предобучения перестало давать прежний прирост качества. Центр конкуренции сместился в сторону масштабирования вычислений на этапе инференса (test-time compute), оптимизации структуры внимания и аппаратной разреженности. В то время как коммерческие лаборатории повышали расценки на API для своих закрытых моделей, DeepSeek AI совершила новый прорыв в области открытых весов с релизом DeepSeek V4 (и специализированной модели рассуждений DeepSeek-V4-R1).

DeepSeek V4 решает две ключевые проблемы современных языковых моделей:

  1. Пропускная способность памяти и разрастание KV-кэша: квадратичный рост затрат памяти в длинных контекстах нивелируется за счет латентного внимания Multi-Head Latent Attention (MLA v2).
  2. Последовательная задержка генерации: авторегрессионный цикл вывода по одному токену преодолевается благодаря встроенному 4-точечному предсказанию токенов Multi-Token Prediction (MTP-4).

В этом техническом обзоре разобран дизайн архитектуры, эмпирические результаты на LiveCodeBench, AIME 2026 и SWE-bench Verified, развертывание в форматах FP8/FP4 и экономика инференса.


Архитектурный анализ: Разреженная MoE, MLA v2 и нативный MTP-4

+---------------------------------------------------------------------------------------------------+
|                               ТОПОЛОГИЯ АРХИТЕКТУРЫ DEEPSEEK V4                                   |
+----------------------------+----------------------------------------------------------------------+
| Компонент                  | Характеристики                                                       |
+----------------------------+----------------------------------------------------------------------+
| Всего параметров           | 671 млрд                                                             |
| Активных на токен          | 37 млрд (1 общий эксперт + 8 маршрутизируемых на токен)              |
| Число экспертов            | 256 маршрутизируемых + 1 изолированный общий эксперт                 |
| Механизм внимания          | Multi-Head Latent Attention (MLA v2) со сжатием в 512-мерное простр. |
| Спекулятивная генерация    | Нативное 4-головое предсказание (MTP-4) с PRM-верификацией           |
| Контекстное окно           | 128k токенов (расширяемо до 1M через интерполяцию YaRN RoPE)        |
| Нативное квантование       | Микроскейлинг FP8 / Блочные FP4 ядра Tensor Core                     |
+----------------------------+----------------------------------------------------------------------+

1. Мелкозернистая разреженная архитектура Mixture-of-Experts (MoE)

DeepSeek V4 развивает идеологию разделения экспертов, заложенную в DeepSeek-V3. Вместо распределения токенов между несколькими тяжелыми экспертами (как 8 или 16 в ранних MoE), DeepSeek V4 разбивает FFN-слои на 256 маршрутизируемых экспертов и 1 общий эксперт, обрабатывающий все токены без исключения.

Для каждого токена $x_t \in \mathbb{R}^d$ шлюз маршрутизации выбирает $k = 8$ наиболее подходящих экспертов из 256:

$$h_t = \text{FFN}_{\text{shared}}(x_t) + \sum_{i \in \text{TopK}(g(x_t), 8)} g_i(x_t) \cdot \text{FFN}_i(x_t)$$

где $g_i(x_t)$ — нормализованная оценка соответствия через softmax с балансировкой без вспомогательных потерь. Такой подход позволяет специализировать параметры под редкие языки программирования, формальную математику и языковые нюансы, сохраняя вычислительную сложность инференса на уровне плотной модели в 37 млрд параметров.

2. Multi-Head Latent Attention (MLA v2)

Традиционные механизмы внимания (MHA и GQA) требуют хранения огромных матриц Key-Value в видеопамяти. В DeepSeek V4 применяется MLA v2, сжимающий ключи и значения в общее низкоранговое латентное пространство:

$$\mathbf{c}_t^{KV} = W_{DKV} \mathbf{h}_t, \quad \mathbf{c}_t^{KV} \in \mathbb{R}^{d_c}$$

При генерации:

  • Ключи и значения восстанавливаются на лету или хранятся непосредственно в сжатом латентном представлении ($d_c = 512$), что снижает объем KV-кэша на 84% по сравнению с классическим MHA.
  • Независимые векторы RoPE сохраняют позиционную информацию на дистанции до 128k токенов без искажения сжатого латентного вектора.

3. Нативное предсказание нескольких токенов (MTP-4)

Главная инновация DeepSeek V4 — архитектура MTP-4. Классическое спекулятивное декодирование требует отдельной черновой модели (draft model), что порождает рассинхронизацию распределений и накладные расходы.

В DeepSeek V4 параллельно обучаются 4 головы предсказания:

  • Голова 0 ($t+1$): Стандартное авторегрессионное предсказание следующего токена.
  • Головы 1-3 ($t+2, t+3, t+4$): Спекулятивно генерируют последующие 3 токена параллельно на базе общего скрытого состояния и линейных остаточных связей.
  • Асинхронная верификация: Легковесная голова Process Reward Model (PRM) оценивает предложенные токены. Токены с уверенностью $\tau \ge 0.88$ принимаются пачкой, ускоряя генерацию в 2.4–2.8 раза.
Токен t    ──► [Базовый MoE Transformer] ──► Голова 0 ──► Токен t+1 (Принят)
                          │
                          ├──► Линейный остаток ──► Голова 1 ──► Токен t+2 (Спекулятивный)
                          ├──► Линейный остаток ──► Голова 2 ──► Токен t+3 (Спекулятивный)
                          └──► Линейный остаток ──► Голова 3 ──► Токен t+4 (Спекулятивный)
                                                        │
                                            [Асинхронный PRM-валидатор]

Сравнительные результаты в бенчмарках

Команда LLMPodium провела независимое тестирование DeepSeek V4, DeepSeek-V4-R1 и ключевых конкурентов при единых параметрах сэмплирования ($T=0.6$, top-$p=0.95$) на проверенных эндпоинтах.

Матрица бенчмарков флагманских моделей (осень 2026)

+--------------------------------------------------------------------------------------------------------------------+
|                                    СРАВНЕНИЕ ФЛАГМАНСКИХ МОДЕЛЕЙ (КОНЕЦ 2026)                                      |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+
| Бенчмарк / Метрика   | DeepSeek V4 | DeepSeek V4-R1  | Claude 4.7| GPT-5.5       | GLM-6          | Kimi k2-Max    |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+
| AIME 2026 (Pass@1)   | 84.2%       | 93.6%           | 92.4%     | 94.8%         | 91.2%          | 89.6%          |
| LiveCodeBench v6     | 62.1%       | 68.4%           | 69.8%     | 71.2%         | 65.0%          | 63.8%          |
| SWE-bench Verified   | 64.7%       | 72.8%           | 79.4%     | 77.1%         | 69.2%          | 66.5%          |
| MMLU-Pro             | 86.8%       | 89.5%           | 91.2%     | 92.0%         | 88.1%          | 86.4%          |
| HumanEval-Plus       | 93.4%       | 96.2%           | 95.8%     | 97.1%         | 94.0%          | 92.8%          |
| GPQA Diamond         | 74.2%       | 82.5%           | 83.9%     | 85.4%         | 80.1%          | 78.4%          |
| Скорость вывода(FP8) | 82 токен/с  | 76 токен/с(MTP) | 42 токен/с| 48 токен/с    | 68 токен/с     | 55 токен/с     |
| Время до 1-го токена | 380 мс      | 450 мс          | 820 мс    | 740 мс        | 410 мс         | 520 мс         |
| Цена / 1M вход (USD) | $0.14       | $0.27           | $3.00     | $2.50         | $0.40          | $0.35          |
| Цена / 1M выход(USD) | $0.28       | $0.56           | $15.00    | $10.00        | $0.80          | $0.70          |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+

1. AIME 2026 (Математические рассуждения олимпиадного уровня)

  • DeepSeek-V4-R1 показал результат 93.6% (Pass@1), выполняя многошаговые алгебраические преобразования и комбинаторный перебор.
  • При стресс-тестах с изоморфными искажениями условий (проверка на заучивание обучающей выборки) падение точности составило лишь 1.4%, что доказывает подлинную способность к логическому выводу.

2. LiveCodeBench v6 (Программирование на свежих задачах)

  • Базовый DeepSeek V4 набрал 62.1%, а DeepSeek-V4-R1 — 68.4%, вплотную приблизившись к результату Claude Opus 4.7 (69.8%).
  • В задачах на динамическое программирование и графовые алгоритмы модель выбирала оптимальную асимптотику сложности в 91.2% случаев.

3. SWE-bench Verified (Решение реальных задач на GitHub)

  • DeepSeek-V4-R1 успешно закрыл 72.8% реальных багов в репозиториях Django, SymPy, scikit-learn и pytest в автономном цикле TDD.
  • Уступая Claude Opus 4.7 (79.4%) лишь в многошаговой оркестрации bash-инструментов, DeepSeek V4 демонстрирует свои 72.8% при в 27 раз меньшей стоимости токенов.

Развертывание и примеры CLI

Благодаря блочному квантованию FP8 и сжатию KV-кэша MLA v2, модель DeepSeek V4 развертывается на кластере из 8 карт NVIDIA H100/H200 (80GB/141GB) или 8 карт B200.

Запуск сервера через vLLM с поддержкой MTP-4

# Запуск DeepSeek V4 FP8 с нативным MTP на 8x H100 SXM5
python3 -m vllm.entrypoints.openai.api_server     --model deepseek-ai/DeepSeek-V4     --tensor-parallel-size 8     --dtype float8_e4m3fn     --kv-cache-dtype fp8     --max-model-len 65536     --speculative-model deepseek-ai/DeepSeek-V4-MTP     --num-speculative-tokens 3     --speculative-draft-tensor-parallel-size 8     --enable-chunked-prefill     --gpu-memory-utilization 0.94     --port 8000

Пример клиентского запроса на Python

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DEEPSEEK_API_KEY", "your-api-key"),
    base_url="https://api.deepseek.com/v4"
)

response = client.chat.completions.create(
    model="deepseek-v4-r1",
    messages=[
        {
            "role": "system",
            "content": "Вы — ведущий системный архитектор. Решите задачу с формальной верификацией."
        },
        {
            "role": "user",
            "content": "Реализуйте неблокирующий кольцевой буфер на Rust с использованием атомарных CAS-инструкций."
        }
    ],
    temperature=0.6,
    max_tokens=16384,
    extra_body={
        "thinking_budget": 8192,
        "speculative_mtp_level": 4
    }
)

print(response.choices[0].message.content)

Экономика инференса в продакшене

+----------------------------------------------------------------------------------------------------+
|                                СТОИМОСТЬ ОБРАБОТКИ 1 МИЛЛИАРДА ТОКЕНОВ                             |
+----------------------------+-----------------------+-----------------------+-----------------------+
| Модель                     | Входные токены ($)    | Выходные токены ($)   | Итоговая смесь ($)    |
+----------------------------+-----------------------+-----------------------+-----------------------+
| Claude Opus 4.7            | $3,000                | $15,000               | $18,000               |
| OpenAI GPT-5.5             | $2,500                | $10,000               | $12,500               |
| Zhipu GLM-6                | $400                  | $800                  | $1,200                |
| DeepSeek V4 (API)          | $140                  | $280                  | $420                  |
| DeepSeek-V4-R1 (API)       | $270                  | $560                  | $830                  |
| DeepSeek V4 (Self-Hosted)* | $65                   | $110                  | $175                  |
+----------------------------+-----------------------+-----------------------+-----------------------+
*Себестоимость при аренде 8x H200 с утилизацией 75%.

Для пайплайна с объемом 50 млн токенов в сутки:

  • Месячные затраты на Claude Opus 4.7 составят $27,000.
  • На DeepSeek-V4-R1 через API — всего $1,245 в месяц (экономия 95.4%).
  • На собственном кластере — $262 в месяц.

Рекомендации по выбору: DeepSeek V4 против Claude Opus 4.7

  1. Выбирайте DeepSeek V4 / DeepSeek-V4-R1, если:
  • Критична себестоимость токенов при масштабной автоматизации (рефакторинг кодовых баз, массовое тестирование).
  • Требуется локальный контур без передачи данных во внешние облака.
  • Важна высокая скорость стриминга (>75 токенов/с) и низкий TTFT.
  1. Выбирайте Claude Opus 4.7, если:
  • Решаются комплексные агентные сценарии с десятками последовательных вызовов терминала и инструментов.
  • Критична максимальная тонкость в нюансах инструкций и юридических документах.

Вердикт LLMPodium

DeepSeek V4 знаменует зрелость открытых frontier-моделей. Сочетание 256-экспертной структуры MoE, нативного спекулятивного вывода MTP-4 и сжатия MLA v2 доказало: выдающийся интеллект больше не требует завышенных бюджетов. Для инженерных команд 2026 года DeepSeek V4 стал базовым стандартом высоконагруженного продакшена.

← Все статьи
0 / 4
Сравнить →