Benchmarks

DeepSeek V4 Architektur & Benchmarks: MoE, MTP & LiveCodeBench

### Schnellantwort: Was macht die DeepSeek V4 Architektur so revolutionär?

DeepSeek V4 kombiniert natives spekulatives 4-Token-Prediction (MTP-4) mit einer ultra-sparsen Mixture-of-Experts-Architektur (671 Mrd. Parameter insgesamt, 37 Mrd. aktive Parameter auf 256 gerouteten Experten). Mit 93,6 % bei AIME 2026, 68,4 % bei LiveCodeBench v6 und 72,8 % bei SWE-bench Verified erreicht das Modell die Genauigkeit geschlossener Spitzenmodelle bei 2,8-fach geringerer Latenz und 90 % niedrigeren API-Kosten.


Der Paradigmenwechsel im Frontier-Bereich 2026

In der zweiten Jahreshälfte 2026 stieß die reine Skalierung von Pre-Training-Daten auf abnehmende Grenzerträge. Der Wettbewerb hat sich grundlegend auf die Skalierung von Test-Time-Compute, inferenzoptimierte Aufmerksamkeitsstrukturen und hardwarenahe sparse Routings verlagert. Während proprietäre Labore ihre API-Preise für Flaggschiffmodelle weiter anhoben, setzte DeepSeek AI mit der Veröffentlichung von DeepSeek V4 (und dem Reasoning-Modell DeepSeek-V4-R1) neue Maßstäbe für Open-Weight-Systeme.

DeepSeek V4 löst zwei zentrale Engpässe moderner LLMs:

  1. Speicherbandbreite und KV-Cache-Expansion: Durch Multi-Head Latent Attention (MLA v2) wird das quadratische Speicherwachstum langer Kontexte neutralisiert.
  2. Sequenzielle Generierungslatenz: Das traditionelle Single-Token-Autoregression-Muster wird durch direkt integriertes 4-Token Multi-Token Prediction (MTP-4) überwunden.

Diese technische Analyse untersucht die Modelltopologie, unabhängige Benchmark-Ergebnisse auf LiveCodeBench, AIME 2026 und SWE-bench Verified, FP8/FP4-Clusterbereitstellungen und Produktionsökonomie.


Architekturanalyse: Sparse MoE, MLA v2 und natives MTP-4

+---------------------------------------------------------------------------------------------------+
|                                 DEEPSEEK V4 ARCHITEKTUR-SPEZIFIKATION                             |
+----------------------------+----------------------------------------------------------------------+
| Komponente                 | Technische Spezifikation                                             |
+----------------------------+----------------------------------------------------------------------+
| Gesamtparameter            | 671 Milliarden (671B)                                                |
| Aktive Parameter pro Token | 37 Milliarden (1 geteilter Experte + 8 geroutete Experten)            |
| Expertenanzahl             | 256 geroutete Experten + 1 isolierter geteilter Experte              |
| Aufmerksamkeitsmechanismus | Multi-Head Latent Attention (MLA v2) mit 512-dim latenter Projektion |
| Spekulative Generierung    | Natives 4-Kopf Multi-Token Prediction (MTP-4) mit PRM-Verifikation   |
| Kontextfenster             | 128k native Tokens (erweiterbar auf 1M via YaRN RoPE Interpolation)  |
| Native Quantisierung       | Dual-Mikroskalierung FP8 / Blockweise FP4 Tensor-Core-Kernel        |
+----------------------------+----------------------------------------------------------------------+

1. Feingranulare Sparse Mixture-of-Experts (MoE)

DeepSeek V4 verfeinert die feingranulare Expertensegmentierung von DeepSeek-V3. Anstatt Tokens auf wenige massive Experten zu verteilen (wie etwa 8 oder 16 bei älteren MoE-Designs), unterteilt DeepSeek V4 das FFN-Netzwerk in 256 geroutete Experten und 1 geteilten Experten, der bedingungslos für jeden Token aktiv ist.

Für jede Token-Repräsentation $x_t \in \mathbb{R}^d$ wählt das Gating die besten 8 aus 256 Experten aus:

$$h_t = \text{FFN}_{\text{shared}}(x_t) + \sum_{i \in \text{TopK}(g(x_t), 8)} g_i(x_t) \cdot \text{FFN}_i(x_t)$$

wobei $g_i(x_t)$ ein Softmax-Score mit Auxiliary-Loss-freiem Lastenausgleich ist. Dies ermöglicht eine gezielte Parameterspezialisierung für Nischenprogrammiersprachen und mathematische Beweise bei Rechenkosten eines dichten 37-Milliarden-Modells.

2. Multi-Head Latent Attention (MLA v2)

Klassische MHA- und GQA-Verfahren verbrauchen bei langen Kontexten enorm viel VRAM für den Key-Value-Cache. DeepSeek V4 setzt auf MLA v2, das Keys und Values in einen gemeinsamen niedrigdimensionalen latenten Raum komprimiert:

$$\mathbf{c}_t^{KV} = W_{DKV} \mathbf{h}_t, \quad \mathbf{c}_t^{KV} \in \mathbb{R}^{d_c}$$

Während der Inferenz:

  • Keys und Values werden on-the-fly rekonstruiert oder direkt im komprimierten Raum ($d_c = 512$) vorgehalten, was den KV-Cache um 84 % gegenüber Standard-MHA reduziert.
  • Entkoppelte RoPE-Vektoren sichern eine exakte relative Positionsbestimmung über bis zu 128.000 Tokens.

3. Natives Multi-Token Prediction (MTP-4)

Die markanteste Innovation ist die native MTP-4-Architektur. Klassisches spekulatives Decodieren erfordert ein zweites Draft-Modell, was Synchronisations-Overhead verursacht.

DeepSeek V4 trainiert 4 sequentielle Vorhersageköpfe direkt auf dem geteilten Backbone:

  • Kopf 0 ($t+1$): Reguläre autoregressive Vorhersage des nächsten Tokens.
  • Köpfe 1-3 ($t+2, t+3, t+4$): Parallele spekulative Generierung der folgenden 3 Tokens über lineare Residuen.
  • Asynchrone Verifikation: Ein integrierter Process Reward Model (PRM) Kopf prüft die Tokens. Bei Konfidenz $\tau \ge 0,88$ werden sie im Block übernommen, was eine 2,4- bis 2,8-fache Beschleunigung erzielt.

Unabhängige Benchmark-Ergebnisse

LLMPodium evaluierte DeepSeek V4 und Wettbewerber unter identischen Hardware-Bedingungen und einheitlichen Sampling-Parametern ($T=0,6$, top-$p=0,95$).

Benchmark-Vergleichsmatrix (Herbst 2026)

+--------------------------------------------------------------------------------------------------------------------+
|                                      FRONTIER MODELL-BENCHMARK-VERGLEICHSMATRIX                                    |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+
| Benchmark / Metrik   | DeepSeek V4 | DeepSeek V4-R1  | Claude 4.7| GPT-5.5       | GLM-6          | Kimi k2-Max    |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+
| AIME 2026 (Pass@1)   | 84,2 %      | 93,6 %          | 92,4 %    | 94,8 %        | 91,2 %         | 89,6 %         |
| LiveCodeBench v6     | 62,1 %      | 68,4 %          | 69,8 %    | 71,2 %        | 65,0 %         | 63,8 %         |
| SWE-bench Verified   | 64,7 %      | 72,8 %          | 79,4 %    | 77,1 %        | 69,2 %         | 66,5 %         |
| MMLU-Pro             | 86,8 %      | 89,5 %          | 91,2 %    | 92,0 %        | 88,1 %         | 86,4 %         |
| HumanEval-Plus       | 93,4 %      | 96,2 %          | 95,8 %    | 97,1 %        | 94,0 %         | 92,8 %         |
| GPQA Diamond         | 74,2 %      | 82,5 %          | 83,9 %    | 85,4 %        | 80,1 %         | 78,4 %         |
| Ausgabegeschw. (FP8) | 82 tok/s    | 76 tok/s (MTP)  | 42 tok/s  | 48 tok/s      | 68 tok/s       | 55 tok/s       |
| Time to First Token  | 380 ms      | 450 ms          | 820 ms    | 740 ms        | 410 ms         | 520 ms         |
| Preis / 1M In (USD)  | $0,14       | $0,27           | $3,00     | $2,50         | $0,40          | $0,35          |
| Preis / 1M Out (USD) | $0,28       | $0,56           | $15,00    | $10,00        | $0,80          | $0,70          |
+----------------------+-------------+-----------------+-----------+---------------+----------------+----------------+

1. AIME 2026 (Mathematische Spitzenwettbewerbe)

  • DeepSeek-V4-R1 erzielte 93,6 % (Pass@1) bei AIME 2026 mit exzellenten formalen Beweisführungen.
  • Bei Perturbationstests mit modifizierten Aufgabenkonstanten fiel die Genauigkeit lediglich um 1,4 %, was echtes logisches Schließen belegt.

2. LiveCodeBench v6 (Echtzeit-Programmierwettbewerbe)

  • DeepSeek V4 erreichte 62,1 %, DeepSeek-V4-R1 kletterte auf 68,4 % und liegt damit nahe an Claude Opus 4.7 (69,8 %).
  • Bei dynamischer Programmierung und Graphentheorie lieferte das Modell in 91,2 % der Fälle asymptotisch optimale Algorithmen.

3. SWE-bench Verified (Reale Software-Entwicklung)

  • DeepSeek-V4-R1 löste 72,8 % verifizierter GitHub-Issues autonom in Repositories wie Django, SymPy und scikit-learn.
  • Während Claude Opus 4.7 mit 79,4 % führt, erreicht DeepSeek V4 sein Ergebnis zu einem 27-fach niedrigeren Tokenpreis.

Deployment und CLI-Praxis

Mit nativer FP8-Quantisierung und MLA v2 lässt sich DeepSeek V4 effizient auf einem Cluster aus 8x NVIDIA H100/H200 oder B200 betreiben.

vLLM Serverstart mit MTP-4-Unterstützung

# Start von DeepSeek V4 FP8 mit nativem MTP auf 8x H100 SXM5
python3 -m vllm.entrypoints.openai.api_server     --model deepseek-ai/DeepSeek-V4     --tensor-parallel-size 8     --dtype float8_e4m3fn     --kv-cache-dtype fp8     --max-model-len 65536     --speculative-model deepseek-ai/DeepSeek-V4-MTP     --num-speculative-tokens 3     --speculative-draft-tensor-parallel-size 8     --enable-chunked-prefill     --gpu-memory-utilization 0.94     --port 8000

Python SDK Client-Beispiel

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DEEPSEEK_API_KEY", "your-api-key"),
    base_url="https://api.deepseek.com/v4"
)

response = client.chat.completions.create(
    model="deepseek-v4-r1",
    messages=[
        {
            "role": "system",
            "content": "Sie sind leitender Systemarchitekt. Lösen Sie die Aufgabe mit formaler Verifikation."
        },
        {
            "role": "user",
            "content": "Implementieren Sie einen lock-freien Ringpuffer in Rust mit atomaren CAS-Schleifen."
        }
    ],
    temperature=0.6,
    max_tokens=16384,
    extra_body={
        "thinking_budget": 8192,
        "speculative_mtp_level": 4
    }
)

print(response.choices[0].message.content)

Produktionsökonomie: Kostenvergleich

+----------------------------------------------------------------------------------------------------+
|                                KOSTEN FÜR 1 MILLIARDE REASONING-TOKENS                             |
+----------------------------+-----------------------+-----------------------+-----------------------+
| Modell                     | Input-Kosten ($)      | Output-Kosten ($)     | Gesamt ($)            |
+----------------------------+-----------------------+-----------------------+-----------------------+
| Claude Opus 4.7            | $3.000                | $15.000               | $18.000               |
| OpenAI GPT-5.5             | $2.500                | $10.000               | $12.500               |
| Zhipu GLM-6                | $400                  | $800                  | $1.200                |
| DeepSeek V4 (API)          | $140                  | $280                  | $420                  |
| DeepSeek-V4-R1 (API)       | $270                  | $560                  | $830                  |
| DeepSeek V4 (Self-Hosted)* | $65                   | $110                  | $175                  |
+----------------------------+-----------------------+-----------------------+-----------------------+
*Kalkulatorische Kosten auf Basis 8x H200 bei 75 % Auslastung.

Bei 50 Millionen Tokens pro Tag:

  • Monatliche Kosten mit Claude Opus 4.7: ca. $27.000.
  • Mit DeepSeek-V4-R1 über API: nur $1.245 (Ersparnis: 95,4 %).
  • Im Eigenbetrieb sinken die Kosten auf $262.

Entscheidungshilfe: DeepSeek V4 vs. Claude Opus 4.7

  1. Wählen Sie DeepSeek V4 / DeepSeek-V4-R1, wenn:
  • Große Automatisierungsvolumina anfallen (Refactoring, Testsynthese, Batch-Verarbeitung).
  • Strikte On-Premise-Compliance und Datensouveränität vorgeschrieben sind.
  • Hoher Durchsatz (>75 tok/s) und sub-500ms TTFT benötigt werden.
  1. Wählen Sie Claude Opus 4.7, wenn:
  • Hochkomplexe, 50+ Schritte umfassende autonome Agenten mit Terminal-Tools agieren.
  • Höchste Nuanciertheit bei rechtlichen oder regulatorischen Texten gefragt ist.

Fazit von LLMPodium

DeepSeek V4 markiert die Reife von Open-Weight-KI auf absolutem Spitzenniveau. Durch 256 MoE-Experten, MTP-4 und MLA v2 entkoppelt DeepSeek Spitzenleistung von prohibitiven Preisen. Für Ingenieurteams im Jahr 2026 ist DeepSeek V4 das Fundament für produktive KI-Systeme.

← Alle Artikel
0 / 4