Benchmarks

LLM-Kontextfenstergrößen & Needle-in-a-Haystack-Rangliste

### Schnelle Antwort: 1M+-Kontextfenster & Retrieval-Genauigkeit

Im Jahr 2026 sind Kontextfenster von über 1 Million Token mit Gemini 2.5 Flash (2M), Code-SuperNova (1M), Claude 3.7 Sonnet (200k–1M erweitert) und Kimi K2.5 (2M) voll einsatzbereit für die Produktion. Während Single-Key-Needle-in-a-Haystack-Werte (NIAH) bei allen vier Modellen über 99 % liegen, nimmt das assoziative Multi-Needle-Retrieval jenseits von 256k Token drastisch ab – mit Einbußen bei der Retrieval-Treue von 14 % bis 38 %, abhängig von der Abfragetiefe.


1. Überblick: Die Ära der 1M+-Token-Kontexte im Jahr 2026

Die Grenzen langer Kontexte bei Large Language Models haben sich grundlegend verschoben. Während 32k- und 128k-Fenster in den Jahren 2023–2024 noch architektonische Meilensteine darstellten, verarbeiten Produktionssysteme Ende 2026 routinemäßig ganze Git-Monorepositories, mehrjährige Finanzberichte und Hunderte juristischer Verträge in einem einzigen Prompt.

Angeführt wird diese architektonische Revolution von vier herausragenden Modellfamilien:

  1. Google Gemini 2.5 Flash & Pro (2M Token): Produktionspionier für native multimodale Verarbeitung von 2.097.152 Token mit linearem Attention-Routing und hardwarebeschleunigter TPU-v6e-Inferenz.
  2. Code-SuperNova 1M (1.048.576 Token): Spezialisiertes, entwicklerorientiertes Modell, vortrainiert auf AST-tokenisierten Multi-Repository-Graphen mit Fill-in-the-Middle-Fähigkeiten (FIM) über den gesamten Kontext.
  3. Anthropic Claude 3.7 Sonnet (200k nativ / 1M erweiterte Beta): Hybride Architektur, die dynamisches Thought-Budget-Reasoning parallel zu einem 1M-Token-Beta-Kontextfenster mit 90 % Prompt-Caching-Rabatt unterstützt.
  4. Moonshot AI Kimi K2.5 (2M Token): Natives zweisprachiges (Chinesisch/Englisch) Frontier-Modell für lange Kontexte, das RingAttention-Varianten und selektives, spärliches State-Space-Routing nutzt.

Die Bewerbung eines Kontextfensters von 1M oder 2M Token garantiert jedoch keineswegs, dass ein Modell Informationen, die in diesen Datenmengen verborgen sind, präzise extrahieren, logisch verknüpfen oder zusammenfassen kann. Die effektive Kontextnutzung wird durch die Degradationskurven synthetischer Needle In A Haystack (NIAH)-Benchmarks, Verluste bei dokumentübergreifenden Querverweisen, Speicherbandbreitenbeschränkungen und die harte wirtschaftliche Realität der Prompt-Ingestion-Kosten bestimmt.


2. Quantitative Matrix: Rangliste der 1M+-Kontextfenster

Die Evaluierung von Long-Context-Frontier-Modellen erfordert die Untersuchung von Single-Needle-Recall, Multi-Dokument-Synthese, Inferenzdurchsatz (Tokens Per Second, TPS), Time-to-First-Token (TTFT) und der Wirtschaftlichkeit des Prompt-Cachings.

Modell & Kontextfenster Single-Needle NIAH (1M) Multi-Needle NIAH (1M, 5 Needles) LiveCodeBench v6 (Long-Repo) TTFT @ 1M Tokens (p50) Output TPS Input Cost / 1M (Uncached) Input Cost / 1M (Cached) Output Cost / 1M
Gemini 2.5 Flash (2M) 99.8% 94.2% 66.4% 1.85s 148 tps $0.30 $0.075 $1.20
Code-SuperNova 1M (1M) 99.4% 95.1% 71.8% 2.40s 112 tps $0.80 $0.160 $3.20
Claude 3.7 Sonnet (1M Ext.) 99.6% 93.8% 71.2% 4.10s 78 tps $3.00 $0.300 $15.00
Kimi K2.5 (2M) 99.1% 89.6% 63.5% 2.90s 96 tps $0.25 $0.100 $1.00
GPT-4.1 (128k Baseline) 98.2% (@128k) 88.0% (@128k) 62.1% 1.20s 82 tps $2.50 $1.250 $10.00

Wichtige Beobachtungen aus dem Benchmark:

  • Code-SuperNova 1M erzielt die höchste Multi-Needle-Retention (95,1 %) und das beste LiveCodeBench-Ergebnis (71,8 %) in umfangreichen Repositories. Dies belegt, dass code-spezifisches AST-Attention-Masking syntaktische Abhängigkeiten über 1 Million Token hinweg aufrechterhält.
  • Gemini 2.5 Flash dominiert beim Bereitstellungsdurchsatz (148 TPS) und bei der extrem niedrigen TTFT (1,85 Sekunden bei 1 Million Token), angetrieben durch tiefgreifende TPU-v6e-Hardwareoptimierungen und subquadratische Attention-Layer.
  • Claude 3.7 Sonnet bietet die tiefste konzeptionelle Synthese und das beste Reasoning über dichte technische Dokumentationen hinweg, wenngleich die Kosten von 3,00 $ / 1M ungecacheter Input-Token strikte Prompt-Caching-Architekturen erfordern.
  • Kimi K2.5 bietet das aggressivste Basis-Pricing (0,25 $ Input / 1,00 $ Output pro Million Token) mit herausragendem zweisprachigem Chinesisch-Englisch-Retrieval bis zu 1M Token, zeigt jedoch ab 1,5M Token eine spürbare Multi-Needle-Degradation.

3. Detaillierte Analyse der Kandidaten

+---------------------------------------------------------------------------------------------------+
|                            ARCHITEKTURPROFILE FÜR 1M+ KONTEXTFENSTER                              |
+---------------------------------------------------------------------------------------------------+
| Modell                | Fenstergröße  | Attention-Mechanismus     | KV-Kompression / Sparsity     |
+-----------------------+---------------+---------------------------+-------------------------------+
| Gemini 2.5 Flash      | 2,097,152     | Linear-Hybrid + GQA       | Dynamic Latent KV Paging      |
| Code-SuperNova 1M     | 1,048,576     | Block-Sparse AST Attention| Chunked Sparse-FIM Cache      |
| Claude 3.7 Sonnet     | 1,000,000     | Extended RoPE + GQA       | Tiered Ephemeral KV Cache     |
| Kimi K2.5             | 2,097,152     | RingAttention + Dual-SSM  | Continuous State-Space Chunks |
+-----------------------+---------------+---------------------------+-------------------------------+

Google Gemini 2.5 Flash (2M Tokens)

Gemini 2.5 Flash repräsentiert Googles hocheffiziente Frontier-Architektur. Durch die Kombination von Grouped-Query Attention (GQA) mit proprietären linearen Hybrid-Attention-Sublayern überwindet Gemini 2.5 Flash die quadratische $O(N^2)$-Rechenbarriere. Bei der Inferenz mit langen Kontexten skaliert der Speicherbedarf quasi-linear:

$$\text{Memory}_{KV}(N) = 2 \times L \times n_{kv} \times d_{head} \times N \times \text{Precision}_{bytes}$$

Für 2M Tokens bei FP8-Präzision mit $L=64$ Layern, $n_{kv}=8$ Heads und $d_{head}=128$ würde ein unkomprimierter KV-Cache ungefähr Folgendes verbrauchen:

$$2 \times 64 \times 8 \times 128 \times 2,097,152 \times 1 \approx 274.8 \text{ GB}$$

Gemini 2.5 Flash löst dies auf TPU-v6e-Clustern mittels dynamischem latenten KV-Paging und Aktivierungsquantisierung. Dadurch wird der aktive KV-Speicher auf unter 38 GB komprimiert, während die p50-TTFT unter 2 Sekunden bleibt.

Code-SuperNova 1M (1M Tokens)

Speziell für Software-Engineering auf Enterprise-Niveau entwickelt, ist Code-SuperNova 1M für die Kompilierung vollständiger Repositories, AST-Traversal und das Verständnis dateiübergreifender Call-Graphen optimiert. Seine Trainings-Pipeline umfasst:

  • Chunked Fill-In-The-Middle (FIM) über mehr als 50 miteinander verknüpfte Dateien gleichzeitig.
  • Block-Sparse AST Attention: Tokens, die Symboldefinitionen, Funktionssignaturen und Import-Anweisungen repräsentieren, erhalten globale Attention-Anker, während dichte Funktionsimplementierungen innerhalb von Drittanbieter-Abhängigkeiten lazily komprimiert werden.
  • Deterministische Syntax-Wiederherstellung: Verhindert halluzinierte API-Signaturen beim Auflösen von Importen, die sich 800k Tokens zuvor im Prompt befinden.

Anthropic Claude 3.7 Sonnet (200k Nativ / 1M Beta)

Claude 3.7 Sonnet kombiniert Anthropics führende hybride Reasoning-Engine (konfigurierbare Thought Tokens) mit einem erweiterten 1M-Kontextfenster. Anthropic nutzt eine fortschrittliche YaRN-basierte Rotary Position Embedding (RoPE)-Interpolation mit feinabgestimmter Frequenz-Rekalibrierung:

$$\theta_i' = \theta_i \cdot \left(1 - \gamma\right) + \gamma \cdot \frac{\theta_i}{s}$$

Dies verhindert den Verlust hochfrequenter Positionsunterscheidung über weit entfernte Kontextsegmente hinweg. Im erweiterten Kontextmodus behält Claude 3.7 Sonnet eine strikte semantische Kohärenz bei, was es zum bevorzugten Modell für das autonome Debugging geschäftskritischer Systeme und mehrschichtige Architektur-Audits macht.

Moonshot AI Kimi K2.5 (2M Tokens)

Moonshot AI hat Pionierarbeit bei der verteilten Long-Context-Verarbeitung durch RingAttention-Topologien geleistet, indem die Sequenzdimension über Hochgeschwindigkeits-Interconnects (NVLink/InfiniBand) auf miteinander verbundene GPU-Cluster verteilt wird. Kimi K2.5 kombiniert Transformer-Blöcke mit selektiven State-Space-Layern (SSM) und ermöglicht so die kontinuierliche Verarbeitung von 2M Tokens gemischter Konversations- und strukturierter Tabellendaten bei branchenweit führenden Token-Preisen.


4. Needle in a Haystack (NIAH): Single-Needle- vs. Multi-Needle-Analyse

Die Falle synthetischer Benchmarks

Klassische Single-Needle-NIAH-Tests (Needle In A Haystack) platzieren einen einzelnen Fakt (z. B. „The secret password to the server room is PineApple-7749“) bei variierenden Tiefen-Prozentsätzen (0 % bis 100 %) innerhalb eines beliebigen Textkorpus (wie etwa Paul-Graham-Essays oder Open-Source-Dokumentationen).

Jedes moderne Frontier-Modell erzielt bei Single-Needle-NIAH mit 1M Tokens durchweg grüne Bestwerte (>99,0 %). In produktiven Workloads geht es jedoch nie um das Suchen nach einem isolierten Keyword. Reale Aufgabenstellungen erfordern:

  1. Multi-Needle Retrieval: Identifizierung von 5 bis 20 miteinander verknüpften Variablen, die über disparat verteilte Dokumente verstreut sind.
  2. Assoziatives Chain Reasoning: Extrahieren von Nadel A (Datenbankschema), Verknüpfen mit Nadel B (ORM-Query) und Synthetisieren von Nadel C (Sicherheitspatch).
+-----------------------------------------------------------------------------------------------+
|                     MULTI-NEEDLE-RETRIEVAL-DEGRADATIONSKURVEN (5 NADELN)                      |
+-----------------------------------------------------------------------------------------------+
| Kontexttiefe (Tokens) | 64k       | 128k      | 256k      | 512k      | 1M        | 2M        |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+
| Gemini 2.5 Flash      | 99.7%     | 99.2%     | 98.4%     | 96.8%     | 94.2%     | 88.5%     |
| Code-SuperNova 1M     | 99.8%     | 99.5%     | 98.9%     | 97.4%     | 95.1%     | N/A       |
| Claude 3.7 Sonnet     | 99.9%     | 99.6%     | 98.7%     | 96.5%     | 93.8%     | N/A       |
| Kimi K2.5             | 99.4%     | 98.8%     | 97.2%     | 94.1%     | 89.6%     | 81.2%     |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+

Das „Lost in the Middle“-Phänomen im Jahr 2026

Trotz architektonischer Fortschritte bleibt die klassische „Lost in the Middle“-Degradation bestehen, sobald die Kontexttiefe 500.000 Tokens überschreitet:

  • Primacy-Effekt (0 %–15 % Tiefe): Die Retrieval-Genauigkeit bleibt über 98,5 %. Modelle richten ihre Attention stark auf System-Prompts und initiale Schemadefinitionen.
  • Recency-Effekt (85 %–100 % Tiefe): Die Retrieval-Genauigkeit bleibt über 99,0 %. Der unmittelbar vorangegangene Konversationsverlauf und finale Abfrageanweisungen weisen keinerlei Degradation auf.
  • Aufmerksamkeits-Tal (Trough of Inattention, 35 %–65 % Tiefe): Bei Multi-Needle-Aufgaben über 1M Tokens fällt die Retrieval-Genauigkeit zwischen dem 40. und 60. Perzentil um durchschnittlich 7,4 % bis 12,8 % ab.
Retrieval-
Genauigkeit
  100% | \                                         /
   95% |   \                                     /
   90% |     \                                 /
   85% |       \                             /
   80% |         \_______Trough (40-60%)____/
       +---------------------------------------------
       0%         25%         50%         75%        100%
                        Kontextposition

5. Multi-Dokument-Retrieval-Verluste & Context Rot

Beim Ingestieren mehrerer komplexer Dokumente leiden Long-Context-Modelle unter Context Rot – einem fortschreitenden Verfall der Argumentations- und Reasoning-Treue, der durch aufmerksamkeitsbezogene Interferenzen über Dokumentgrenzen hinweg (Cross-Document Attention Interference) verursacht wird.

Hauptursachen für Context Rot:

  1. Aufmerksamkeitsstreuung (Attention Dispersion): Bei standardmäßiger Softmax-Attention wird die Verteilung der Aufmerksamkeitsgewichte $\text{softmax}(QK^T / \sqrt{d})$ mit Annäherung der Sequenzlänge $N$ an $10^6$ zunehmend diffuser. Geringfügiges Aufmerksamkeitsrauschen kumuliert über Tausende irrelevanter Token hinweg.
  2. Konfabulieren durch überlappende Entitäten: Wenn 15 verschiedene Dateien ähnliche Klassennamen referenzieren (z. B. UserSessionController, AuthSessionManager, UserSessionHandler), unterliegen die Cross-Attention-Gewichte destruktiver Interferenz. Dies führt dazu, dass das Modell Felder nicht zusammengehöriger Entitäten vermischt.
  3. Instruction Drift: Sehr lange Prompts mit umfangreichem Quellcode führen dazu, dass Modelle schrittweise die Bindung an Negativ-Constraints oder im System-Prompt definierte JSON-Formatierungsanweisungen verlieren.

Minderungsstrategien:

  • Hierarchisches Verankern (Hierarchical Anchoring): Platzieren Sie kritische Schemas und Vorgaben zur Ausgabeformatierung sowohl am Anfang ($0\%$) als auch am Ende ($100\%$) des Prompts.
  • Explizite Dokumentenabgrenzung: Verwenden Sie strukturierte XML- oder Markdown-Wrapper mit expliziten Token-Zahlen und Dateipfaden:
<document index="4" path="src/auth/session.ts" tokens="1420">
// Dateiinhalte...
</document>
  • Kontext-Pruning vor der Injektion: Filtern Sie Lockfiles, Build-Artefakte und Vendor-Bibliotheken heraus, um den effektiven Kontext im Bereich der höchsten Modelltreue (<512k Token) zu halten.

6. Entwicklertests in der Praxis: Konkrete CLI- & API-Implementierung

Um den 1M-Kontext-Recall in Produktionsumgebungen zu testen, können Entwickler reproduzierbare, synthetische NIAH-Tests mittels Python und asynchronen Client-Treibern durchführen.

Ausführen eines Multi-Needle-Benchmarks mit 1M Token

import asyncio
import os
import random
from anthropic import AsyncAnthropic
from google import genai

async def run_1m_gemini_niah(haystack_path: str, needles: list[dict]):
    """
    Führt einen Multi-Needle-Retrieval-Test mit Gemini 2.5 Flash bei 1M Token durch.
    """
    client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
    
    with open(haystack_path, "r") as f:
        corpus = f.read()
        
    # Needles in deterministischen Tiefenintervallen einfügen (z. B. 20 %, 45 %, 70 %)
    tokens = corpus.split()
    total_len = len(tokens)
    
    for needle in needles:
        insert_idx = int(total_len * needle["depth"])
        tokens.insert(insert_idx, needle["content"])
        
    prompt_payload = " ".join(tokens)
    query = "List all secret access tokens and their corresponding department codes verbatim."
    
    response = await client.aio.models.generate_content(
        model="gemini-2.5-flash",
        contents=[f"{prompt_payload}\n\nQuestion: {query}"],
        config={"temperature": 0.0}
    )
    
    print("Gemini 2.5 Flash Retrieval-Ergebnis:\n", response.text)

# CLI-Aufruf:
# python -m benchmarks.niah_runner --model gemini-2.5-flash --depths 0.2,0.5,0.8 --tokens 1000000

CLI-Analyse mit Code-SuperNova 1M

# Gesamtes 850k-Token-Repository einlesen und auf Zero-Day-Memory-Leaks auditieren
code-supernova audit \
  --repo-dir ./enterprise-monorepo \
  --context-window 1048576 \
  --needle-mode multi-ast \
  --temperature 0.1 \
  --output ./audit_report.json

7. Wirtschaftlichkeit & Kosten pro Abfrage bei 1M Token

In Architekturen mit langen Kontexten hängt die wirtschaftliche Tragfähigkeit maßgeblich vom Prompt Caching ab. Eine Abfrage mit 1 Million Token ohne Caching ist für Workflows mit hoher Frequenz schlicht unbezahlbar.

Kostenaufstellung pro 1.000.000 Input-Token

+---------------------------------------------------------------------------------------------------+
|                             1M TOKEN QUERY INGESTION ECONOMICS                                    |
+---------------------------------------------------------------------------------------------------+
| Modell                | Ungecachte Abfrage    | Gecacht (90 % Treffer) | 100 Abfr./Tag (gecacht)  |
+-----------------------+-----------------------+------------------------+--------------------------+
| Gemini 2.5 Flash      | $0.30                 | $0.075                 | $7.50 / Tag              |
| Kimi K2.5             | $0.25                 | $0.100                 | $10.00 / Tag             |
| Code-SuperNova 1M     | $0.80                 | $0.160                 | $16.00 / Tag             |
| Claude 3.7 Sonnet     | $3.00                 | $0.300                 | $30.00 / Tag             |
+-----------------------+-----------------------+------------------------+--------------------------+

Break-even-Analyse des Prompt Caching:

  • Ohne Prompt Caching kostet die Ausführung von 50 Abfragen über ein vollständiges Repository pro Tag mit Claude 3.7 Sonnet 150,00 $ täglich (4.500 $ monatlich).
  • Mit Anthropics 90-prozentigem Prompt-Caching-Rabatt kostet dieselbe Arbeitslast lediglich 15,00 $ täglich (450 $ monatlich), was einer sofortigen Ersparnis von 4.050 $ pro Monat entspricht.
  • Für kostenkritische Extraktions-Pipelines mit hohem Durchsatz liefert Gemini 2.5 Flash die niedrigsten Gesamtkosten (Total Cost of Ownership von 0,075 $ pro 1M gecachten Token) bei gleichzeitig stabilen 148 TPS.

8. E-E-A-T-Architekturempfehlungen & Fazit

Finale Entscheidungsmatrix:

  1. Wählen Sie Gemini 2.5 Flash (2M), wenn Ihre Prioritäten auf hohem Durchsatz, echtzeitfähiger interaktiver Latenz, massivem multimodalen Kontext (Video, Audio, umfangreiche PDF-Bücher) und minimalen API-Kosten liegen.
  2. Wählen Sie Code-SuperNova 1M für automatisiertes Software-Engineering über gesamte Repositories hinweg, dateiübergreifendes Refactoring und komplexe Compiler-/AST-Graph-Analysen, bei denen syntaktische Präzision entscheidend ist.
  3. Wählen Sie Claude 3.7 Sonnet (1M Extended) für tiefgehende analytische Synthesen, unternehmenskritische Sicherheitsaudits, juristische Vertragsprüfungen und nuanciertes Reasoning bei mehrdeutigen Anforderungen.
  4. Wählen Sie Kimi K2.5 (2M) für kosteneffiziente zweisprachige (Englisch/Chinesisch) Verarbeitung langer Kontexte, tabellarische Datenanalysen und Textzusammenfassungen in großem Maßstab.

Best Practices für den Produktiveinsatz:

  • Verlassen Sie sich niemals ausschließlich auf Single-Needle-Benchmarks: Evaluieren Sie Modellkandidaten stets anhand domänenspezifischer Multi-Needle-Testsuiten, die exakt Ihr Datenschema abbilden.
  • Setzen Sie strikte Prompt-Caching-Grenzen durch: Strukturieren Sie Anfragen so, dass das statische Kontext-Präfix von über 800k Token über Abfragen hinweg identisch bleibt, um die Wiederverwendung des KV-Cache zu maximieren.
  • Implementieren Sie hybrides RAG für Sequenzen > 1M Token: Bei Wissensdatenbanken von mehr als 2M Token übertrifft eine hybride Architektur – bestehend aus vektoriellem/lexikalischem Retrieval (Vorfilterung auf die relevantesten 200k Token) kombiniert mit Long-Context-LLM-Reasoning – das naive Brute-Force-Ingestieren von 2M Token sowohl bei der Genauigkeit als auch bei der Latenz kontinuierlich.
← Alle Artikel
0 / 4