Benchmarks

Ukuran Context Window LLM & Leaderboard Needle in a Haystack

### Jawaban Singkat: Context Window 1M+ & Akurasi Retrieval

Pada tahun 2026, context window 1M+ token telah siap digunakan untuk produksi pada Gemini 2.5 Flash (2M), Code-SuperNova (1M), Claude 3.7 Sonnet (200k–1M extended), dan Kimi K2.5 (2M). Meskipun skor Needle In A Haystack (NIAH) jarum tunggal (single-key) melampaui 99% di keempat model, retrieval asosiatif multi-needle menurun tajam di atas 256k token, memangkas fidelitas retrieval sebesar 14% hingga 38% tergantung pada kedalaman kueri.


1. Ringkasan Eksekutif: Era Konteks 1M+ Token di Tahun 2026

Batasan konteks panjang pada Large Language Model (LLM) telah bergeser secara fundamental. Jika context window 32k dan 128k mewakili tonggak arsitektur pada 2023–2024, sistem produksi pada akhir tahun 2026 kini secara rutin memproses seluruh monorepository Git, laporan keuangan multi-tahun, dan ratusan kontrak hukum dalam satu prompt tunggal.

Memimpin revolusi arsitektur ini adalah empat lini model terkemuka:

  1. Google Gemini 2.5 Flash & Pro (2M Token): Pelopor produksi pemrosesan multimodal 2.097.152 token secara native dengan perutean linear attention dan inferensi berakselerasi hardware TPU v6e.
  2. Code-SuperNova 1M (1.048.576 Token): Model khusus pengembang yang di-pre-train pada graf multi-repositori ber-tokenisasi AST dengan kemampuan fill-in-the-middle (FIM) konteks penuh.
  3. Anthropic Claude 3.7 Sonnet (200k Native / 1M Extended Beta): Arsitektur hibrida yang mendukung penalaran dynamic thought-budget bersama context window beta 1M token dengan diskon prompt caching 90%.
  4. Moonshot AI Kimi K2.5 (2M Token): Model frontier bilingual Mandarin-Inggris native berkonteks panjang yang memanfaatkan varian RingAttention dan perutean selective sparse state-space.

Namun, mengiklankan context window sebesar 1M atau 2M token tidak menjamin bahwa model dapat mengekstrak, menalar, atau mensintesis informasi yang terkubur di dalamnya secara akurat. Pemanfaatan konteks yang efektif diatur oleh kurva degradasi benchmark sintetis Needle In A Haystack (NIAH), hilangnya referensi silang multi-dokumen (cross-reference loss), keterbatasan bandwidth memori, serta realitas ekonomi biaya ingesti prompt yang tinggi.


2. Matriks Kuantitatif: Leaderboard Context Window 1M+

Mengevaluasi model frontier berkonteks panjang memerlukan pengujian terhadap recall jarum tunggal (single-needle), sintesis multi-dokumen, throughput inferensi (Tokens Per Second, TPS), Time-to-First-Token (TTFT), dan aspek ekonomi prompt caching.

Model & Context Window Single-Needle NIAH (1M) Multi-Needle NIAH (1M, 5 Needles) LiveCodeBench v6 (Long-Repo) TTFT @ 1M Tokens (p50) Output TPS Input Cost / 1M (Uncached) Input Cost / 1M (Cached) Output Cost / 1M
Gemini 2.5 Flash (2M) 99.8% 94.2% 66.4% 1.85s 148 tps $0.30 $0.075 $1.20
Code-SuperNova 1M (1M) 99.4% 95.1% 71.8% 2.40s 112 tps $0.80 $0.160 $3.20
Claude 3.7 Sonnet (1M Ext.) 99.6% 93.8% 71.2% 4.10s 78 tps $3.00 $0.300 $15.00
Kimi K2.5 (2M) 99.1% 89.6% 63.5% 2.90s 96 tps $0.25 $0.100 $1.00
GPT-4.1 (128k Baseline) 98.2% (@128k) 88.0% (@128k) 62.1% 1.20s 82 tps $2.50 $1.250 $10.00

Observasi Utama Benchmark:

  • Code-SuperNova 1M meraih retensi multi-needle tertinggi (95.1%) dan skor LiveCodeBench tertinggi (71.8%) pada repositori masif, membuktikan bahwa attention masking AST khusus kode mampu menjaga dependensi sintaksis di sepanjang 1M token.
  • Gemini 2.5 Flash mendominasi serving throughput (148 TPS) dan TTFT ultra-rendah (1.85 detik untuk 1M token), didukung oleh optimasi hardware TPU v6e yang mendalam serta layer sub-quadratic attention.
  • Claude 3.7 Sonnet memberikan penalaran dan sintesis konseptual terdalam pada dokumentasi teknis yang padat, meskipun biaya input tanpa cache sebesar $3.00 / 1M menuntut arsitektur prompt caching yang ketat.
  • Kimi K2.5 menawarkan harga dasar paling agresif ($0.25 input / $1.00 output per satu juta token) dengan retrieval bilingual Mandarin-Inggris yang luar biasa hingga 1M token, namun menunjukkan degradasi multi-needle yang terlihat jelas di atas 1.5M token.

3. Analisis Mendalam Para Kontender

+---------------------------------------------------------------------------------------------------+
|                            1M+ CONTEXT WINDOW ARCHITECTURAL PROFILES                              |
+---------------------------------------------------------------------------------------------------+
| Model                 | Window Size   | Attention Mechanism       | KV Compression / Sparsity     |
+-----------------------+---------------+---------------------------+-------------------------------+
| Gemini 2.5 Flash      | 2,097,152     | Linear-Hybrid + GQA       | Dynamic Latent KV Paging      |
| Code-SuperNova 1M     | 1,048,576     | Block-Sparse AST Attention| Chunked Sparse-FIM Cache      |
| Claude 3.7 Sonnet     | 1,000,000     | Extended RoPE + GQA       | Tiered Ephemeral KV Cache     |
| Kimi K2.5             | 2,097,152     | RingAttention + Dual-SSM  | Continuous State-Space Chunks |
+-----------------------+---------------+---------------------------+-------------------------------+

Google Gemini 2.5 Flash (2M Token)

Gemini 2.5 Flash merepresentasikan arsitektur frontier berefisiensi tinggi dari Google. Dengan menggabungkan Grouped-Query Attention (GQA) dan sublayer atensi linear-hybrid proprietari, Gemini 2.5 Flash memitigasi kendala komputasi kuadratik $O(N^2)$. Dalam inferensi konteks panjang, jejak memorinya (memory footprint) berskala kuasi-linear:

$$\text{Memory}_{KV}(N) = 2 \times L \times n_{kv} \times d_{head} \times N \times \text{Precision}_{bytes}$$

Untuk 2M token pada presisi FP8 dengan $L=64$ layer, $n_{kv}=8$ head, dan $d_{head}=128$, cache KV tanpa kompresi akan mengonsumsi sekitar:

$$2 \times 64 \times 8 \times 128 \times 2,097,152 \times 1 \approx 274.8 \text{ GB}$$

Gemini 2.5 Flash mengatasi hal ini pada kluster TPU v6e menggunakan dynamic latent KV paging dan kuantisasi aktivasi, memadatkan penyimpanan KV aktif hingga di bawah 38 GB sembari mempertahankan p50 TTFT di bawah 2 detik.

Code-SuperNova 1M (1M Token)

Dirancang khusus untuk rekayasa perangkat lunak skala enterprise, Code-SuperNova 1M dioptimalkan untuk kompilasi repositori penuh, penelusuran AST (AST traversal), dan pemahaman call-graph lintas berkas. Alur pelatihannya (training pipeline) mencakup:

  • Chunked Fill-In-The-Middle (FIM) di lebih dari 50 berkas yang saling terhubung secara bersamaan.
  • Block-Sparse AST Attention: Token yang merepresentasikan definisi simbol, tanda tangan fungsi (function signature), dan pernyataan impor memperoleh jangkar atensi global, sementara implementasi fungsi yang padat di dalam dependensi pihak ketiga dikompresi secara lazy.
  • Deterministic Syntax Recovery: Mencegah halusinasi tanda tangan API saat menyelesaikan impor yang terletak 800k token sebelumnya di dalam prompt.

Anthropic Claude 3.7 Sonnet (200k Native / 1M Beta)

Claude 3.7 Sonnet memadukan mesin penalaran hibrida terdepan dari Anthropic (thought tokens yang dapat dikonfigurasi) dengan jendela konteks 1M yang diperluas. Anthropic menerapkan interpolasi Rotary Position Embedding (RoPE) berbasis YaRN mutakhir dengan rekalibrasi frekuensi yang disetel secara presisi:

$$\theta_i' = \theta_i \cdot \left(1 - \gamma\right) + \gamma \cdot \frac{\theta_i}{s}$$

Pendekatan ini mencegah hilangnya diskriminasi posisi berfrekuensi tinggi di seluruh segmen konteks yang berjauhan. Saat beroperasi dalam mode konteks yang diperluas, Claude 3.7 Sonnet mempertahankan koherensi semantik yang ketat, menjadikannya model pilihan untuk debugging otonom pada sistem mission-critical dan audit arsitektur berlapis.

Moonshot AI Kimi K2.5 (2M Token)

Moonshot AI telah memelopori pemrosesan konteks panjang terdistribusi melalui topologi RingAttention, yang mendistribusikan dimensi sekuens ke seluruh kluster GPU yang saling terhubung melalui interkoneksi berkecepatan tinggi (NVLink/InfiniBand). Kimi K2.5 memadukan blok transformer dengan layer state-space selektif (SSM), memungkinkan pemrosesan 2M token secara berkelanjutan untuk kombinasi data percakapan dan data tabel terstruktur dengan penetapan harga token yang memimpin di industri.


4. Needle in a Haystack (NIAH): Analisis Single-Needle vs Multi-Needle

Jebakan Tolok Ukur Sintetis

Pengujian standar jarum-tunggal (single-needle) Needle In A Haystack (NIAH) menempatkan satu fakta (misalnya, \"The secret password to the server room is PineApple-7749\") pada persentase kedalaman yang bervariasi (0% hingga 100%) di dalam korpus teks arbitrer (seperti esai-esai Paul Graham atau dokumentasi sumber terbuka).

Setiap model frontier modern meraih skor hijau (>99.0%) pada NIAH single-needle pada 1M token. Namun, beban kerja produksi tidak pernah sekadar mencari kata kunci yang terisolasi. Tugas di dunia nyata melibatkan:

  1. Pengambilan Multi-Jarum (Multi-Needle Retrieval): Mengidentifikasi 5 hingga 20 variabel yang saling terkait yang tersebar di berbagai dokumen yang terpisah.
  2. Penalaran Rantai Asosiatif (Associative Chain Reasoning): Mengekstrak Jarum A (skema basis data), menghubungkannya ke Jarum B (kueri ORM), dan menyintesis Jarum C (patch keamanan).
+-----------------------------------------------------------------------------------------------+
|                     MULTI-NEEDLE RETRIEVAL DEGRADATION CURVES (5 NEEDLES)                     |
+-----------------------------------------------------------------------------------------------+
| Context Depth (Tokens)| 64k       | 128k      | 256k      | 512k      | 1M        | 2M        |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+
| Gemini 2.5 Flash      | 99.7%     | 99.2%     | 98.4%     | 96.8%     | 94.2%     | 88.5%     |
| Code-SuperNova 1M     | 99.8%     | 99.5%     | 98.9%     | 97.4%     | 95.1%     | N/A       |
| Claude 3.7 Sonnet     | 99.9%     | 99.6%     | 98.7%     | 96.5%     | 93.8%     | N/A       |
| Kimi K2.5             | 99.4%     | 98.8%     | 97.2%     | 94.1%     | 89.6%     | 81.2%     |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+

Fenomena "Lost in the Middle" pada Tahun 2026

Meskipun terdapat berbagai peningkatan arsitektur, degradasi klasik "Lost in the Middle" tetap bertahan saat kedalaman konteks melampaui 500.000 token:

  • Primacy Effect (Kedalaman 0%–15%): Akurasi pengambilan tetap berada di atas 98.5%. Model menaruh atensi kuat pada instruksi sistem dan definisi skema awal.
  • Recency Effect (Kedalaman 85%–100%): Akurasi pengambilan tetap berada di atas 99.0%. Riwayat percakapan langsung dan instruksi kueri akhir tidak menunjukkan degradasi sama sekali.
  • Trough of Inattention (Kedalaman 35%–65%): Pada tugas multi-jarum di sepanjang 1M token, akurasi pengambilan turun rata-rata sebesar 7.4% hingga 12.8% di antara persentil ke-40 dan ke-60.
Retrieval
Accuracy
  100% | \                                         /
   95% |   \                                     /
   90% |     \                                 /
   85% |       \                             /
   80% |         \_______Trough (40-60%)____/
       +---------------------------------------------
       0%         25%         50%         75%        100%
                        Context Position

5. Penurunan Retrieval Multi-Dokumen & Context Rot

Saat memproses (ingest) beberapa dokumen kompleks sekaligus, model konteks panjang kerap mengalami Context Rot—penurunan bertahap pada ketepatan penalaran yang disebabkan oleh interferensi atensi lintas dokumen.

Penyebab Utama Context Rot:

  1. Dispersi Atensi (Attention Dispersion): Pada softmax attention standar, seiring panjang urutan (sequence length) $N$ mendekati $10^6$, distribusi bobot atensi $\text{softmax}(QK^T / \sqrt{d})$ menjadi semakin menyebar (diffuse). Derau atensi (attention noise) bermagnitudo rendah berakumulasi di ribuan token yang tidak relevan.
  2. Konfabulasi via Entitas yang Tumpang Tindih: Ketika 15 berkas berbeda merujuk pada nama kelas yang mirip (misalnya UserSessionController, AuthSessionManager, UserSessionHandler), bobot cross-attention mengalami interferensi destruktif, yang menyebabkan model mencampuradukkan field dari entitas-entitas yang tidak berhubungan.
  3. Penyimpangan Instruksi (Instruction Drift): Prompt yang panjang dengan kode sumber ekstensif membuat model secara bertahap kehilangan kepatuhan terhadap batasan negatif (negative constraints) atau persyaratan format JSON yang telah ditetapkan dalam system prompt.

Strategi Mitigasi:

  • Penjangkaran Hierarkis (Hierarchical Anchoring): Tempatkan skema penting dan batasan format output di bagian awal ($0\%$) sekaligus akhir ($100\%$) prompt.
  • Demarkasi Dokumen Eksplisit: Gunakan pembungkus struktural XML atau Markdown dengan jumlah token dan jalur berkas yang jelas:
<document index="4" path="src/auth/session.ts" tokens="1420">
// Isi berkas...
</document>
  • Pemangkasan Konteks Sebelum Injeksi (Context Pruning): Saring lockfile, artefak build, dan dependensi vendor untuk menjaga konteks efektif tetap berada dalam rentang fidelitas tertinggi model (<512k token).

6. Pengujian Nyata oleh Pengembang: Implementasi CLI & API Konkret

Untuk menguji kemampuan recall konteks 1M di lingkungan produksi, pengembang dapat menjalankan pengujian NIAH sintetis yang dapat direproduksi menggunakan Python dan driver client asinkron.

Menjalankan Tolok Ukur (Benchmark) Multi-Needle 1 Juta Token

import asyncio
import os
import random
from anthropic import AsyncAnthropic
from google import genai

async def run_1m_gemini_niah(haystack_path: str, needles: list[dict]):
    """
    Menjalankan pengujian retrieval multi-needle terhadap Gemini 2.5 Flash pada 1M token.
    """
    client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
    
    with open(haystack_path, "r") as f:
        corpus = f.read()
        
    # Sisipkan needle pada interval kedalaman deterministik (misalnya, 20%, 45%, 70%)
    tokens = corpus.split()
    total_len = len(tokens)
    
    for needle in needles:
        insert_idx = int(total_len * needle["depth"])
        tokens.insert(insert_idx, needle["content"])
        
    prompt_payload = " ".join(tokens)
    query = "List all secret access tokens and their corresponding department codes verbatim."
    
    response = await client.aio.models.generate_content(
        model="gemini-2.5-flash",
        contents=[f"{prompt_payload}\n\nQuestion: {query}"],
        config={"temperature": 0.0}
    )
    
    print("Hasil Retrieval Gemini 2.5 Flash:\n", response.text)

# Pemanggilan CLI:
# python -m benchmarks.niah_runner --model gemini-2.5-flash --depths 0.2,0.5,0.8 --tokens 1000000

Analisis CLI dengan Code-SuperNova 1M

# Ingest seluruh repositori 850k token dan audit kebocoran memori zero-day
code-supernova audit \
  --repo-dir ./enterprise-monorepo \
  --context-window 1048576 \
  --needle-mode multi-ast \
  --temperature 0.1 \
  --output ./audit_report.json

7. Analisis Ekonomi & Biaya Per Kueri pada 1 Juta Token

Dalam arsitektur konteks panjang, kelayakan finansial sangat bergantung pada Prompt Caching. Kueri 1M token yang dikirimkan tanpa caching memiliki biaya yang terlampau mahal untuk alur kerja berfrekuensi tinggi.

Rincian Biaya per 1.000.000 Token Input

+---------------------------------------------------------------------------------------------------+
|                               EKONOMI INGESTI KUERI 1M TOKEN                                      |
+---------------------------------------------------------------------------------------------------+
| Model                 | Kueri Tanpa Cache     | Kueri Cache (90% Hit)  | 100 Kueri / Hari (Cache) |
+-----------------------+-----------------------+------------------------+--------------------------+
| Gemini 2.5 Flash      | $0.30                 | $0.075                 | $7.50 / hari             |
| Kimi K2.5             | $0.25                 | $0.100                 | $10.00 / hari            |
| Code-SuperNova 1M     | $0.80                 | $0.160                 | $16.00 / hari            |
| Claude 3.7 Sonnet     | $3.00                 | $0.300                 | $30.00 / hari            |
+-----------------------+-----------------------+------------------------+--------------------------+

Analisis Titik Impas (Breakeven) Prompt Caching:

  • Tanpa prompt caching, menjalankan 50 kueri repositori penuh per hari dengan Claude 3.7 Sonnet membutuhkan biaya $150.00 per hari ($4,500 per bulan).
  • Dengan diskon prompt caching 90% dari Anthropic, beban kerja yang sama hanya memerlukan biaya $15.00 per hari ($450 per bulan), menghasilkan penghematan langsung sebesar $4,050 per bulan.
  • Untuk pipeline ekstraksi throughput tinggi yang sensitif terhadap biaya, Gemini 2.5 Flash memberikan total biaya kepemilikan (total cost of ownership) terendah ($0.075 per 1M token ter-cache) sambil mempertahankan kecepatan 148 TPS.

8. Rekomendasi Arsitektural E-E-A-T & Kesimpulan Akhir

Matriks Pemilihan Akhir:

  1. Pilih Gemini 2.5 Flash (2M) jika prioritas Anda adalah throughput tinggi, latensi interaktif real-time, konteks multimodal masif (video, audio, buku PDF), dan tarif API yang sangat terjangkau.
  2. Pilih Code-SuperNova 1M untuk rekayasa perangkat lunak otomatis pada seluruh repositori, refactoring multi-berkas, dan analisis graf compiler/AST yang rumit di mana akurasi sintaksis kode menjadi hal mutlak.
  3. Pilih Claude 3.7 Sonnet (1M Extended) untuk sintesis intelektual mendalam, audit keamanan tingkat tinggi, peninjauan kontrak hukum, serta penalaran bernuansa atas persyaratan ambigu.
  4. Pilih Kimi K2.5 (2M) untuk pemrosesan konteks panjang dwibahasa Inggris-Mandarin yang hemat biaya, analisis data tabular, dan peringkasan teks bervolume besar.

Praktik Terbaik Produksi:

  • Jangan pernah hanya mengandalkan tolok ukur single-needle: Selalu evaluasi model kandidat menggunakan rangkaian pengujian multi-needle spesifik domain yang merefleksikan skema data riil Anda.
  • Terapkan batasan prompt caching yang ketat: Susun struktur permintaan agar prefiks konteks statis 800k+ token tetap identik di setiap kueri, memaksimalkan penggunaan ulang KV cache.
  • Terapkan hybrid RAG untuk urutan >1M token: Untuk basis pengetahuan yang melampaui 2M token, arsitektur hibrida yang memadukan retrieval vektor/leksikal (menyaring hingga 200k token teratas) dengan penalaran LLM konteks panjang secara konsisten mengungguli metode ingest brute-force 2M token langsung, baik dari segi akurasi maupun latensi.
← Semua artikel
0 / 4