Jawaban Cepat: Prompt caching memangkas biaya input API LLM sebesar 50% hingga 90% dan memotong latensi TTFT hingga 85% dengan menggunakan kembali tensor KV cache antar permintaan. Anthropic menawarkan diskon baca 90% dengan breakpoint eksplisit (minimal 1.024 token). OpenAI memberikan diskon 50% otomatis tanpa biaya tulis. DeepSeek menghadirkan penghematan 80%–90% mulai dari ambang batas 64 token dengan penyimpanan NVMe persisten.
1. Pendahuluan: Ekonomi Status dalam API LLM Nir-Status (Stateless)
API Model Bahasa Besar (LLM) modern secara arsitektural dirancang tanpa status (stateless): setiap permintaan HTTP POST ke /v1/chat/completions atau /v1/messages wajib mengirimkan riwayat percakapan lengkap, instruksi sistem, definisi alat, dan dokumen konteks. Meskipun arsitektur tanpa status memudahkan penyeimbangan beban dan penskalaan horizontal kluster GPU, hal ini menimbulkan pemborosan komputasi dan biaya finansial yang sangat besar pada alur kerja agen multi-putaran.
Dalam siklus agen otonom — seperti Claude Code, Roo Code, Aider, Devin, atau mesin RAG perusahaan — agen secara berulang mentransmisikan prompt sistem yang identik, spesifikasi OpenAPI, dan snapshot basis kode. Pada putaran ke-15 dari tugas rekayasa perangkat lunak standar, 95% hingga 98% dari seluruh token yang dikirimkan adalah prefiks statis (Static Prefix) yang telah diproses berulang kali oleh model.
Sebelumnya, penyedia komputasi awan mengenakan tarif input dasar penuh untuk setiap token di setiap putaran, memaksa kluster inferensi menjalankan perkalian matriks yang berat (fase prefill) pada konteks yang tidak berubah. Prompt Caching mengatasi inefisiensi ini secara fundamental. Dengan menyimpan tensor aktivasi Key-Value (KV) yang telah dihitung sebelumnya di memori GPU (HBM), RAM host, atau SSD NVMe super cepat, mesin inferensi sepenuhnya melewati komputasi prefill yang redundan.
Tim rekayasa yang menerapkan prompt caching secara sistematis rutin mencatat pengurangan tagihan API sebesar 60% hingga 88%, sembari memangkas waktu hingga token pertama (TTFT) dari beberapa detik menjadi hanya beberapa ratus milidetik.
2. Analisis Arsitektur: Mekanisme KV Cache dan Hambatan Prefill
Untuk memahami aspek ekonomi prompt caching, para insinyur harus memahami batasan fisik inferensi Transformer pada akselerator modern (NVIDIA H100/B200, Google TPU v5e/v6e).
Pipeline Inferensi Stateless Tradisional:
[Prompt Sistem Statis + Skema Alat + Riwayat (64.000 token)]
│
▼
[Fase Prefill Penuh (O(N²) FLOPs)]
Perkalian matriks menghitung ulang semua Q, K, V
│
▼
[Token pertama dibuat (TTFT: 2.8s)]
[Biaya: Tarif input dasar penuh × 64.000 token]
Pipeline dengan Prompt Caching Aktif:
[Prefiks Statis (60.000 token)] ──► [Hash Prefiks Cocok!] ──► [Muat tensor KV dari cache]
│ (Lewati FLOPs matriks)
[Kueri Dinamis (4.000 token)] ──► [Prefill hanya untuk selisih] ──────┤
▼
[Token pertama dibuat (TTFT: 0.35s)]
[Biaya: Tarif baca cache × 60k + Dasar × 4k]
Hambatan Komputasi Self-Attention
Dalam mekanisme self-attention standar, token input diproyeksikan ke dalam matriks Query ($Q$), Key ($K$), dan Value ($V$):
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Selama fase prefill, GPU memproses semua token prompt secara paralel. Karena self-attention mengevaluasi hubungan antara setiap pasangan token, kompleksitas komputasi (FLOPs) meningkat secara kuadratik terhadap panjang urutan $N$:
$$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$
Untuk model 70B dengan prompt 64.000 token, fase prefill saja membutuhkan sekitar $5.8 \times 10^{14}$ operasi floating-point sebelum menghasilkan token pertama.
Dalam fase decode, token dihasilkan satu per satu secara berurutan. Agar tidak menghitung ulang token sebelumnya, vektor aktivasi $K$ dan $V$ disimpan dalam memori: inilah KV Cache. Ukuran memori per token untuk $L$ lapisan dengan $H_{kv}$ head dimensi $D$ adalah:
$$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(byte dalam FP16 / BF16)}$$
Prompt Caching memperluas KV cache ini ke berbagai permintaan HTTP terpisah, sehingga saat hash kriptografis cocok, komputasi prefill langsung diabaikan.
3. Matriks Perbandingan Penyedia: Anthropic vs OpenAI vs DeepSeek
| Dimensi Arsitektural | Anthropic Claude | OpenAI (GPT-4o / o1 / o3) | DeepSeek (V3 / V4 / R1) |
|---|---|---|---|
| Mekanisme Aktivasi | Breakpoint eksplisit (cache_control) |
Pencocokan otomatis prefiks terpanjang | Pencocokan otomatis prefiks terpanjang |
| Ambang Batas Minimum | 1.024 token (Sonnet/Opus) 2.048 token (Haiku) |
1.024 token | 64 token (Ukuran blok perangkat keras) |
| Granularitas Blok | Titik henti manual (maks. 4/permintaan) | Kelipatan 128 token setelah 1.024 | Tepat selaras dengan blok 64 token |
| Masa Berlaku (TTL) | 5 menit (standar efemeral) 1 jam (tingkat diperpanjang) |
5 hingga 10 menit (penggusuran dinamis LRU) | Beberapa jam hingga persisten (NVMe) |
| Pembaruan TTL | Direset ke 5m/1h pada setiap hit | Diperpanjang otomatis saat aktif | Disimpan stabil di media sekunder |
| Biaya Tulis (Write) | +25% (1.25x tarif dasar untuk 5m) +100% (2.0x dasar untuk 1h) |
$0.00 (1.0x tarif dasar input) | $0.00 (1.0x tarif dasar, tanpa biaya tambahan) |
| Diskon Baca (Read) | Diskon 90% (0.10x tarif dasar) | Diskon 50% (0.50x tarif dasar) | Diskon 75% hingga 90% (0.10x–0.25x) |
| Biaya Penyimpanan | Termasuk dalam premi penulisan | Gratis | Gratis (disimpan di disk NVMe) |
| Pengurangan Latensi (TTFT) | Hingga 85% lebih cepat | Hingga 50% lebih cepat | Hingga 80% lebih cepat |
4. Tabel Tarif Lengkap Menurut Model (USD per 1 Juta Token)
| Nama Model | Input Standar ($/1M) | Tulis Cache ($/1M) | Baca Cache ($/1M) | Diskon Baca | Output Standar ($/1M) | Batas Minimum |
|---|---|---|---|---|---|---|
| Claude 3.5 / 3.7 Haiku | $0.80 | $1.00 (5m) / $1.60 (1h) | $0.08 | 90.0% | $4.00 | 2.048 token |
| Claude 3.7 Sonnet | $3.00 | $3.75 (5m) / $6.00 (1h) | $0.30 | 90.0% | $15.00 | 1.024 token |
| Claude 3 Opus / Opus 4.6 | $15.00 | $18.75 (5m) / $30.00 (1h) | $1.50 | 90.0% | $75.00 | 1.024 token |
| OpenAI GPT-4o mini | $0.15 | $0.15 | $0.075 | 50.0% | $0.60 | 1.024 token |
| OpenAI GPT-4o | $2.50 | $2.50 | $1.25 | 50.0% | $10.00 | 1.024 token |
| OpenAI o1 | $15.00 | $15.00 | $7.50 | 50.0% | $60.00 | 1.024 token |
| OpenAI o3-mini | $1.10 | $1.10 | $0.55 | 50.0% | $4.40 | 1.024 token |
| DeepSeek V3 / V4 (Luar Sibuk) | $0.14 | $0.14 | $0.014 | 90.0% | $0.28 | 64 token |
| DeepSeek V3 / V4 (Sibuk) | $0.27 | $0.27 | $0.027 | 90.0% | $1.10 | 64 token |
| DeepSeek R1 (Penalaran) | $0.55 | $0.55 | $0.14 | 74.5% | $2.19 | 64 token |
| Google Gemini 2.5 Flash | $0.15 | $0.15 | $0.0375 | 75.0% | $0.60 | 32.768 token |
| Google Gemini 2.5 Pro | $1.25 | $1.25 | $0.3125 | 75.0% | $5.00 | 32.768 token |
5. Model Matematika dan Titik Impas (Break-Even)
Perhitungan Break-Even ($N^*$)
Untuk Anthropic dengan biaya penulisan 25% lebih tinggi ($R_{\text{write}} = 1.25 R_{\text{base}}$, $R_{\text{read}} = 0.10 R_{\text{base}}$):
$$1.25 + 0.10(N - 1) \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278$$
Teorema 1: Pada TTL 5 menit Anthropic, prompt caching mencapai titik impas dan menghasilkan keuntungan bersih mulai dari permintaan ke-2 (N = 2).
Untuk TTL 1 jam ($R_{\text{write}} = 2.0 R_{\text{base}}$):
$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11$$
Teorema 2: Pada TTL 1 jam Anthropic, titik impas tercapai pada permintaan ke-3 (N = 3).
Pembuktian Batas Asimtotik Penghematan 90%
Pada sesi yang panjang ($N \to \infty$):
$$\lim_{N \to \infty} S(N) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$
- Anthropic dan DeepSeek: $1 - 0.10 = \mathbf{90.0\%}$ penghematan teoretis maksimum.
- OpenAI: $1 - 0.50 = \mathbf{50.0\%}$ penghematan teoretis maksimum.
6. Contoh Implementasi Kode
Anthropic Claude (Python)
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
max_tokens=2048,
system=[
{
"type": "text",
"text": "Spesifikasi arsitektur sistem...\n" * 400,
"cache_control": {"type": "ephemeral"} # Titik henti
}
],
messages=[{"role": "user", "content": "Rancang ulang modul otentikasi."}]
)
print("Token baca dari cache:", getattr(response.usage, "cache_read_input_tokens", 0))
OpenAI (TypeScript / Node.js)
import OpenAI from "openai";
const openai = new OpenAI();
const res = await openai.chat.completions.create({
model: "gpt-4o",
messages: [
{ role: "system", content: "Panduan dukungan perusahaan...\n".repeat(400) },
{ role: "user", content: "Periksa status pesanan #999" }
]
});
console.log("Token dalam cache:", (res.usage as any)?.prompt_tokens_details?.cached_tokens ?? 0);
7. Studi Kasus Industri Nyata
- Agen Pemrograman (Claude Code, Monorepo 250k Baris): 20 insinyur menurunkan biaya bulanan dari $29.700 menjadi $4.334 / bulan (penghematan bersih 85.4%).
- RAG Dokumen Hukum (OpenAI GPT-4o): 50.000 kueri bulanan turun dari $5.625 menjadi $2.975,63 / bulan (hemat 47.1%).
- Layanan Pelanggan Skala Besar (DeepSeek V3/V4): 2 juta percakapan bulanan berkurang dari $3.360 menjadi $378,34 / bulan (hemat 88.7%).
8. Lima Anti-Pattern yang Membatalkan Cache
- Menyisipkan timestamp dinamis di prompt sistem: Hash berubah setiap detik sehingga hit rate menjadi 0%.
- Urutan array alat (Tools) yang tidak konsisten: Serialisasi JSON yang acak membatalkan hash. Selalu urutkan secara alfabetis.
- Menaruh variabel dinamis di tengah prompt: Cache membutuhkan prefiks yang identik. Tempatkan data dinamis selalu di bagian akhir.
- Mengabaikan batas TTL 5 menit: Untuk jeda antar-permintaan yang lama, gunakan opsi TTL 1 jam.
- Mengirim prompt di bawah batas minimum: Permintaan kurang dari 1.024 token tidak disimpan dalam cache.
9. Kesimpulan & Rekomendasi LLMPodium
- Terbaik untuk Agen Pengembang Kode: Anthropic Claude 3.7 Sonnet memberikan ROI tertinggi berkat diskon baca 90%.
- Terbaik untuk Hemat Cepat Tanpa Ubah Kode: OpenAI GPT-4o memberikan penghematan 50% instan tanpa konfigurasi rumit.
- Terbaik untuk Beban Kerja Masif Termurah: DeepSeek V3/V4 memimpin dengan batas 64 token dan tarif baca $0.014/1M.