त्वरित उत्तर: प्रॉम्प्ट कैशिंग (Prompt Caching) अनुरोधों के बीच KV कैश टेन्सर का पुन: उपयोग करके LLM API इनपुट लागत को 50% से 90% तक घटाता है और विलंबता (TTFT) को 85% तक कम करता है। Anthropic स्पष्ट ब्रेकप्वाइंट के साथ 90% रीड छूट (1,024 टोकन न्यूनतम) देता है। OpenAI बिना राइट शुल्क के 50% स्वचालित छूट प्रदान करता है। DeepSeek 64 टोकन सीमा और NVMe स्टोरेज से 80%–90% बचत कराता है।
1. परिचय: स्टेटलेस LLM API में स्टेट का अर्थशास्त्र
आधुनिक लार्ज लैंग्वेज मॉडल (LLM) API बुनियादी रूप से स्टेटलेस (Stateless) आर्किटेक्चर पर काम करते हैं: /v1/chat/completions या /v1/messages पर भेजे जाने वाले प्रत्येक HTTP POST अनुरोध में पूरे संवाद इतिहास, सिस्टम निर्देशों, टूल स्कीमा और संदर्भ दस्तावेजों को दोबारा भेजना अनिवार्य होता है। हालांकि स्टेटलेस डिज़ाइन GPU क्लस्टर के लोड बैलेंसिंग को आसान बनाता है, लेकिन यह मल्टी-टर्न एजेंट वर्कफ़्लो में भारी कम्प्यूटेशनल और वित्तीय बर्बादी का कारण बनता है।
Claude Code, Roo Code, Aider, Devin या एंटरप्राइज RAG सिस्टम जैसे स्वायत्त एजेंटों में, एजेंट प्रत्येक चरण पर समान सिस्टम प्रॉम्प्ट, OpenAPI विनिर्देश और कोडबेस स्नैपशॉट बार-बार भेजता है। किसी सामान्य 15-टर्न कोडिंग कार्य में, प्रेषित कुल टोकन का 95% से 98% स्थिर प्रीफिक्स (Static Prefix) होता है जिसे मॉडल पहले ही कई बार प्रोसेस कर चुका होता है।
पहले क्लाउड प्रदाता प्रत्येक अनुरोध पर प्रत्येक टोकन के लिए पूर्ण बेस इनपुट दर वसूलते थे, जिससे इन्फरेंस क्लस्टर को अपरिवर्तित संदर्भ पर भारी मैट्रिक्स गुणन (Prefill चरण) बार-बार निष्पादित करना पड़ता था। प्रॉम्प्ट कैशिंग (Prompt Caching) इस अक्षमता को समाप्त करता है। स्थिर प्रीफिक्स के पूर्व-गणना किए गए Key-Value (KV) एक्टिवेशन टेन्सर को GPU मेमोरी (HBM), होस्ट रैम या तेज NVMe SSDs में सहेजकर, इन्फरेंस इंजन अनावश्यक Prefill गणना को पूरी तरह बायपास कर देता है।
प्रॉम्प्ट कैशिंग लागू करने वाली इंजीनियरिंग टीमें नियमित रूप से अपने कुल API बिल में 60% से 88% की कटौती करती हैं और पहले टोकन के समय (TTFT) को कई सेकंड से घटाकर कुछ सौ मिलीसेकंड पर लाती हैं।
2. आर्किटेक्चर विश्लेषण: KV कैश कार्यप्रणाली और Prefill की बाधा
प्रॉम्प्ट कैशिंग के अर्थशास्त्र को समझने के लिए आधुनिक AI एक्सेलेरेटर (NVIDIA H100/B200, Google TPU v5e/v6e) पर ट्रांसफॉर्मर इन्फरेंस की भौतिक सीमाओं को समझना आवश्यक है।
पारंपरिक स्टेटलेस इन्फरेंस पाइपलाइन:
[स्थिर सिस्टम प्रॉम्प्ट + टूल स्कीमा + इतिहास (64,000 टोकन)]
│
▼
[पूर्ण Prefill चरण (O(N²) FLOPs)]
मैट्रिक्स गुणन द्वारा सभी Q, K, V की पुनर्गणना
│
▼
[पहला टोकन उत्पन्न (TTFT: 2.8s)]
[लागत: पूर्ण बेस इनपुट दर × 64,000 टोकन]
प्रॉम्प्ट कैशिंग सक्षम इन्फरेंस पाइपलाइन:
[स्थिर प्रीफिक्स (60,000 टोकन)] ──► [प्रीफिक्स हैश मैच!] ──► [कैश किए गए KV टेन्सर लोड]
│ (मैट्रिक्स गणना समाप्त)
[डायनामिक क्वेरी (4,000 टोकन)] ──► [केवल अंतर के लिए Prefill] ────────┤
▼
[पहला टोकन उत्पन्न (TTFT: 0.35s)]
[लागत: रीड दर × 60k + बेस दर × 4k]
सेल्फ-अटेंशन की कम्प्यूटेशनल जटिलता
मानक सेल्फ-अटेंशन में, इनपुट टोकन को Query ($Q$), Key ($K$) और Value ($V$) मैट्रिक्स में प्रोजेक्ट किया जाता है:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Prefill चरण में GPU सभी प्रॉम्प्ट टोकन को समानांतर प्रोसेस करता है। क्योंकि अटेंशन प्रत्येक टोकन युग्म के बीच संबंधों की गणना करता है, इसलिए गणना जटिलता (FLOPs) अनुक्रम लंबाई $N$ के साथ द्विघात (Quadratic) रूप से बढ़ती है:
$$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$
जहाँ $P$ मॉडल पैरामीटर की संख्या है। 70B मॉडल पर 64,000 टोकन के प्रॉम्प्ट के लिए केवल Prefill चरण में लगभग $5.8 \times 10^{14}$ फ्लोटिंग-पॉइंट ऑपरेशन लगते हैं।
Decode चरण में टोकन एक-एक करके उत्पन्न होते हैं। पिछले टोकन की पुनर्गणना से बचने के लिए सक्रियण वैक्टर $K$ और $V$ को मेमोरी में रखा जाता है—यही KV कैश है। $L$ लेयर और $H_{kv}$ हेड वाले मॉडल में प्रति टोकन मेमोरी खपत निम्न है:
$$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(FP16 / BF16 बाइट्स)}$$
प्रॉम्प्ट कैशिंग इस KV कैश को अलग-अलग HTTP अनुरोधों में साझा करने की अनुमति देता है, जिससे आने वाला हैश मेल खाते ही भारी Prefill गणना पूरी तरह से टल जाती है।
3. प्रदाता तुलना मैट्रिक्स: Anthropic vs OpenAI vs DeepSeek
| आयाम | Anthropic Claude | OpenAI (GPT-4o / o1 / o3) | DeepSeek (V3 / V4 / R1) |
|---|---|---|---|
| सक्रियण तंत्र | स्पष्ट ब्रेकप्वाइंट (cache_control) |
स्वचालित प्रीफिक्स मिलान | स्वचालित प्रीफिक्स मिलान |
| न्यूनतम सक्रियण सीमा | 1,024 टोकन (Sonnet/Opus) 2,048 टोकन (Haiku) |
1,024 टोकन | 64 टोकन (हार्डवेयर ब्लॉक) |
| ब्लॉक आकार | कस्टम ब्रेकप्वाइंट (अधिकतम 4/अनुरोध) | 1,024 के बाद 128 टोकन वृद्धि | सटीक 64 टोकन संरेखण |
| जीवनकाल (TTL) | 5 मिनट (डिफ़ॉल्ट) 1 घंटा (विस्तारित टियर) |
5 से 10 मिनट (LRU एल्गोरिदम) | कई घंटे से स्थायी (NVMe आर्किटेक्चर) |
| TTL रीसेट | प्रत्येक हिट पर 5 मिनट/1 घंटा रीसेट | उपयोग जारी रहने पर स्वतः विस्तार | हाई-स्पीड डिस्क पर सुरक्षित |
| राइट सरचार्ज (Write) | +25% (5m TTL के लिए 1.25x) +100% (1h TTL के लिए 2.0x) |
$0.00 (1.0x बेस दर) | $0.00 (1.0x बेस दर, कोई अधिभार नहीं) |
| रीड छूट (Read) | 90% छूट (0.10x बेस दर) | 50% छूट (0.50x बेस दर) | 75% से 90% छूट (0.10x–0.25x बेस दर) |
| स्टोरेज शुल्क | राइट प्रीमियम में सम्मिलित | मुफ़्त | मुफ़्त (NVMe स्टोरेज) |
| विलंबता में कमी (TTFT) | 85% तक तेज़ | 50% तक तेज़ | 80% तक तेज़ |
4. मॉडल-वार विस्तृत मूल्य तालिका (USD प्रति 1M टोकन)
| मॉडल का नाम | बेस इनपुट ($/1M) | कैश राइट ($/1M) | कैश रीड ($/1M) | रीड छूट | बेस आउटपुट ($/1M) | न्यूनतम सीमा |
|---|---|---|---|---|---|---|
| Claude 3.5 / 3.7 Haiku | $0.80 | $1.00 (5m) / $1.60 (1h) | $0.08 | 90.0% | $4.00 | 2,048 टोकन |
| Claude 3.7 Sonnet | $3.00 | $3.75 (5m) / $6.00 (1h) | $0.30 | 90.0% | $15.00 | 1,024 टोकन |
| Claude 3 Opus / Opus 4.6 | $15.00 | $18.75 (5m) / $30.00 (1h) | $1.50 | 90.0% | $75.00 | 1,024 टोकन |
| OpenAI GPT-4o mini | $0.15 | $0.15 | $0.075 | 50.0% | $0.60 | 1,024 टोकन |
| OpenAI GPT-4o | $2.50 | $2.50 | $1.25 | 50.0% | $10.00 | 1,024 टोकन |
| OpenAI o1 | $15.00 | $15.00 | $7.50 | 50.0% | $60.00 | 1,024 टोकन |
| OpenAI o3-mini | $1.10 | $1.10 | $0.55 | 50.0% | $4.40 | 1,024 टोकन |
| DeepSeek V3 / V4 (ऑफ-पीक) | $0.14 | $0.14 | $0.014 | 90.0% | $0.28 | 64 टोकन |
| DeepSeek V3 / V4 (पीक) | $0.27 | $0.27 | $0.027 | 90.0% | $1.10 | 64 टोकन |
| DeepSeek R1 (रीज़निंग) | $0.55 | $0.55 | $0.14 | 74.5% | $2.19 | 64 टोकन |
| Google Gemini 2.5 Flash | $0.15 | $0.15 | $0.0375 | 75.0% | $0.60 | 32,768 टोकन |
| Google Gemini 2.5 Pro | $1.25 | $1.25 | $0.3125 | 75.0% | $5.00 | 32,768 टोकन |
5. लागत बचत का गणित और ब्रेक-इवेन बिंदु
ब्रेक-इवेन टर्न गणना ($N^*$)
Anthropic के लिए जहाँ राइट पर 25% प्रीमियम है ($R_{\text{write}} = 1.25 R_{\text{base}}$, $R_{\text{read}} = 0.10 R_{\text{base}}$):
$$1.25 + 0.10(N - 1) \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278$$
प्रमेय 1: Anthropic के 5-मिनट TTL में दूसरे अनुरोध (N = 2) से ही शुद्ध बचत शुरू हो जाती है।
1-घंटे के विस्तारित TTL के लिए ($R_{\text{write}} = 2.0 R_{\text{base}}$):
$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11$$
प्रमेय 2: विस्तारित 1-घंटे TTL में तीसरे अनुरोध (N = 3) पर ब्रेक-इवेन प्राप्त होता है।
90% अधिकतम लागत कटौती का प्रमाण
लंबे सत्रों में ($N \to \infty$):
$$\lim_{N \to \infty} S(N) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$
- Anthropic और DeepSeek: $1 - 0.10 = \mathbf{90.0\%}$ अधिकतम सैद्धांतिक बचत।
- OpenAI: $1 - 0.50 = \mathbf{50.0\%}$ अधिकतम सैद्धांतिक बचत।
6. कोड कार्यान्वयन उदाहरण
Anthropic Claude (Python)
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
max_tokens=2048,
system=[
{
"type": "text",
"text": "विस्तृत सिस्टम आर्किटेक्चर...\n" * 400,
"cache_control": {"type": "ephemeral"} # ब्रेकप्वाइंट
}
],
messages=[{"role": "user", "content": "डेटाबेस माइग्रेशन लिखें।"}]
)
print("कैश रीड टोकन:", getattr(response.usage, "cache_read_input_tokens", 0))
OpenAI (TypeScript / Node.js)
import OpenAI from "openai";
const openai = new OpenAI();
const res = await openai.chat.completions.create({
model: "gpt-4o",
messages: [
{ role: "system", content: "स्थिर सहायता दिशानिर्देश...\n".repeat(400) },
{ role: "user", content: "ऑर्डर स्थिति जांचें" }
]
});
console.log("कैश किए गए टोकन:", (res.usage as any)?.prompt_tokens_details?.cached_tokens ?? 0);
7. वास्तविक उद्योग केस स्टडीज़
- कोडिंग एजेंट (Claude Code, 250k LOC मोनोरेपो): 20 इंजीनियरों का मासिक खर्च $29,700 से घटकर $4,334 / माह हो गया (85.4% शुद्ध बचत)।
- लंबी दस्तावेज RAG (OpenAI GPT-4o): 50,000 मासिक प्रश्नों का खर्च $5,625 से गिरकर $2,975.63 / माह हुआ (47.1% बचत)।
- ग्राहक सहायता इंजन (DeepSeek V3/V4): 20 लाख मासिक संवादों का खर्च $3,360 से घटकर $378.34 / माह पर आ गया (88.7% बचत)।
8. कैशिंग को बिगाड़ने वाले पाँच सामान्य एंटी-पैटर्न
- सिस्टम प्रॉम्प्ट में डायनामिक टाइमस्टैम्प जोड़ना: हर सेकंड हैश बदलता है जिससे हिट दर 0% हो जाती है।
- टूल्स एरे (Tools) का अव्यवस्थित क्रम: JSON स्कीमा में क्रम बदलने पर हैश मिसमैच होता है। हमेशा वर्णमाला क्रम में सॉर्ट करें।
- प्रॉम्प्ट के बीच में डायनामिक वैरिएबल डालना: कैशिंग केवल समान प्रीफिक्स पर काम करती है। स्थिर डेटा पहले रखें, परिवर्तनीय अंत में।
- 5-मिनट के TTL विंडो को अनदेखा करना: लंबे अंतराल वाले सत्रों में 1-घंटे का विस्तारित TTL उपयोग करें।
- न्यूनतम सीमा से कम प्रॉम्प्ट भेजना: 1,024 टोकन से कम पर कैशिंग सक्रिय नहीं होती।
9. निष्कर्ष और LLMPodium अनुशंसा
- स्वायत्त कोडिंग एजेंटों के लिए: Anthropic Claude 3.7 Sonnet 90% रीड छूट के साथ सर्वोत्तम रिटर्न प्रदान करता है।
- बिना कोड बदले तत्काल बचत के लिए: OpenAI GPT-4o शून्य विन्यास के साथ 50% बचत सुनिश्चित करता है।
- विशाल वॉल्यूम और न्यूनतम बजट के लिए: DeepSeek V3/V4 64-टोकन सीमा और $0.014/1M दर के साथ सबसे किफायती है।