فوری جواب: پرامپٹ کیشنگ (Prompt Caching) درخواستوں کے درمیان KV کیش ٹینسرز کو دوبارہ استعمال کر کے LLM API کے ان پٹ اخراجات میں 50% سے 90% کمی اور TTFT تاخیر میں 85% تک بہتری لاتی ہے۔ Anthropic واضح بریک پوائنٹس کے ساتھ 90% ریڈ ڈسکاؤنٹ دیتی ہے (کم از کم 1,024 ٹوکن)۔ OpenAI بغیر کسی رائٹ فیس کے خودکار 50% رعایت فراہم کرتی ہے۔ DeepSeek محض 64 ٹوکن کی حد اور مستقل NVMe اسٹوریج سے 80% سے 90% بچت ممکن بناتی ہے۔
1. تعارف: اسٹیٹ لیس LLM APIs میں حالت (State) کی معاشیات
جدید لارج لینگویج ماڈل (LLM) APIs بنیادی طور پر اسٹیٹ لیس (Stateless) فن تعمیر پر استوار ہیں: /v1/chat/completions یا /v1/messages پر بھیجی جانے والی ہر HTTP POST درخواست میں بات چیت کی مکمل تاریخ، سسٹم ہدایات، ٹولز کی وضاحتیں اور متعلقہ دستاویزات دوبارہ بھیجنا لازمی ہوتا ہے۔ اگرچہ یہ اسٹیٹ لیس ڈیزائن سرور کلسٹرز کے بوجھ کو سنبھالنا آسان بناتا ہے، لیکن یہ ملٹی ٹرن ایجنٹ ورک فلو میں وسیع مالی اور حسابی نقصان کا باعث بنتا ہے۔
خود مختار ایجنٹ سسٹمز — جیسے Claude Code، Roo Code، Aider، Devin یا انٹرپرائز RAG سسٹمز — میں ماڈل ہر مرحلے پر یکساں سسٹم پرامپٹس اور کوڈ بیس کا حوالہ بار بار وصول کرتا ہے۔ ایک عام 15 مرحلوں کے کوڈنگ سیشن میں بھیجے گئے کل ٹوکنز کا 95% سے 98% حصہ جامد پریفکس (Static Prefix) پر مشتمل ہوتا ہے، جسے ماڈل پہلے ہی متعدد بار پروسیس کر چکا ہوتا ہے۔
ماضی میں کلاؤڈ فراہم کنندگان ہر درخواست پر تمام ٹوکنز کے لیے مکمل بنیادی فیس وصول کرتے تھے، جس کی وجہ سے انفراسٹرکچر کو غیر تبدیل شدہ سیاق و سباق پر دوبارہ پیچیدہ میٹرکس ضرب (Prefill فیز) چلانا پڑتی تھی۔ پرامپٹ کیشنگ (Prompt Caching) اس مسئلے کا مکمل خاتمہ کرتی ہے۔ جامد پریفکس کے پہلے سے حساب شدہ Key-Value (KV) ایکٹیویشن ٹینسرز کو تیز رفتار GPU میموری (HBM)، میزبان ریم یا تیز رفتار NVMe SSDs میں محفوظ کر کے، انفراسٹرکچر غیر ضروری حساب کتاب کو مکمل طور پر نظر انداز کر دیتا ہے۔
پرامپٹ کیشنگ کو منظم طریقے سے نافذ کرنے والی انجینئرنگ ٹیمیں اپنے کل API بلوں میں 60% سے 88% تک کمی حاصل کرتی ہیں اور پہلے ٹوکن کا وقت (TTFT) کئی سیکنڈز سے گھٹ کر چند سو ملی سیکنڈز پر آ جاتا ہے۔
2. اندرونی فن تعمیر: KV کیش میکانکس اور Prefill کی رکاوٹ
پرامپٹ کیشنگ کی معاشیات کو سمجھنے کے لیے جدید AI ایکسلریٹر چپس (NVIDIA H100/B200، Google TPU v5e/v6e) پر ٹرانسفارمر کمپیوٹیشن کی جسمانی حدود کا ادراک ضروری ہے۔
روایتی اسٹیٹ لیس پائپ لائن:
[مستقل سسٹم پرامپٹ + ٹول اسکیمات + تاریخ (64,000 ٹوکنز)]
│
▼
[مکمل Prefill مرحلہ (O(N²) FLOPs)]
میٹرکس ضرب تمام Q، K، V کی دوبارہ گنتی کرتی ہے
│
▼
[پہلا ٹوکن تیار ہوا (TTFT: 2.8 سیکنڈ)]
[لاگت: مکمل بنیادی ریٹ × 64,000 ٹوکنز]
پرامپٹ کیشنگ فعال پائپ لائن:
[جامد پریفکس (60,000 ٹوکنز)] ──► [پریفکس ہیش بالکل مماثل!] ──► [محفوظ KV ٹینسرز لوڈ]
│ (میٹرکس حسابات ختم)
[متحرک سوال (4,000 ٹوکنز)] ──► [صرف فرق کے لیے Prefill] ────────────┤
▼
[پہلا ٹوکن تیار ہوا (TTFT: 0.35 سیکنڈ)]
[لاگت: کیش ریڈ ریٹ × 60k + بنیادی ریٹ × 4k]
سیلف اٹینشن کی حسابی پیچیدگی
معیاری سیلف اٹینشن میکانزم میں ان پٹ ٹوکنز Query ($Q$)، Key ($K$) اور Value ($V$) میٹرکس میں تبدیل کیے جاتے ہیں:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Prefill مرحلے کے دوران GPU تمام ٹوکنز کو متوازی طور پر پروسیس کرتا ہے۔ چونکہ سیلف اٹینشن ہر ٹوکن جوڑے کے باہمی تعلقات کا اندازہ لگاتی ہے، اس لیے حسابی پیچیدگی (FLOPs) تسلسل کی لمبائی $N$ کے ساتھ دوگنی رفتار سے بڑھتی ہے:
$$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$
جہاں $P$ ماڈل کے پیرامیٹرز کی تعداد ہے۔ 70B ماڈل پر 64,000 ٹوکنز کے پرامپٹ کے لیے صرف پہلے مرحلے میں تقریباً $5.8 \times 10^{14}$ فلوٹنگ پوائنٹ آپریشنز درکار ہوتے ہیں۔
Decode مرحلے میں ٹوکنز ایک ایک کر کے تیار ہوتے ہیں۔ پچھلے ٹوکنز کے حساب کو دہرانے سے بچنے کے لیے فعال ویکٹرز $K$ اور $V$ کو میموری میں محفوظ رکھا جاتا ہے—یہ KV کیش ہے۔ فی ٹوکن میموری کا فارمولا درج ذیل ہے:
$$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(بائٹس FP16 / BF16 میں)}$$
پرامپٹ کیشنگ اس کیش کو الگ الگ HTTP درخواستوں کے درمیان استعمال کرنے کی سہولت دیتی ہے، جس سے مماثل ہیش کی بنیاد پر بھاری حساب کتاب مکمل طور پر بچ جاتا ہے۔
3. فراہم کنندگان کا موازنہ: Anthropic بمقابلہ OpenAI بمقابلہ DeepSeek
| خصوصیت | Anthropic Claude | OpenAI (GPT-4o / o1 / o3) | DeepSeek (V3 / V4 / R1) |
|---|---|---|---|
| ایکٹیویشن کا طریقہ | واضح بریک پوائنٹس (cache_control) |
خودکار مشترکہ پریفکس میچنگ | خودکار مشترکہ پریفکس میچنگ |
| کم از کم حد | 1,024 ٹوکنز (Sonnet/Opus) 2,048 ٹوکنز (Haiku) |
1,024 ٹوکنز | 64 ٹوکنز (ہارڈویئر بلاک سائز) |
| بلاک کا سائز | صارف کے منتخب کردہ پوائنٹس (زیادہ سے زیادہ 4) | 1024 کے بعد 128 ٹوکنز کا اضافہ | بالکل 64 ٹوکنز پر مبنی |
| مدت (TTL) | 5 منٹ (معیاری عارضی) 1 گھنٹہ (توسیع شدہ درجہ) |
5 سے 10 منٹ (متحرک LRU الگورتھم) | کئی گھنٹے تا مستقل (NVMe) |
| TTL کی تجدید | ہر ہٹ پر 5 منٹ/1 گھنٹہ نئی تجدید | متواتر استعمال سے برقرار رہتی ہے | ہارڈ ڈرائیوز پر مستحکم محفوظ |
| رائٹ فیس (Write) | +25% (5 منٹ کے لیے 1.25x) +100% (1 گھنٹے کے لیے 2.0x) |
$0.00 (1.0x بنیادی ان پٹ ریٹ) | $0.00 (1.0x بنیادی ریٹ، صفر اضافی فیس) |
| ریڈ رعایت (Read) | 90% رعایت (0.10x بنیادی ریٹ) | 50% رعایت (0.50x بنیادی ریٹ) | 75% سے 90% رعایت (0.10x–0.25x) |
| اسٹوریج فیس | رائٹ سرچارج میں شامل | مفت | مفت (NVMe کیش آف لوڈ) |
| تاخیر میں کمی (TTFT) | 85% تک تیز ترین | 50% تک تیز ترین | 80% تک تیز ترین |
4. ماڈلز کی تفصیلی قیمتوں کا چارٹ (USD فی 1M ٹوکنز)
| ماڈل کا نام | بنیادی ان پٹ ($/1M) | کیش رائٹ ($/1M) | کیش ریڈ ($/1M) | ریڈ ڈسکاؤنٹ | بنیادی آؤٹ پٹ ($/1M) | کم از کم حد |
|---|---|---|---|---|---|---|
| Claude 3.5 / 3.7 Haiku | $0.80 | $1.00 (5m) / $1.60 (1h) | $0.08 | 90.0% | $4.00 | 2,048 ٹوکنز |
| Claude 3.7 Sonnet | $3.00 | $3.75 (5m) / $6.00 (1h) | $0.30 | 90.0% | $15.00 | 1,024 ٹوکنز |
| Claude 3 Opus / Opus 4.6 | $15.00 | $18.75 (5m) / $30.00 (1h) | $1.50 | 90.0% | $75.00 | 1,024 ٹوکنز |
| OpenAI GPT-4o mini | $0.15 | $0.15 | $0.075 | 50.0% | $0.60 | 1,024 ٹوکنز |
| OpenAI GPT-4o | $2.50 | $2.50 | $1.25 | 50.0% | $10.00 | 1,024 ٹوکنز |
| OpenAI o1 | $15.00 | $15.00 | $7.50 | 50.0% | $60.00 | 1,024 ٹوکنز |
| OpenAI o3-mini | $1.10 | $1.10 | $0.55 | 50.0% | $4.40 | 1,024 ٹوکنز |
| DeepSeek V3 / V4 (آف پیک) | $0.14 | $0.14 | $0.014 | 90.0% | $0.28 | 64 ٹوکنز |
| DeepSeek V3 / V4 (پیک ٹائم) | $0.27 | $0.27 | $0.027 | 90.0% | $1.10 | 64 ٹوکنز |
| DeepSeek R1 (استدلال) | $0.55 | $0.55 | $0.14 | 74.5% | $2.19 | 64 ٹوکنز |
| Google Gemini 2.5 Flash | $0.15 | $0.15 | $0.0375 | 75.0% | $0.60 | 32,768 ٹوکنز |
| Google Gemini 2.5 Pro | $1.25 | $1.25 | $0.3125 | 75.0% | $5.00 | 32,768 ٹوکنز |
5. لاگت کی بچت کا ریاضیاتی ماڈل اور بریک ایون پوائنٹ
بریک ایون کا تعین ($N^*$)
Anthropic کے 5 منٹ کے ماڈل کے لیے جہاں رائٹ پر 25% اضافی فیس ہے ($R_{\text{write}} = 1.25 R_{\text{base}}$، $R_{\text{read}} = 0.10 R_{\text{base}}$):
$$1.25 + 0.10(N - 1) \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278$$
قضیہ 1: Anthropic کے 5 منٹ TTL میں دوسری درخواست (N = 2) پر ہی خالص بچت شروع ہو جاتی ہے۔
1 گھنٹے کے توسیعی TTL کے لیے ($R_{\text{write}} = 2.0 R_{\text{base}}$):
$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11$$
قضیہ 2: 1 گھنٹے والے آپشن میں بریک ایون تیسری درخواست (N = 3) پر حاصل ہوتا ہے۔
90% زیادہ سے زیادہ بچت کا ثبوت
طویل سیشنز میں جب $N \to \infty$:
$$\lim_{N \to \infty} S(N) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$
- Anthropic اور DeepSeek: $1 - 0.10 = \mathbf{90.0\%}$ زیادہ سے زیادہ ممکنہ بچت۔
- OpenAI: $1 - 0.50 = \mathbf{50.0\%}$ زیادہ سے زیادہ ممکنہ بچت۔
6. کوڈ کا عملی نفاذ
Anthropic Claude (Python)
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
max_tokens=2048,
system=[
{
"type": "text",
"text": "سسٹم آرکیٹیکچر کی گائیڈ لائنز...\n" * 400,
"cache_control": {"type": "ephemeral"} # بریک پوائنٹ
}
],
messages=[{"role": "user", "content": "توثیق کا ماڈیول ری فیکٹر کریں۔"}]
)
print("کیش ریڈ ٹوکنز:", getattr(response.usage, "cache_read_input_tokens", 0))
OpenAI (TypeScript / Node.js)
import OpenAI from "openai";
const openai = new OpenAI();
const res = await openai.chat.completions.create({
model: "gpt-4o",
messages: [
{ role: "system", content: "مستقل سپورٹ ہدایات...\n".repeat(400) },
{ role: "user", content: "آرڈر کی صورتحال چیک کریں" }
]
});
console.log("کیش شدہ ٹوکنز:", (res.usage as any)?.prompt_tokens_details?.cached_tokens ?? 0);
7. صنعتی دنیا کے حقیقی نتائج
- کوڈنگ ایجنٹس (Claude Code، 250k لائن مونو ریپو): 20 انجینئرز کا ماہانہ خرچ $29,700 سے گھٹ کر $4,334 فی ماہ رہ گیا (85.4% خالص بچت).
- ریگولیٹری دستاویزات RAG (OpenAI GPT-4o): ماہانہ 50,000 سوالات کا خرچ $5,625 سے گر کر $2,975.63 فی ماہ رہ گیا (47.1% بچت).
- کسٹمر سپورٹ سسٹم (DeepSeek V3/V4): ماہانہ 20 لاکھ مکالموں کا خرچ $3,360 سے کم ہو کر $378.34 فی ماہ رہ گیا (88.7% بچت).
8. کیش کو ضائع کرنے والی پانچ بڑی غلطیاں
- سسٹم پرامپٹ میں ٹائم اسٹیمپ شامل کرنا: ہر سیکنڈ ہیش تبدیل ہونے سے کیش ہٹ ریٹ 0% ہو جاتا ہے۔
- ٹولز ایرے کی بے ترتیب ترتیب: غیر منظم JSON سٹرکچر ہیش کو خراب کر دیتا ہے۔ ہمیشہ حروف تہجی کے مطابق ترتیب دیں۔
- پرامپٹ کے درمیان متحرک متغیرات رکھنا: کیشنگ مشترکہ پریفکس پر منحصر ہے۔ متحرک مواد ہمیشہ آخر میں رکھیں۔
- 5 منٹ کے TTL ونڈو کو نظر انداز کرنا: طویل وقفوں کے لیے 1 گھنٹے کا توسیعی آپشن استعمال کریں۔
- 1,024 ٹوکنز سے کم پرامپٹ بھیجنا: کم سائز کا ڈیٹا کیش نہیں کیا جاتا۔
9. نتیجہ اور LLMPodium کا فیصلہ
- خود مختار کوڈنگ ایجنٹس کے لیے: Anthropic Claude 3.7 Sonnet 90% ریڈ رعایت کی وجہ سے بہترین سرمایہ کاری ہے۔
- موجودہ پروجیکٹس میں بغیر کوڈ بدلے بچت کے لیے: OpenAI GPT-4o بغیر کسی اضافی محنت کے 50% لاگت کم کرتی ہے۔
- بہت بڑے حجم اور سستے ترین بجٹ کے لیے: DeepSeek V3/V4 64 ٹوکن کی حد اور $0.014/1M ریٹ کے ساتھ سب سے آگے ہے۔