দ্রুত উত্তর: প্রম্পট ক্যাশিং (Prompt Caching) একাধিক রিকোয়েস্টের মধ্যে KV ক্যাশ টেনসর পুনর্ব্যবহার করে LLM API ইনপুট খরচ ৫০% থেকে ৯০% কমায় এবং ল্যাটেন্সি (TTFT) ৮৫% পর্যন্ত হ্রাস করে। Anthropic স্পষ্ট ব্রেকপয়েন্টসহ ৯০% রিড ডিসকাউন্ট দেয় (১০২৪ টোকেন থ্রেশহোল্ড)। OpenAI কোনো রাইট চার্জ ছাড়াই স্বয়ংক্রিয় ৫০% ডিসকাউন্ট প্রদান করে। DeepSeek মাত্র ৬৪ টোকেন থ্রেশহোল্ড এবং স্থায়ী NVMe স্টোরেজের মাধ্যমে ৮০%–৯০% সাশ্রয় নিশ্চিত করে।
১. ভূমিকা: স্টেটলেস LLM API-তে স্টেটের অর্থনীতি
আধুনিক লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) API কাঠামোগতভাবে স্টেটলেস (Stateless): /v1/chat/completions বা /v1/messages-এ পাঠানো প্রতিটি HTTP POST রিকোয়েস্টে সম্পূর্ণ কথোপকথনের ইতিহাস, সিস্টেম নির্দেশনা, টুল স্কিমা এবং প্রাসঙ্গিক ডকুমেন্টস পুনরায় পাঠাতে হয়। এই স্টেটলেস ডিজাইন সার্ভার ক্লাস্টারের লোড ব্যালেন্সিং সহজ করলেও মাল্টি-টার্ন এজেন্ট ওয়ার্কফ্লোতে বিশাল আর্থিক ও কম্পিউটেশনাল অপচয়ের সৃষ্টি করে।
Claude Code, Roo Code, Aider, Devin বা এন্টারপ্রাইজ RAG সিস্টেমে এজেন্ট প্রতিটি ধাপে একই সিস্টেম প্রম্পট, OpenAPI স্পেসিফিকেশন এবং কোডবেস প্রসঙ্গ বারবার পাঠায়। একটি সাধারণ ১৫-টার্ন কোডিং সেশনে মোট প্রেরিত টোকেনের ৯৫% থেকে ৯৮% অংশই হলো স্ট্যাটিক প্রিফিক্স (Static Prefix), যা মডেল আগেই প্রক্রিয়াকরণ করেছে।
পূর্বে ক্লাউড প্রোভাইডাররা প্রতি ধাপে প্রতিটি টোকেনের জন্য পূর্ণ বেস ইনপুট ফি ধার্য করত, যার ফলে ইনফারেন্স ক্লাস্টারকে অপরিবর্তিত প্রসঙ্গের ওপর জটিল ম্যাট্রিক্স গুণন (Prefill ফেজ) পুনরায় চালাতে হতো। প্রম্পট ক্যাশিং (Prompt Caching) এই অদক্ষতা দূর করে। স্ট্যাটিক প্রিফিক্সের প্রাক-গণনাকৃত Key-Value (KV) অ্যাক্টিভেশন টেনসর উচ্চগতির GPU মেমরি (HBM), হোস্ট র্যাম বা দ্রুতগতির NVMe SSD-তে সংরক্ষণ করে ইনফারেন্স ইঞ্জিন অপ্রয়োজনীয় প্রিফিল কম্পিউটেশন পুরোপুরি বাইপাস করে।
প্রম্পট ক্যাশিং সঠিকভাবে প্রয়োগকারী ইঞ্জিনিয়ারিং দলগুলো সাধারণত API বিলে ৬০% থেকে ৮৮% পর্যন্ত খরচ কমিয়ে আনে এবং প্রথম টোকেন পাওয়ার সময় (TTFT) কয়েক সেকেন্ড থেকে কয়েকশো মিলিসেকেন্ডে নামিয়ে আনে।
২. আর্কিটেকচার বিশ্লেষণ: KV ক্যাশ মেকানিক্স ও Prefill বাধা
প্রম্পট ক্যাশিংয়ের অর্থনৈতিক সুবিধা বোঝার জন্য আধুনিক এক্সিলারেটরে (NVIDIA H100/B200, Google TPU v5e/v6e) ট্রান্সফরমার ইনফারেন্সের সীমাবদ্ধতা জানা জরুরি।
প্রথাগত স্টেটলেস ইনফারেন্স পাইপলাইন:
[স্ট্যাটিক সিস্টেম প্রম্পট + টুল স্কিমা + হিস্ট্রি (৬৪,০০০ টোকেন)]
│
▼
[সম্পূর্ণ Prefill ফেজ (O(N²) FLOPs)]
ম্যাট্রিক্স গুণনে সমস্ত Q, K, V নতুন করে হিসাব
│
▼
[প্রথম টোকেন জেনারেট (TTFT: ২.৮ সেকেন্ড)]
[খরচ: পূর্ণ বেস ইনপুট রেট × ৬৪,০০০ টোকেন]
প্রম্পট ক্যাশিং সক্রিয় পাইপলাইন:
[স্ট্যাটিক প্রিফিক্স (৬০,০০০ টোকেন)] ──► [প্রিফিক্স হ্যাশ ম্যাচ!] ──► [ক্যাশড KV টেনসর লোড]
│ (ম্যাট্রিক্স গণনা বাইপাস)
[ডায়নামিক কুয়েরি (৪,০০০ টোকেন)] ──► [কেবল পার্থক্যের জন্য Prefill] ───┤
▼
[প্রথম টোকেন জেনারেট (TTFT: ০.৩৫ সেকেন্ড)]
[খরচ: ক্যাশ রিড রেট × ৬০k + বেস রেট × ৪k]
সেলফ-অ্যাটেনশনের কম্পিউটেশনাল জটিলতা
সেলফ-অ্যাটেনশন মেকানিজমে ইনপুট টোকেনগুলো Query ($Q$), Key ($K$) এবং Value ($V$) ম্যাট্রিক্সে প্রজেক্ট করা হয়:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Prefill ফেজে GPU সমান্তরালভাবে প্রম্পটের সমস্ত টোকেন প্রক্রিয়া করে। যেহেতু সেলফ-অ্যাটেনশন প্রতিটি টোকেন জোড়ার পারস্পরিক সম্পর্ক হিসাব করে, তাই কম্পিউটেশনাল জটিলতা (FLOPs) সিকোয়েন্সের দৈর্ঘ্য $N$-এর সাথে দ্বিঘাতীয় (Quadratic) হারে বৃদ্ধি পায়: $$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$ এখানে $P$ হলো মডেল প্যারামিটার সংখ্যা। ৭০ বিলিয়ন প্যারামিটারের মডেলে ৬৪,০০০ টোকেন প্রম্পটের জন্য শুধুমাত্র Prefill ধাপেই প্রায় $5.8 \times 10^{14}$ ফ্লোটিং-পয়েন্ট অপারেশনের প্রয়োজন হয়।
Decode ফেজে টোকেনগুলো ক্রমানুসারে একটির পর একটি তৈরি হয়। আগের টোকেনগুলোর পুনরাবৃত্তি এড়াতে অ্যাক্টিভেশন ভেক্টর $K$ ও $V$ মেমরিতে সংরক্ষিত থাকে—এটিই KV ক্যাশ। প্রতিটি টোকেনের মেমরি পরিমাপ সূত্র: $$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(বাইট, FP16 / BF16 ফরম্যাটে)}$$
প্রম্পট ক্যাশিং এই ক্যাশ মেমরিকে বিভিন্ন রিকোয়েস্টের মধ্যে শেয়ার করার সুযোগ দেয়, যার ফলে প্রিফিক্স হ্যাশ মিলে গেলেই Prefill ধাপটি সম্পূর্ণ এড়িয়ে যাওয়া সম্ভব হয়।
৩. প্রোভাইডার তুলনা ম্যাট্রিক্স: Anthropic বনাম OpenAI বনাম DeepSeek
| আর্কিটেকচারাল প্যারামিটার | Anthropic Claude | OpenAI (GPT-4o / o1 / o3) | DeepSeek (V3 / V4 / R1) |
|---|---|---|---|
| অ্যাক্টিভেশন পদ্ধতি | স্পষ্ট ব্রেকপয়েন্ট (cache_control) |
স্বয়ংক্রিয় লঙ্গেস্ট কমন প্রিফিক্স | স্বয়ংক্রিয় লঙ্গেস্ট কমন প্রিফিক্স |
| ন্যূনতম থ্রেশহোল্ড | ১,০২৪ টোকেন (Sonnet/Opus) ২,০৪৮ টোকেন (Haiku) |
১,০২৪ টোকেন | ৬৪ টোকেন (হার্ডওয়্যার ব্লক) |
| ব্লক গ্র্যানুলারিটি | ইউজার ব্রেকপয়েন্ট (সর্বোচ্চ ৪টি/রিকোয়েস্ট) | ১০২৪-এর পর ১২৮ টোকেন ধাপ | সুনির্দিষ্ট ৬৪ টোকেন অ্যালাইনমেন্ট |
| মেয়াদ (TTL) | ৫ মিনিট (স্ট্যান্ডার্ড) ১ ঘণ্টা (বর্ধিত টায়ার) |
৫ থেকে ১০ মিনিট (ডায়নামিক LRU) | কয়েক ঘণ্টা থেকে স্থায়ী (NVMe) |
| TTL নবায়ন | প্রতি হিটে ৫ মিনিট/১ ঘণ্টা বৃদ্ধি | ব্যবহারের সাথে সাথে সক্রিয় থাকে | ডিস্কে স্থায়ীভাবে সংরক্ষিত থাকে |
| রাইট সারচার্জ (Write) | +২৫% (৫ মিনিটের জন্য ১.২৫ গুণ) +১০০% (১ ঘণ্টার জন্য ২.০ গুণ) |
$০.০০ (১.০ গুণ বেস ইনপুট রেট) | $০.০০ (১.০ গুণ বেস রেট, কোনো বাড়তি ফি নেই) |
| রিড ডিসকাউন্ট (Read) | ৯০% ডিসকাউন্ট (০.১০ গুণ বেস রেট) | ৫০% ডিসকাউন্ট (০.৫০ গুণ বেস রেট) | ৭৫% থেকে ৯০% ডিসকাউন্ট (০.১০x–০.২৫x) |
| স্টোরেজ চার্জ | প্রাথমিক রাইট সারচার্জের অন্তর্ভুক্ত | সম্পূর্ণ ফ্রি | সম্পূর্ণ ফ্রি (NVMe স্টোরেজ) |
| ল্যাটেন্সি হ্রাস (TTFT) | ৮৫% পর্যন্ত দ্রুততর | ৫০% পর্যন্ত দ্রুততর | ৮০% পর্যন্ত দ্রুততর |
৪. মডেলভিত্তিক পূর্ণাঙ্গ মূল্য তালিকা (প্রতি ১০ লাখ টোকেনে USD)
| মডেলের নাম | বেস ইনপুট ($/1M) | ক্যাশ রাইট ($/1M) | ক্যাশ রিড ($/1M) | রিড ডিসকাউন্ট | বেস আউটপুট ($/1M) | ন্যূনতম থ্রেশহোল্ড |
|---|---|---|---|---|---|---|
| Claude 3.5 / 3.7 Haiku | $0.80 | $1.00 (5m) / $1.60 (1h) | $0.08 | 90.0% | $4.00 | ২,০৪৮ টোকেন |
| Claude 3.7 Sonnet | $3.00 | $3.75 (5m) / $6.00 (1h) | $0.30 | 90.0% | $15.00 | ১,০২৪ টোকেন |
| Claude 3 Opus / Opus 4.6 | $15.00 | $18.75 (5m) / $30.00 (1h) | $1.50 | 90.0% | $75.00 | ১,০২৪ টোকেন |
| OpenAI GPT-4o mini | $0.15 | $0.15 | $0.075 | 50.0% | $0.60 | ১,০২৪ টোকেন |
| OpenAI GPT-4o | $2.50 | $2.50 | $1.25 | 50.0% | $10.00 | ১,০২৪ টোকেন |
| OpenAI o1 | $15.00 | $15.00 | $7.50 | 50.0% | $60.00 | ১,০২৪ টোকেন |
| OpenAI o3-mini | $1.10 | $1.10 | $0.55 | 50.0% | $4.40 | ১,০২৪ টোকেন |
| DeepSeek V3 / V4 (অফ-পিক) | $0.14 | $0.14 | $0.014 | 90.0% | $0.28 | ৬৪ টোকেন |
| DeepSeek V3 / V4 (পিক) | $0.27 | $0.27 | $0.027 | 90.0% | $1.10 | ৬৪ টোকেন |
| DeepSeek R1 (রিজনিং) | $0.55 | $0.55 | $0.14 | 74.5% | $2.19 | ৬৪ টোকেন |
| Google Gemini 2.5 Flash | $0.15 | $0.15 | $0.0375 | 75.0% | $0.60 | ৩২,৭৬৮ টোকেন |
| Google Gemini 2.5 Pro | $1.25 | $1.25 | $0.3125 | 75.0% | $5.00 | ৩২,৭৬৮ টোকেন |
৫. খরচ সাশ্রয়ের গাণিতিক মডেল ও ব্রেক-ইভেন টার্ন
ব্রেক-ইভেন পয়েন্ট ($N^*$) নির্ণয়
Anthropic-এ যেখানে রাইটের ওপর ২৫% বাড়তি চার্জ রয়েছে ($R_{\text{write}} = 1.25 R_{\text{base}}$, $R_{\text{read}} = 0.10 R_{\text{base}}$): $$1.25 + 0.10(N - 1) \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278$$
উপপাদ্য ১: Anthropic-এর ৫ মিনিটের TTL-এ দ্বিতীয় রিকোয়েস্ট (N = 2) থেকেই সরাসরি নিট সাশ্রয় শুরু হয়। ১ ঘণ্টার বর্ধিত TTL-এর ক্ষেত্রে ($R_{\text{write}} = 2.0 R_{\text{base}}$):
$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11$$
উপপাদ্য ২: Anthropic-এর ১ ঘণ্টার TTL-এ তৃতীয় রিকোয়েস্টে (N = 3) ব্রেক-ইভেন অর্জিত হয়।
৯০% খরচ কমানোর সীমা প্রমাণ
দীর্ঘ সেশনে যখন $N \to \infty$:
$$\lim_{N \to \infty} S(N) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$
- Anthropic ও DeepSeek: $1 - 0.10 = \mathbf{90.0\%}$ সর্বোচ্চ তাত্ত্বিক সাশ্রয়।
- OpenAI: $1 - 0.50 = \mathbf{50.0\%}$ সর্বোচ্চ তাত্ত্বিক সাশ্রয়।
৬. কোড বাস্তবায়ন উদাহরণ
Anthropic Claude (Python)
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
max_tokens=2048,
system=[
{
"type": "text",
"text": "সিস্টেম আর্কিটেকচার নির্দেশিকা...\n" * 400,
"cache_control": {"type": "ephemeral"} # ব্রেকপয়েন্ট
}
],
messages=[{"role": "user", "content": "অথেন্টিকেশন মডিউল রিফ্যাক্টর করুন।"}]
)
print("ক্যাশ রিড টোকেন:", getattr(response.usage, "cache_read_input_tokens", 0))
OpenAI (TypeScript / Node.js)
import OpenAI from "openai";
const openai = new OpenAI();
const res = await openai.chat.completions.create({
model: "gpt-4o",
messages: [
{ role: "system", content: "নির্দিষ্ট কর্পোরেট নির্দেশিকা...\n".repeat(400) },
{ role: "user", content: "অর্ডার স্ট্যাটাস পরীক্ষা করুন" }
]
});
console.log("ক্যাশড টোকেন:", (res.usage as any)?.prompt_tokens_details?.cached_tokens ?? 0);
৭. বাস্তব এন্টারপ্রাইজ কেস স্টাডি
- কোডিং এজেন্ট (Claude Code, ২৫০k লাইন মোনোরিপো): ২০ জন ইঞ্জিনিয়ারের মাসিক বিল $২৯,৭০০ থেকে কমে $৪,৩৩৪ / মাস হয়েছে (৮৫.৪% নিট সাশ্রয়)।
- দীর্ঘ ডকুমেন্ট RAG (OpenAI GPT-4o): ৫০,০০০ মাসিক কুয়েরির খরচ $৫,৬২৫ থেকে নেমে $২,৯৭৫.৬৩ / মাস হয়েছে (৪৭.১% সাশ্রয়)।
- বৃহৎ কাস্টমার সাপোর্ট ইঞ্জিন (DeepSeek V3/V4): ২০ লাখ মাসিক কথোপকথনের খরচ $৩,৩৬০ থেকে হ্রাস পেয়ে $৩৭৮.৩৪ / মাস হয়েছে (৮৮.৭% সাশ্রয়)।
৮. ক্যাশ নষ্টকারী পাঁচটি মারাত্মক ভুল
- সিস্টেম প্রম্পটে ডায়নামিক টাইমস্ট্যাম্প যোগ করা: প্রতি সেকেন্ডে হ্যাশ পরিবর্তিত হয়ে হিট রেট ০% হয়ে যায়।
- টুলস অ্যারের এলোমেলো ক্রম: JSON সিরিয়ালাইজেশনে ক্রম পরিবর্তন হলে ক্যাশ মিস হয়। সব সময় বর্ণানুক্রমিকভাবে সাজান।
- প্রম্পটের মাঝে ডায়নামিক ভ্যারিয়েবল ঢোকানো: প্রিফিক্স ক্যাশিং সাধারণ প্রিফিক্সে কাজ করে। পরিবর্তনশীল তথ্য সবসময় শেষে রাখুন।
- ৫ মিনিটের TTL মেয়াদ ভুলে যাওয়া: দীর্ঘ বিরতির পর ব্যবহারের ক্ষেত্রে ১ ঘণ্টার এক্সটেন্ডেড TTL বেছে নিন।
- ন্যূনতম আকারের চেয়ে ছোট প্রম্পট পাঠানো: ১,০২৪ টোকেনের কম হলে ক্যাশিং সক্রিয় হয় না।
৯. উপসংহার ও LLMPodium রায়
- অটোনোমাস কোডিং এজেন্টের জন্য সেরা: Anthropic Claude 3.7 Sonnet ৯০% রিড ডিসকাউন্টের কারণে সর্বোচ্চ ROI প্রদান করে।
- কোড পরিবর্তন ছাড়া তাৎক্ষণিক সাশ্রয়ে: OpenAI GPT-4o স্বয়ংক্রিয়ভাবে ৫০% খরচ কমায়।
- বিশাল ভলিউমে সর্বনিম্ন খরচে: DeepSeek V3/V4 ৬৪ টোকেন থ্রেশহোল্ড এবং $০.০১৪/1M রেটের মাধ্যমে বাজারে অপ্রতিদ্বন্দ্বী।