त्वरित उत्तर: 2026 में, उच्च-प्रदर्शन प्रोडक्शन के लिए सबसे सस्ता AI मॉडल DeepSeek-V3 है, जिसकी कीमत $0.14/1M इनपुट और $0.28/1M आउटपुट टोकन है (कैश हिट्स पर केवल $0.014/1M)। मुफ्त AI मॉडल्स में Google Gemini 2.5 Flash Google AI Studio के माध्यम से 15 RPM का फ्री टियर देता है, जबकि Qwen 2.5 Coder 32B कोडिंग के लिए सबसे सस्ता LLM है ($0.05/$0.15 प्रति 1M टोकन)।
1. प्रस्तावना: 2026 में प्रोडक्शन AI का अर्थशास्त्र
2024 और 2025 की शुरुआत में, अत्याधुनिक फ्रंटियर मॉडल्स को तैनात करने का मतलब अत्यधिक एंटरप्राइज टैरिफ का भुगतान करना था: OpenAI के GPT-4o की कीमत $2.50 से $5.00 प्रति मिलियन इनपुट टोकन और $10.00 से $15.00 प्रति मिलियन आउटपुट टोकन थी, जबकि Anthropic के Claude 3.5 Sonnet का शुल्क $3.00/$15.00 प्रति मिलियन टोकन था। मल्टी-एजेंट सिस्टम, रिकर्सिव कोडबेस इंडेक्सर्स, या रियल-टाइम RAG पाइपलाइनों को संचालित करने वाली इंजीनियरिंग टीमों के लिए जो प्रति माह 500 मिलियन टोकन प्रोसेस करती हैं, शुद्ध इन्फरेंस बिल तेजी से $15,000 से $40,000 प्रति माह तक पहुंच जाते थे।
2026 में, जनरेटिव AI का यूनिट अर्थशास्त्र दो परिमाणों (orders of magnitude) तक कम हो गया:
[2024 Frontier Baseline] GPT-4o / Claude 3.5 Sonnet
Input: $3.00 / 1M tokens | Output: $15.00 / 1M tokens
Monthly Bill (100M in / 20M out): $300 + $300 = $600
[2026 Commodity Tier] DeepSeek-V3 / Gemini 2.5 Flash / MiniMax M2.5
Input: $0.14 / 1M tokens | Output: $0.28 / 1M tokens (DeepSeek-V3)
Monthly Bill (100M in / 20M out): $14 + $5.60 = $19.60 (96.7% Cost Reduction!)
आज, टिकाऊ AI सॉफ्टवेयर बनाने के लिए इन्फरेंस यूनिट लागत ($/1M टोकन), सर्विंग लेटेंसी (Time-To-First-Token और टोकन/सेकंड), और टास्क-विशिष्ट क्षमता (MMLU-Pro, SWE-bench Verified, LiveCodeBench) के त्रिकोण को अनुकूलित करना आवश्यक है।
चाहे आप बड़े पैमाने पर डेटा वर्गीकरण के लिए सबसे सस्ते AI मॉडल की तलाश कर रहे हों, कोडिंग वर्कफ़्लो के लिए सबसे सस्ता LLM ढूंढ रहे हों, या शून्य-लागत डेवलपर टियर वाले व्यावहारिक फ्री AI मॉडल तलाश रहे हों, यह व्यापक 2026 बेंचमार्क प्रोप्राइटरी सर्वरलेस एपीआई, ओपन-वेट सेल्फ-होस्टिंग और आक्रामक प्रॉम्प्ट कैशिंग आर्किटेक्चर के बीच प्रोडक्शन ट्रेड-ऑफ का विश्लेषण करता है।
2. व्यापक प्रोडक्शन लागत और बेंचमार्क मैट्रिक्स (2026)
एक निष्पक्ष और वस्तुनिष्ठ आधार प्रदान करने के लिए, हमारी इंजीनियरिंग टीम ने समान उच्च-समवर्ती भार (50 समवर्ती स्ट्रीम, स्ट्रीमिंग SSE, वार्म KV-कैश) के तहत प्रमुख लागत-प्रभावी दावेदारों का मूल्यांकन किया।
+-----------------------------------------------------------------------------------------------------------------------+
| 2026 PRODUCTION INFERENCE PRICING & BENCHMARK MATRIX |
+----------------------+--------------------+-------------------+-----------------+-----------+-----------+-------------+
| Model Name | Input Price ($/1M) | Output Price | Cached Input | SWE-bench | LCB Pass@1| TTFT (p50) |
| | | ($/1M) | Price ($/1M) | Verified | (0.2) | Streaming |
+----------------------+--------------------+-------------------+-----------------+-----------+-----------+-------------+
| DeepSeek-V3 (671B) | $0.14 | $0.28 | $0.014 (-90%) | 49.2% | 65.4% | 380 ms |
| DeepSeek-R1 (Reason) | $0.55 | $2.19 | $0.14 (-75%) | 53.8% | 71.2% | 850 ms |
| Gemini 2.5 Flash | $0.075 (<128k) | $0.30 (<128k) | $0.01875 (-75%) | 46.5% | 62.8% | 210 ms |
| MiniMax M2.5 | $0.10 | $0.20 | $0.020 (-80%) | 44.1% | 58.6% | 290 ms |
| Qwen 2.5 Coder 32B | $0.05 (DeepInfra) | $0.15 (DeepInfra) | N/A (Serverless)| 41.8% | 61.2% | 180 ms |
| Llama 3.3 70B Inst. | $0.18 (Groq/TGI) | $0.59 (Groq/TGI) | Provider Spec. | 38.4% | 54.7% | 140 ms |
| OpenAI GPT-4o-mini | $0.15 | $0.60 | $0.075 (-50%) | 41.2% | 52.3% | 240 ms |
| Claude 3.5 Haiku | $0.80 | $4.00 | $0.080 (-90%) | 40.6% | 51.4% | 220 ms |
+----------------------+--------------------+-------------------+-----------------+-----------+-----------+-------------+
मुख्य विश्लेषणात्मक निष्कर्ष:
- $0.20/1M बेसलाइन: DeepSeek-V3 और MiniMax M2.5 ने लगभग फ्रंटियर-स्तर की बुद्धिमत्ता के लिए प्रति मिलियन टोकन $0.30 से कम की मिश्रित लागत को मजबूती से स्थापित किया है।
- लागत के एक अंश पर कोडिंग समानता: Qwen 2.5 Coder 32B केवल $0.05/$0.15 प्रति मिलियन टोकन पर 61.2% का LiveCodeBench Pass@1 स्कोर प्रदान करता है—जो Sonnet 3.5 की तुलना में लगभग 98% सस्ता है और शुद्ध Python/TypeScript सिंथेसिस में पुराने फ्रंटियर मॉडल को पछाड़ता है।
- KV कैश आर्बिट्राज: DeepSeek की कॉन्टेक्स्ट कैश हिट दर इनपुट लागत को घटाकर आश्चर्यजनक रूप से $0.014 प्रति मिलियन टोकन कर देती है, जिससे लंबे संदर्भ वाले सिस्टम प्रॉम्प्ट व्यावहारिक रूप से मुफ्त हो जाते हैं।
3. शीर्ष 5 बजट दावेदारों का गहन आर्किटेक्चरल विश्लेषण
1. DeepSeek-V3 और DeepSeek-R1: ओपन-वेट प्रतिमान का बदलाव
DeepSeek ने वैश्विक AI उद्योग को चौंका दिया जब उसने साबित किया कि 671B पैरामीटर वाले Mixture-of-Experts (MoE) आर्किटेक्चर (प्रति टोकन केवल 37B पैरामीटर सक्रिय) को FP8 मिक्स्ड प्रिसिजन, Multi-head Latent Attention (MLA), और नोड के भीतर DualPipe पाइपलाइनिंग का उपयोग करके $6 मिलियन से कम के अनुमानित बजट में प्री-ट्रेन किया जा सकता है।
[DeepSeek-V3 Sparse MoE Pipeline]
Input Tokens ──> [Multi-Head Latent Attention (MLA)] ──> [Router: Top-8 of 256 Experts]
│ │
(Massive KV Cache Compression) (37B Active / 671B Total)
│ │
└─────────────────┬───────────────────┘
▼
[High Throughput / Low Cost]
- इन्फरेंस दक्षता: MLA के माध्यम से KV-कैश मेमोरी फ़ुटप्रिंट को भारी रूप से संकुचित करके, DeepSeek Llama जैसे मानक Multi-Head Attention (MHA) आर्किटेक्चर की तुलना में प्रति H800/H100 नोड 4x से 8x अधिक बैच आकार प्रोसेस कर सकता है।
- DeepSeek-R1 (रीज़निंग): मानव फीडबैक के बिना बड़े पैमाने पर रीइन्फोर्समेंट लर्निंग (Cold-Start + Multi-Stage RL) का उपयोग करके विस्तृत Chain-of-Thought (CoT) तर्क उत्पन्न करता है। यद्यपि अत्यधिक विस्तार के कारण आउटपुट टोकन की कीमत $2.19/1M है, इसकी रीज़निंग गहराई OpenAI o1 की तुलना में 15% से भी कम लागत पर टक्कर देती है।
- प्रोडक्शन उपयोग: ऑटोनॉमस कोडिंग एजेंट, सिमेंटिक सर्च री-रैंकर और जटिल संरचित JSON एक्सट्रैक्शन पाइपलाइनों के लिए अत्यंत उपयुक्त।
2. Google Gemini 2.5 Flash: अल्ट्रा-लो लेटेंसी और उदार फ्री लिमिट्स
Google का हल्का मल्टीमॉडल इंजन विशेष रूप से हाइपर-स्केल उपभोक्ता ऐप्लिकेशनों और लेटेंसी-संवेदनशील एपीआई वर्कफ़्लो के लिए डिज़ाइन किया गया है।
- मूल्य निर्धारण संरचना: 128k से कम के प्रॉम्प्ट के लिए $0.075 प्रति 1M इनपुट टोकन पर, Gemini 2.5 Flash हाइपरस्केलर्स के बीच आधिकारिक तौर पर सबसे कम कीमत वाला प्रोप्राइटरी एपीआई है। 128k से अधिक (1M टोकन तक) के प्रॉम्प्ट के लिए इनपुट लागत $0.15/1M समायोजित होती है।
- फ्री टियर अर्थशास्त्र: Google AI Studio 15 रिक्वेस्ट प्रति मिनट (RPM) और 1,500 रिक्वेस्ट प्रति दिन (RPD) का स्थायी फ्री टियर प्रदान करता है, जिसमें 1M टोकन प्रति मिनट की सीमा है (डेटा मॉडल प्रशिक्षण के लिए साझा किया जाता है)। इंडी डेवलपर्स और प्रोटोटाइप परीक्षण के लिए, यह उपलब्ध सबसे सक्षम फ्री AI मॉडल है।
- मल्टीमॉडल गति: औसतन 210ms के TTFT के साथ ऑडियो, वीडियो, पीडीएफ पार्सिंग और इमेज विश्लेषण के लिए नेटिव समर्थन।
3. MiniMax M2.5: लॉन्ग-कॉन्टेक्स्ट और वॉयस का प्रमुख दावेदार
MiniMax एशिया और पश्चिमी डेवलपर हलकों में एक आक्रामक एंटरप्राइज प्रतिस्पर्धी के रूप में उभरा है, जो लंबी कहानी निरंतरता और संवादात्मक एजेंटों के लिए अनुकूलित एक संतुलित MoE आर्किटेक्चर प्रदान करता है।
- अर्थशास्त्र: $0.10/1M इनपुट और $0.20/1M आउटपुट की निश्चित कीमत पर, MiniMax आउटपुट मूल्य निर्धारण में GPT-4o-mini को 66% से पीछे छोड़ देता है।
- कॉन्टेक्स्ट विंडो: 192k गहराई पर लगभग त्रुटिहीन सुई-इन-हेस्टैक (needle-in-a-haystack) रिकॉल के साथ 200k नेटिव संदर्भ।
- डेवलपर इकोसिस्टम: 300ms से कम की p50 लेटेंसी और यूएस/ईयू पीक आवर्स के दौरान शून्य थ्रॉटलिंग के साथ सीधे OpenAI SDK संगतता (
/v1/chat/completions)।
4. Qwen 2.5 Coder 32B: कोडिंग के लिए सबसे सस्ता LLM
Alibaba Cloud के समर्पित प्रोग्रामिंग मॉडल ने स्थानीयकृत और सर्वरलेस कोड सिंथेसिस में क्रांति ला दी है।
- SWE-bench Verified (41.8%): एंड-टू-एंड GitHub इश्यू रिज़ॉल्यूशन पर Claude 3.5 Haiku और GPT-4o-mini से बेहतर प्रदर्शन करता है, जबकि इसकी लागत उनकी कीमत के एक-तिहाई से भी कम है।
- सर्विंग बहुमुखी प्रतिभा: चूंकि इसमें केवल 32B डेंस पैरामीटर हैं, Qwen 2.5 Coder को 4-बिट (AWQ या EXL2) में क्वांटाइज़ किया जा सकता है और 45 टोकन प्रति सेकंड की दर से एक सिंगल कंज्यूमर GPU (NVIDIA RTX 4090 24GB या 32GB यूनिफाइड मेमोरी वाले Apple Mac M-सीरीज़) पर स्थानीय रूप से चलाया जा सकता है।
- होस्टेड सर्वरलेस विकल्प: DeepInfra, Together AI और Fireworks AI $0.05/$0.15 प्रति 1M टोकन से शुरू होने वाले एंडपॉइंट प्रदान करते हैं।
5. Llama 3.3 70B Instruct: एंटरप्राइज ओपन स्टैंडर्ड
Meta का प्रमुख डेंस ओपन-वेट्स रिलीज़ सुलभ 70B पैरामीटर फ़ुटप्रिंट के भीतर पूर्ववर्ती 405B रिलीज़ का प्रदर्शन प्रदान करता है।
- Groq LPU त्वरण: Groq के लैंग्वेज प्रोसेसिंग यूनिट्स (LPUs) पर, Llama 3.3 70B 140ms से कम के TTFT के साथ 280-350 टोकन प्रति सेकंड पर स्ट्रीम करता है।
- फाइन-ट्यूनिंग अर्थशास्त्र: पूर्ण ओपन वेट्स एंटरप्राइजेज को वेंडर लॉक-इन या प्रोप्राइटरी डेटा सुरक्षा जोखिमों के बिना आंतरिक डेटा पर LoRA/QLoRA का उपयोग करके फाइन-ट्यून करने की अनुमति देते हैं।
4. फ्री AI मॉडल्स: 2026 में डेवलपर्स के लिए व्यावहारिक फ्री टियर्स
शून्य पूंजी के साथ उत्पाद शुरू करते समय, इंजीनियरिंग टीमें दैनिक रूप से हजारों स्वचालित संचालन को बनाए रखने के लिए वैध डेवलपर टियर को जोड़ सकती हैं:
+-----------------------------------------------------------------------------------------------------+
| FREE AI MODEL TIERS FOR PRODUCTION TESTING |
+----------------------+---------------------------+--------------------------------+-----------------+
| Provider | Model Offerings | Free Quotas | Constraints |
+----------------------+---------------------------+--------------------------------+-----------------+
| Google AI Studio | Gemini 2.5 Flash, | 15 RPM, 1,500 RPD, | Prompt data |
| | Gemini 2.5 Pro (Exp) | 1,000,000 TPM | logged by Google|
+----------------------+---------------------------+--------------------------------+-----------------+
| Groq Cloud | Llama 3.3 70B, | 30 RPM, 14,400 RPD, | Strict TPM caps |
| | Qwen 2.5 Coder 32B | 6,000 TPM | on peak hours |
+----------------------+---------------------------+--------------------------------+-----------------+
| Hugging Face | Qwen 2.5 72B, Mistral Nemo| Rate limited by IP | Cold start delay|
| Serverless Inference | DeepSeek-R1 Distill | (Approx. 1,000 req/day) | (5s - 30s) |
+----------------------+---------------------------+--------------------------------+-----------------+
| Cloudflare Workers AI| Llama 3.3 70B, | 10,000 Neurons/day free | Max 2k context |
| | Qwen 2.5 7B | (Approx. 50k-100k tokens/day) | output limits |
+----------------------+---------------------------+--------------------------------+-----------------+
सुरक्षा और गोपनीयता चेतावनी: Google AI Studio और सार्वजनिक प्लेग्राउंड के फ्री टियर रीइन्फोर्समेंट मॉडल अलाइनमेंट के लिए प्रॉम्प्ट और उत्तरों को लॉग करते हैं। संवेदनशील PII, ग्राहक क्रेडेंशियल्स, या मालिकाना सोर्स कोड को कभी भी फ्री टियर के माध्यम से रूट न करें। इन्हें विशेष रूप से सिंथेटिक डेटा जेनरेशन, इंटीग्रेशन टेस्टिंग और सार्वजनिक कंटेंट स्क्रैपिंग के लिए आरक्षित रखें।
5. व्यावहारिक कार्यान्वयन: Python में मल्टी-प्रोवाइडर फेलओवर राउटर
वेंडर आउटेज को रोकने और टोकन खर्चों को व्यवस्थित रूप से अनुकूलित करने के लिए, प्रोडक्शन सिस्टम को एक स्वचालित, लागत-भारित फेलओवर राउटर तैनात करना चाहिए। निम्नलिखित प्रोडक्शन-रेडी Python पैटर्न asyncio और httpx का उपयोग करके सबसे पहले सबसे सस्ते उपलब्ध प्रदाता को अनुरोध रूट करता है:
import asyncio
import os
import httpx
from typing import List, Dict, Any, Optional
PROVIDERS_CONFIG = [
{
"name": "deepseek",
"url": "https://api.deepseek.com/v1/chat/completions",
"key": os.getenv("DEEPSEEK_API_KEY"),
"model": "deepseek-chat",
"cost_in_per_m": 0.14,
"cost_out_per_m": 0.28
},
{
"name": "gemini",
"url": "https://generativelanguage.googleapis.com/v1beta/openai/chat/completions",
"key": os.getenv("GEMINI_API_KEY"),
"model": "gemini-2.5-flash",
"cost_in_per_m": 0.075,
"cost_out_per_m": 0.30
},
{
"name": "deepinfra_qwen",
"url": "https://api.deepinfra.com/v1/openai/chat/completions",
"key": os.getenv("DEEPINFRA_API_KEY"),
"model": "Qwen/Qwen2.5-Coder-32B-Instruct",
"cost_in_per_m": 0.05,
"cost_out_per_m": 0.15
}
]
async def dispatch_cheapest_model(
messages: List[Dict[str, str]],
max_tokens: int = 1024,
temperature: float = 0.2
) -> Optional[Dict[str, Any]]:
# अनुमानित औसत टोकन लागत के आधार पर प्रदाताओं को आरोही क्रम में क्रमबद्ध करें
sorted_providers = sorted(
PROVIDERS_CONFIG,
key=lambda p: (p["cost_in_per_m"] * 0.7 + p["cost_out_per_m"] * 0.3)
)
async with httpx.AsyncClient(timeout=15.0) as client:
for provider in sorted_providers:
if not provider["key"]:
continue
try:
headers = {
"Authorization": f"Bearer {provider['key']}",
"Content-Type": "application/json"
}
payload = {
"model": provider["model"],
"messages": messages,
"max_tokens": max_tokens,
"temperature": temperature
}
response = await client.post(provider["url"], json=payload, headers=headers)
if response.status_code == 200:
data = response.json()
return {
"provider": provider["name"],
"model": provider["model"],
"content": data["choices"][0]["message"]["content"],
"usage": data.get("usage", {})
}
else:
print(f"Provider {provider['name']} failed with status {response.status_code}. Failing over...")
except Exception as e:
print(f"Provider {provider['name']} error: {str(e)}. Attempting next provider...")
raise RuntimeError("All configured cost-effective LLM providers failed.")
# प्रदर्शन निष्पादन
if __name__ == "__main__":
test_messages = [
{"role": "system", "content": "You are a senior systems engineer optimizing backend pipelines."},
{"role": "user", "content": "Explain KV-cache compression in under 40 words."}
]
result = asyncio.run(dispatch_cheapest_model(test_messages))
print(f"Served by: {result['provider']} ({result['model']})")
print(f"Output: {result['content']}")
6. सेल्फ-होस्टिंग बनाम सर्वरलेस एपीआई: कुल स्वामित्व लागत (TCO)
इंजीनियरिंग लीड्स के सामने अक्सर यह दुविधा होती है कि क्या वे Qwen 2.5 Coder या DeepSeek-V3 जैसे ओपन-सोर्स मॉडल को समर्पित क्लाउड GPU क्लस्टर (RunPod, Lambda Labs, AWS EC2) पर खुद होस्ट करें या विशेष रूप से सर्वरलेस पे-एज-यू-गो एपीआई पर निर्भर रहें।
+-----------------------------------------------------------------------------------------------------+
| TCO BREAK-EVEN ANALYSIS (MONTHLY VOLUME) |
+----------------------+--------------------+--------------------+------------------------------------+
| Monthly Token Volume | Serverless API | Self-Hosted (vLLM) | Recommendation |
| (Inputs + Outputs) | Cost (DeepSeek/Qwen| 1x H100 SXM5 / A10G| |
+----------------------+--------------------+--------------------+------------------------------------+
| 50 Million Tokens | ~$10.00 | $1,850.00 (Lambda) | 100% Serverless (Avoid hardware) |
| 500 Million Tokens | ~$100.00 | $1,850.00 | 100% Serverless |
| 2 Billion Tokens | ~$400.00 | $1,850.00 | 100% Serverless |
| 15 Billion Tokens | ~$3,000.00 | $2,400.00 (2x H100)| TCO Break-Even Point reached |
| 50 Billion Tokens | ~$10,000.00 | $4,800.00 (4x H100)| Self-Host Saves >50% (vLLM/SGLang) |
+----------------------+--------------------+--------------------+------------------------------------+
सेल्फ-होस्टिंग पर इंजीनियरिंग निर्णय:
जब तक आपकी टीम प्रति माह 12 से 15 बिलियन टोकन से अधिक के निरंतर ट्रैफ़िक को संभाल नहीं रही है, तब तक GPU नोड्स को स्वयं होस्ट करना आर्थिक रूप से तर्कसंगत नहीं है। सर्वरलेस एपीआई प्रदाता लाखों समवर्ती उपयोगकर्ताओं की मांग को एकीकृत करते हैं, जिससे वे 80-90% निरंतर GPU उपयोग (MBU) प्राप्त करते हैं, जबकि निजी कॉर्पोरेट क्लस्टर ऑफ-पीक घंटों के दौरान शायद ही कभी 15-25% से अधिक औसत उपयोग तक पहुंच पाते हैं और बेकार पड़े हार्डवेयर का 24/7 बिल उत्पन्न करते रहते हैं।
7. रणनीतिक सिफारिशें और निर्णय वृक्ष (2026)
अपने एप्लिकेशन आर्किटेक्चर के लिए आदर्श और सबसे किफायती AI मॉडल चुनने के लिए, इस सुव्यवस्थित इंजीनियरिंग निर्णय पदानुक्रम का पालन करें:
[Select Workload Objective]
│
┌───────────────────────────────────┼──────────────────────────────────┐
▼ ▼ ▼
[High-Volume Agentic RAG] [Complex Coding Agent] [Indie / Free Tier Prototyping]
│ │ │
▼ ▼ ▼
DeepSeek-V3 API Qwen 2.5 Coder 32B Gemini 2.5 Flash Free Tier
($0.14 / $0.28 per 1M) ($0.05 / $0.15 per 1M) (15 RPM / 1,500 RPD Free)
- With Prompt Caching: - 61.2% LCB Pass@1 - 1M token context
$0.014 / 1M cached hits - Drop-in OpenAI API - Upgrade to $0.075/1M payg
- सामान्य एंटरप्राइज ऑटोमेशन के लिए: DeepSeek-V3 को मानक बनाएं। $0.14/1M इनपुट और $0.28/1M आउटपुट पर, यह जटिल रीज़निंग, JSON स्कीमा पार्सिंग और बहुभाषी समझ में लगभग आधी लागत पर GPT-4o-mini से बेहतर प्रदर्शन करता है।
- कोडिंग कोपायलट और डेवटूल्स के लिए: Qwen 2.5 Coder 32B (DeepInfra/Together पर होस्टेड) या DeepSeek-V3 चुनें। नियमित यूनिट टेस्टिंग, कोड रीफैक्टरिंग और AST ट्रांसफॉर्मेशन के लिए Sonnet 3.5 पर प्रीमियम दरों का भुगतान करने से बचें।
- लेटेंसी-क्रिटिकल कंज्यूमर प्रोडक्ट्स के लिए: Google Gemini 2.5 Flash या Llama 3.3 70B on Groq को तैनात करें। सब-200ms स्ट्रीमिंग TTFT अंतिम उपयोगकर्ताओं के लिए त्वरित प्रतिक्रिया का अनुभव कराता है।
- हमेशा डायनामिक प्रॉम्प्ट कैशिंग सक्षम करें: सिस्टम प्रॉम्प्ट्स, वेक्टर दस्तावेज़ संदर्भों और स्कीमा घोषणाओं को 1,024-टोकन कैश सीमा से ऊपर पिन करके, आधुनिक एपीआई इनपुट बिलों में 75% से 90% की कटौती करते हैं।