LLM لغت

درجہ بندی پڑھتے وقت ملنے والے بنیادی تصورات۔ ہر اصطلاح کے ساتھ مختصر وضاحت اور متعلقہ صفحے کا لنک ہے۔

Podium Score

LLMPodium کا 0–100 مرکب اسکور: ‏0.35·ارینا Elo + 0.30·بینچ مارک اوسط + 0.20·انٹیلیجنس انڈیکس + 0.15·LLM Stats، min-max معمول کاری اور غیر موجود اشاروں کی دوبارہ تقسیم کے ساتھ۔ — لائیو ڈیٹا دیکھیں

Elo ریٹنگ

شطرنج سے لی گئی درجہ بندی۔ LLM ارینا میں ماڈلز انسانی ترجیح کے براہِ راست مقابلے جیت کر Elo کماتے ہیں؛ دو Elo کا فرق جیت کے امکان کی پیشگوئی کرتا ہے۔ — لائیو ڈیٹا دیکھیں

بینچ مارک

نمبر دیے گئے کاموں (ریاضی، کوڈنگ، سائنس) والا معیاری ٹیسٹ سیٹ، جو قابلِ موازنہ حالات میں ماڈل کی مخصوص صلاحیت ماپتا ہے۔ — لائیو ڈیٹا دیکھیں

ٹوکنز

وہ ذیلی لفظ ٹکڑے جو LLM پڑھتے اور لکھتے ہیں۔ تقریباً 1 ٹوکن ≈ انگریزی کے 4 حروف؛ قیمتیں فی ملین (M) ٹوکنز بتائی جاتی ہیں۔

کانٹیکسٹ ونڈو

زیادہ سے زیادہ متن (ٹوکنز میں) جو ماڈل ایک بار میں دیکھ سکتا ہے — پرامپٹ اور جواب ملا کر۔ 2026 کے فرنٹیئر ماڈلز 128K سے 1M ٹوکنز تک۔ — لائیو ڈیٹا دیکھیں

TTFT (پہلے ٹوکن تک کا وقت)

پہلا آؤٹ پٹ ٹوکن آنے تک کی تاخیر۔ چیٹ کی محسوس شدہ تیزی اسی پر منحصر ہے؛ ملی سیکنڈ میں ماپی جاتی ہے۔ — لائیو ڈیٹا دیکھیں

آؤٹ پٹ تھروپٹ (ٹوکنز/سیکنڈ)

پہلے ٹوکن کے بعد ماڈل فی سیکنڈ کتنے ٹوکنز بناتا ہے۔ لمبے جوابات کی رفتار یہی طے کرتی ہے۔ — لائیو ڈیٹا دیکھیں

Mixture of Experts (MoE)

ایک معماری جس میں فی ٹوکن پیرامیٹرز کا صرف ایک حصہ («ماہرین») فعال ہوتا ہے — کم انفیرنس لاگت میں بڑا علم — جیسے Qwen3.8 Max یا DeepSeek V4۔ — لائیو ڈیٹا دیکھیں

اوپن ویٹس

وہ ماڈل جن کے تربیت یافتہ پیرامیٹرز عوامی ہوتے ہیں، تاکہ خود میزبانی اور فائن ٹیوننگ ہو سکے (Kimi K3، GLM-5.2، Llama 4)۔ صرف-API والے ملکیتی ماڈلز کے برعکس۔ — لائیو ڈیٹا دیکھیں

ریزننگ ماڈل

جواب سے پہلے اضافی «سوچ» ٹوکنز خرچ کرنے کے لیے تربیت یافتہ ماڈل — مشکل مسائل (GPQA، HLE، مقابلہ جاتی ریاضی) پر تاخیر کے بدلے درستگی۔ — لائیو ڈیٹا دیکھیں

ہیلوسینیشن

پراعتماد مگر بے بنیاد بیان۔ SimpleQA جیسے حقائق بینچ مارک ماپتے ہیں کہ ماڈل ان سے کتنی بار بچتے ہیں۔ — لائیو ڈیٹا دیکھیں

SWE-Bench Verified

حقیقی ریپوزٹریز میں حقیقی GitHub issues کا حل، انسانی تصدیق کے ساتھ۔ ایجنٹک سافٹ ویئر انجینئرنگ کا معیاری بینچ مارک۔ — لائیو ڈیٹا دیکھیں

GPQA Diamond

ماہرین کے لکھے ہوئے گریجویٹ سطح کے «سرچ پروف» سائنسی سوالات؛ اہم ریزننگ بینچ مارک۔ — لائیو ڈیٹا دیکھیں

Humanity's Last Exam

انسانی علم کی حد پر رکھے گئے ماہرین کے بنائے سوالات؛ موجودہ فرنٹیئر ماڈل ابھی 40–60% ہی لیتے ہیں۔ — لائیو ڈیٹا دیکھیں

MMLU-Pro

MMLU کا سخت تر جانشین: 14 زمرے اور مشکل اختیارات کے ساتھ وسیع تعلیمی علم کی پیمائش۔ — لائیو ڈیٹا دیکھیں

Min-max معمول کاری

کسی بھی خام میٹرک کو تمام ٹریک شدہ ماڈلز پر 0–100 پر دوبارہ اسکیل کرنا، تاکہ مختلف ذرائع کے اسکور ملائے جا سکیں۔ 80 کا مطلب ہمیشہ «بدترین سے بہترین تک کے فاصلے کا 80%»۔ — لائیو ڈیٹا دیکھیں

اعتماد کا وقفہ (±CI)

ارینا Elo کی شماریاتی غیر یقینی۔ وقفے اوورلیپ ہوں تو دو ماڈل عملاً برابر ہوتے ہیں۔ — لائیو ڈیٹا دیکھیں

$/M ٹوکنز

فی ملین ٹوکنز قیمت، ان پٹ اور آؤٹ پٹ کے لیے الگ الگ۔ آؤٹ پٹ ٹوکنز عام طور پر ان پٹ سے 3–5 گنا مہنگے ہوتے ہیں۔ — لائیو ڈیٹا دیکھیں