คำศัพท์ LLM
แนวคิดหลักที่คุณจะพบเมื่ออ่านตารางอันดับ แต่ละคำมีคำอธิบายสั้นและลิงก์ไปหน้าที่เกี่ยวข้อง
Podium Score
คะแนนอันดับรวม 0–100 ของ LLMPodium: 0.35·Arena Elo + 0.30·ค่าเฉลี่ยเบนช์มาร์ก + 0.20·ดัชนีความฉลาด + 0.15·LLM Stats ปรับ min-max และถ่วงน้ำหนักใหม่เมื่อสัญญาณขาด — ดูข้อมูลสด
Elo
ระบบคะแนนจากหมากรุก ในอารีนา LLM โมเดลได้ Elo จากการชนะการประลองที่มนุษย์เลือก ส่วนต่างของ Elo สองตัวทำนายความน่าจะเป็นชนะ — ดูข้อมูลสด
เบนช์มาร์ก
ชุดทดสอบมาตรฐานที่มีงานให้คะแนน (คณิต โค้ด วิทยาศาสตร์) เพื่อวัดความสามารถเฉพาะของโมเดลภายใต้เงื่อนไขที่เทียบกันได้ — ดูข้อมูลสด
โทเคน
ชิ้นคำย่อยที่ LLM อ่านและเขียน อังกฤษประมาณ 1 โทเคน ≈ 4 ตัวอักษร ราคาอ้างอิงต่อล้าน (M) โทเคน
หน้าต่างบริบท
ปริมาณข้อความสูงสุด (เป็นโทเคน) ที่โมเดลพิจารณาได้พร้อมกัน — พร้อมพ์ตบวกคำตอบ โมเดล frontier ปี 2026 อยู่ในช่วง 128K ถึง 1M โทเคน — ดูข้อมูลสด
TTFT (เวลาถึงโทเคนแรก)
ความหน่วงก่อนโทเคนเอาต์พุตแรกมาถึง เป็นตัวกำหนดความรู้สึกตอบสนองในแชต วัดเป็นมิลลิวินาที — ดูข้อมูลสด
อัตราเอาต์พุต (tokens/s)
จำนวนโทเคนที่โมเดลสร้างต่อวินาทีหลังโทเคนแรก กำหนดความเร็วของคำตอบยาว — ดูข้อมูลสด
Mixture of Experts (MoE)
สถาปัตยกรรมที่เปิดใช้พารามิเตอร์บางส่วน ("experts") ต่อโทเคน ได้ความรู้ขนาดใหญ่ในต้นทุนอนุมานต่ำ เช่น Qwen3.8 Max, DeepSeek V4 — ดูข้อมูลสด
โอเพนเวต
โมเดลที่เปิดเผยน้ำหนักให้โฮสต์เองและไฟน์จูนได้ (Kimi K3, GLM-5.2, Llama 4) ต่างจากโมเดลปิดที่ใช้ผ่าน API เท่านั้น — ดูข้อมูลสด
โมเดลเหตุผล
โมเดลที่ฝึกให้ใช้โทเคน "คิด" เพิ่มก่อนตอบ แลกความหน่วงกับความแม่นยำในปัญหายาก (GPQA, HLE, คณิตโอลิมปิก) — ดูข้อมูลสด
ฮัลลูซิเนชัน
ข้อความมั่นใจแต่ไม่มีหลักฐานรองรับ เบนช์มาร์กข้อเท็จจริงอย่าง SimpleQA วัดความถี่ที่โมเดลหลีกเลี่ยง — ดูข้อมูลสด
SWE-Bench Verified
การแก้ปัญหา GitHub issue จริงใน repo จริง ตรวจสอบโดยมนุษย์ เป็นเบนช์มาร์กมาตรฐานของ software engineering แบบ agent — ดูข้อมูลสด
GPQA Diamond
คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่ผู้เชี่ยวชาญเขียนและกันการค้นหาคำตอบ เป็นเบนช์มาร์กเหตุผลหลัก — ดูข้อมูลสด
Humanity's Last Exam
ชุดคำถามที่ผู้เชี่ยวชาญเขียนให้อยู่ริมขอบความรู้ของมนุษย์ โมเดล frontier ปัจจุบันยังทำได้ 40–60% — ดูข้อมูลสด
MMLU-Pro
รุ่นต่อจาก MMLU ที่ยากขึ้น มี 14 หมวด วัดความรู้เชิงวิชาการกว้างด้วยตัวเลือกที่ยากขึ้น — ดูข้อมูลสด
Min-max normalization
การปรับมาตรวัดดิบใด ๆ เป็น 0–100 ทั้งชุดโมเดลที่ติดตาม เพื่อให้คะแนนคนละแหล่งผสมกันได้ 80 หมายถึง "80% ของทางจากแย่สุดไปดีสุด" เสมอ — ดูข้อมูลสด
ช่วงความเชื่อมั่น (±CI)
ความไม่แน่นอนทางสถิติของ Elo ในอารีนา ช่วงซ้อนกันแปลว่าสองโมเดลเสมอกันในทางปฏิบัติ — ดูข้อมูลสด
$/M โทเคน
ราคาต่อล้านโทเคน แยกอินพุตและเอาต์พุต โทเคนเอาต์พุตมักแพงกว่าอินพุต 3–5 เท่า — ดูข้อมูลสด