การวิเคราะห์อิสระ
ของโมเดล AI ระดับโลก
ทำความเข้าใจภูมิทัศน์ของ AI แถวหน้าเพื่อเลือกโมเดลพื้นฐาน แผนราคา และผู้ให้บริการคลาวด์ที่เหมาะสมที่สุดสำหรับคุณ
ไฮไลท์สำคัญ
คุณภาพความฉลาด
ดัชนีคุณภาพรวม Podium · ยิ่งสูงยิ่งดี
ความเร็วในการประมวลผล
โทเค็นต่อวินาที · ยิ่งเร็วยิ่งดี
ราคาต่อ 1 ล้านโทเค็น
ราคาแบบผสม (3:1) · ยิ่งถูกยิ่งคุ้มค่า
01 · Real-Time Rankings
โมเดลอันดับสูงสุด
10 อันดับโมเดลตามคะแนนรวม Podium
ดูทั้งหมด →| # | โมเดล | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
โมเดลที่ดีที่สุดตามการใช้งาน
การเขียนโค้ด
วิศวกรรมโค้ดระดับ repository: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval
ผู้นำ: Claude Fable 5.1
คณิตศาสตร์
จากคณิตโอลิมปิกถึงแนวหน้า: AIME, MATH, FrontierMath
ผู้นำ: Claude Mythos Preview
การให้เหตุผล
การให้เหตุผลเชิงลึกและวิทยาศาสตร์: GPQA Diamond, HLE, ARC-AGI-2
ผู้นำ: Claude Mythos Preview
เอเจนต์
การใช้เครื่องมืออัตโนมัติ: OSWorld, Toolathlon, MCP Atlas, τ²-Bench
ผู้นำ: Kimi K3
ความรู้
ความรู้ข้อเท็จจริงและต้าน hallucination: SimpleQA, MMLU-Pro, MMMLU
ผู้นำ: Claude Mythos Preview
มัลติโมดัล
เข้าใจภาพและเอกสาร: MMMU, CharXiv, ScreenSpot-Pro
ผู้นำ: Claude Mythos Preview
03 · Research & Analysis
บทความล่าสุด
04 · FAQ
คำถามที่พบบ่อย
ทุกโมเดลจะได้รับ Podium Score (0–100) ซึ่งคำนวณจาก 4 แหล่งข้อมูล: คะแนน Arena Elo 35%, ค่าเฉลี่ย Benchmark 30%, ดัชนีปัญญา 20% และ LLM Stats 15%
Claude Mythos Preview นำเป็นอันดับหนึ่งด้วยคะแนน 97.4 ตามด้วย Claude Fable 5 (93.4) และ Claude Fable 5.1 (88.4)
เราคัดสรร โมเดลเรือธง 700 รุ่น ใน 18 หมวดหมู่ (โค้ด, คณิต, การให้เหตุผล, เอเจนต์, ความรู้, มัลติโมดัล, บริบทยาว, ความเร็ว, ความคุ้มค่า และโอเพนเวต) พร้อมตารางอารีนาฉบับเต็มที่ 726 โมเดล
จาก 5 ตารางอันดับสาธารณะ: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase โดยอัปเดตทุกสัปดาห์