ความเร็วคือเบนช์มาร์กที่ผู้ใช้รู้สึกทุกวัน และในปี 2026 ช่วงห่างนั้นมหาศาล: จาก 389 โทเคน/วินาที บนยอด ถึงหลักหน่วยสำหรับโมเดลเหตุผลขนาดใหญ่ สถานะปัจจุบันจาก อันดับความเร็ว ของเรา
โมเดลเร็วที่สุดในตอนนี้
- Gemini 3.5 Flash-Lite — 389 t/s
- Gemini 3.5 Flash — 267 t/s
- Gemini 3.6 Flash — 233 t/s
- Muse Spark 1.1 (Meta) — 208 t/s
- Qwen3.7 Max — 203 t/s
ตระกูล Flash ของ Google กินโพเดียมทั้งหมด และสังเกต Muse Spark 1.1 ของ Meta: 208 t/s ที่ $4.25/M ต่อเอาต์พุต ทำให้เป็นหนึ่งในตัวเลือกความเร็วต่อดอลลาร์ที่ดีที่สุดที่เราติดตาม
การแลกความเร็วกับสติปัญญา
โมเดลที่เร็วที่สุดไม่ใช่โมเดลที่ฉลาดที่สุด: Flash-Lite แลกความสามารถดิบกับ throughput รูปแบบปฏิบัติของปี 2026 คือ เราติง — โมเดลเร็วสำหรับร่างและเรียกเครื่องมือ โมเดล frontier อย่าง Claude Mythos Preview สำหรับ 5% ที่ยาก เครื่องมือเปรียบเทียบ ของเราแสดงความเร็วกับ Podium Score เคียงกัน
ค่าหน่วง (TTFT) สำคัญกับแชท
การตอบสนองที่รับรู้ถูกครอบงำโดยเวลาถึงโทเคนแรก สำหรับผลิตภัณฑ์แชท โมเดล 200 t/s ที่มี TTFT 150ms รู้สึกเร็วกว่าโมเดล 389 t/s ที่เริ่มเย็น 2 วินาที — ประเมินทั้งสองตัวเลขเสมอ ดูได้ในโปรไฟล์แต่ละโมเดล (เช่น Claude Fable 5: 71 t/s, TTFT 141ms)
สรุป
เน้น throughput ล้วนเลือก Gemini Flash-Lite; สมดุลความเร็ว+คุณภาพเลือก Muse Spark 1.1 หรือ Qwen3.7 Max ตัวเลขสดใน อันดับความเร็ว