速度是用户每天都能感受到的基准,2026年的差距巨大:从榜首的 389 token/秒 到大型推理模型的个位数。以下是我们速度排行榜的最新情况。
当前最快的模型
- Gemini 3.5 Flash-Lite — 389 t/s
- Gemini 3.5 Flash — 267 t/s
- Gemini 3.6 Flash — 233 t/s
- Muse Spark 1.1(Meta)— 208 t/s
- Qwen3.7 Max — 203 t/s
Google 的 Flash 家族占据整个领奖台;注意 Meta 的 Muse Spark 1.1:208 t/s、输出 $4.25/M,是我们追踪的速度性价比最佳选项之一。
速度与智能的权衡
最快的模型并不最聪明:Flash-Lite 用原始能力换取吞吐量。2026年的实用模式是路由——用快模型处理草稿与工具调用,用 Claude Mythos Preview 这样的前沿模型处理最难的5%。我们的对比工具可并排显示速度与 Podium Score。
延迟(TTFT)对聊天很重要
感知响应速度主要由首 token 时间决定。对聊天产品,一个 200 t/s、TTFT 150ms 的模型比 389 t/s、冷启动2秒的模型感觉更快——两个数字都要看,它们显示在每个模型的详情页(例如 Claude Fable 5:71 t/s,TTFT 141ms)。
结论
纯吞吐量选 Gemini Flash-Lite;速度+质量均衡选 Muse Spark 1.1 或 Qwen3.7 Max。实时数据见速度排行榜。