LLM 术语表
阅读排行榜时会遇到的核心概念,每个术语都附有简明解释和相关页面链接。
Podium Score
LLMPodium 的 0–100 综合排名分数:0.35·竞技场 Elo + 0.30·基准平均 + 0.20·智能指数 + 0.15·LLM Stats,经 min-max 归一化并对缺失信号重新加权。 — 查看实时数据
Elo 评分
源自国际象棋的评分系统。在 LLM 竞技场中,模型通过赢得人类偏好对决获得 Elo;两个 Elo 的差值可预测胜率。 — 查看实时数据
基准测试
带评分任务(数学题、编程题、科学问题)的标准化测试集,用于在可比较的条件下衡量模型的特定能力。 — 查看实时数据
Token(词元)
LLM 读写的子词片段。1 个 token 约等于 4 个英文字符;中文通常 1 个字约 1–2 个 token。定价按百万(M)token 计。
上下文窗口
模型一次能考虑的最大文本量(以 token 计)——提示加回答。2026 年前沿模型从 128K 到 1M token 不等。 — 查看实时数据
TTFT(首 token 时间)
第一个输出 token 到达前的延迟。它主导聊天的感知响应速度,以毫秒计。 — 查看实时数据
输出吞吐量(tokens/s)
首个 token 之后模型每秒生成的 token 数,决定长回答的流式速度。 — 查看实时数据
混合专家(MoE)
一种架构:每个 token 只激活一部分参数("专家"),以较小的推理成本获得大容量——如 Qwen3.8 Max、DeepSeek V4。 — 查看实时数据
开放权重
训练参数公开发布的模型,可自托管和微调(Kimi K3、GLM-5.2、Llama 4)。与仅 API 的专有模型相对。 — 查看实时数据
推理模型
在回答前花额外"思考" token 训练的模型,用延迟换取难题(GPQA、HLE、竞赛数学)上的准确率。 — 查看实时数据
幻觉
自信但无依据的陈述。SimpleQA 等事实性基准衡量模型避免幻觉的频率。 — 查看实时数据
SWE-Bench Verified
在真实仓库中解决真实 GitHub issue,并经人工验证。代理式软件工程的标准基准。 — 查看实时数据
GPQA Diamond
领域专家撰写的研究生级"防搜索"科学问题;核心推理基准之一。 — 查看实时数据
Humanity's Last Exam
专家撰写、位于人类知识前沿的题库;当前前沿模型得分仍在 40–60% 区间。 — 查看实时数据
MMLU-Pro
MMLU 的强化版,14 个类别,用更难的选项衡量广泛学术知识。 — 查看实时数据
Min-max 归一化
把任意原始指标在 tracked 模型集上重缩放到 0–100,使不同来源的分数可混合。80 永远表示"从最差到最好之间 80% 的位置"。 — 查看实时数据
置信区间(±CI)
竞技场 Elo 的统计不确定度。区间重叠意味着两个模型实际上打平。 — 查看实时数据
$/M tokens
每百万 token 的价格,输入与输出分别报价。输出 token 通常比输入贵 3–5 倍。 — 查看实时数据