静态基准测试的局限性
像MMLU和HumanEval这样的传统测试非常有价值,但也有局限。模型可能会针对特定测试集进行过拟合优化,无法完全反映真实场景。
进入竞技场模式
LLM竞技场是一个平台,用户可以在这里盲测两个匿名模型的回答并投票。这创造了一个基于真实人类偏好的动态排行榜。
Elo积分机制
用户输入提示词 -> 两个随机模型生成回答 -> 用户选择更佳者 -> 系统更新Elo分值。
像MMLU和HumanEval这样的传统测试非常有价值,但也有局限。模型可能会针对特定测试集进行过拟合优化,无法完全反映真实场景。
LLM竞技场是一个平台,用户可以在这里盲测两个匿名模型的回答并投票。这创造了一个基于真实人类偏好的动态排行榜。
用户输入提示词 -> 两个随机模型生成回答 -> 用户选择更佳者 -> 系统更新Elo分值。