coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
测试模型数
GPT-5
最佳模型
93.4%
最高分
OpenAI
提供商
#模型名称HumanEval提供商Podium 综合得分
1
GPT-5
OpenAI
93.4%
OpenAI23.0
基准数据聚合自 llm-stats.com。详见方法论
0 / 4