coding Coding · source: llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Models Tested
GPT-5
Top Model
93.4%
Top Score
OpenAI
Provider
#ModelHumanEvalProviderPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Benchmark data aggregated from llm-stats.com. See Methodology for details.
0 / 4