coding Coding · source: llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Models Tested
GPT-5
Top Model
93.4%
Top Score
OpenAI
Provider
| # | Model | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Benchmark data aggregated from llm-stats.com. See Methodology for details.