💻 Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Model diuji
GPT-5
Model teratas
93.4%
Skor terbaik
OpenAI
Penyedia
| # | Model | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Data benchmark digabungkan dari llm-stats.com. Selengkapnya di metodologi.