💻 Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Modelos testados
GPT-5
Modelo principal
93.4%
Melhor pontuação
OpenAI
Provedor
| # | Modelo | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Dados de benchmark agregados de llm-stats.com. Saiba mais na metodologia.