coding Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Modelos probados
GPT-5
Modelo destacado
93.4%
Mejor puntuación
OpenAI
Proveedor
| # | Modelo | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Datos agregados de llm-stats.com. Ver Metodología.