coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Modelos probados
GPT-5
Modelo destacado
93.4%
Mejor puntuación
OpenAI
Proveedor
#ModeloHumanEvalProveedorPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Datos agregados de llm-stats.com. Ver Metodología.
0 / 4