💻 Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Modelos testados
GPT-5
Modelo principal
93.4%
Melhor pontuação
OpenAI
Provedor
#ModeloHumanEvalProvedorPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Dados de benchmark agregados de llm-stats.com. Saiba mais na metodologia.