coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Getestete Modelle
GPT-5
Top-Modell
93.4%
Top-Score
OpenAI
Anbieter
#ModellHumanEvalAnbieterPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Benchmark-Daten aggregiert aus llm-stats.com. Siehe Methodik.
0 / 4