coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Modèles testés
GPT-5
Modèle phare
93.4%
Meilleur score
OpenAI
Fournisseur
#ModèleHumanEvalFournisseurPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Données agrégées depuis llm-stats.com. Voir Méthodologie.
0 / 4