coding Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Modèles testés
GPT-5
Modèle phare
93.4%
Meilleur score
OpenAI
Fournisseur
| # | Modèle | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Données agrégées depuis llm-stats.com. Voir Méthodologie.