coding Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
Моделей протестировано
GPT-5
Топ-модель
93.4%
Лучший результат
OpenAI
Провайдер
| # | Модель | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
Данные бенчмарка агрегированы из llm-stats.com. Подробнее — в методологии.