coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Моделей протестировано
GPT-5
Топ-модель
93.4%
Лучший результат
OpenAI
Провайдер
#МодельHumanEvalПровайдерPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Данные бенчмарка агрегированы из llm-stats.com. Подробнее — в методологии.
0 / 4
Сравнить →