coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
테스트된 모델
GPT-5
톱 모델
93.4%
최고 점수
OpenAI
제공업체
#모델명HumanEval제공업체Podium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
벤치마크 데이터는 llm-stats.com에서 집계. 자세한 내용은 방법론.
0 / 4