coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
テスト済みモデル
GPT-5
トップモデル
93.4%
トップスコア
OpenAI
プロバイダー
#モデルHumanEvalプロバイダーPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
ベンチマークデータは llm-stats.com から集計。詳細は方法論
0 / 4