coding Coding · llm-stats.com
HumanEval
Function-level Python completion, the classic code-generation benchmark.
1
โมเดลที่ทดสอบ
GPT-5
โมเดลเด่น
93.4%
คะแนนสูงสุด
OpenAI
ผู้ให้บริการ
| # | โมเดล | HumanEval |
|---|---|---|
| 1 | GPT-5 OpenAI | 93.4% |
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี