coding Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
โมเดลที่ทดสอบ
GPT-5
โมเดลเด่น
93.4%
คะแนนสูงสุด
OpenAI
ผู้ให้บริการ
#โมเดลHumanEvalผู้ให้บริการPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี
0 / 4