💻 Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
परीक्षित मॉडल
GPT-5
शीर्ष मॉडल
93.4%
सर्वोच्च स्कोर
OpenAI
प्रदाता
#मॉडलHumanEvalप्रदाताPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
बेंचमार्क डेटा llm-stats.com से संकलित। अधिक जानें कार्यप्रणाली में।