⌨️ Code LLM 리더보드

Code generation, debugging, and software engineering tasks.

#모델종합HumanEvalSWE-BenchLiveCodeBench속도
1
Claude Opus 4
Anthropic
97.894.5%72.5%73.8%45 t/s
297.593%63.8%70.4%85 t/s
3
o3
OpenAI
97.192.7%71.7%72.1%58 t/s
4
DeepSeek R1
DeepSeek
92.392.1%49.2%65.8%32 t/s
5
o4-mini
OpenAI
91.591.5%68.1%65.3%145 t/s
690.393.7%62.3%55.1%79 t/s
7
GPT-4o
OpenAI
89.290.2%38.4%33.1%110 t/s
888.890.5%55.2%52.8%55 t/s
988.492%49%40.2%82 t/s
1087.590.8%47.5%50.2%120 t/s
1186.789.8%48.2%48.6%203 t/s
12
DeepSeek V3
DeepSeek
86.189.4%42%43.5%68 t/s
1384.588.7%41.3%42.8%95 t/s
1482.189%35.2%27.6%29 t/s
1580.587.6%36.8%28.5%258 t/s
1679.886.4%32.8%25.1%65 t/s
1779.288.1%40.6%29.3%148 t/s
18
Mistral Large
Mistral AI
76.584.3%30.1%22.4%48 t/s
197682.4%26.5%21.3%55 t/s
2075.887.2%23.4%18.3%167 t/s
2174.882.1%28.3%20.5%60 t/s
2274.380.5%27.3%19.8%62 t/s
23
Mixtral 8x22B
Mistral AI
65.275.8%18.2%12.1%82 t/s
24
Phi-4
Microsoft
64.572.4%12.5%8.5%125 t/s