LLM 리더보드

10개 벤치마크에 걸친 25개 모델의 종합 순위.

제공업체
라이선스
25 25개 모델
#모델종합ELOMMLUGPQAHumanEvalSWE-Bench속도가격
1
Claude Opus 4
Anthropic
97.8138592.1%83.5%94.5%72.5%45 t/s$75/M
297.5139892%84%93%63.8%85 t/s$10/M
3
o3
OpenAI
97.1138091.2%81.3%92.7%71.7%58 t/s$40/M
4
DeepSeek R1
DeepSeek
오픈
92.3135890.8%71.5%92.1%49.2%32 t/s$2.19/M
5
o4-mini
OpenAI
91.5134588.3%72.1%91.5%68.1%145 t/s$4.4/M
690.3134090.4%70.2%93.7%62.3%79 t/s$15/M
7
GPT-4o
OpenAI
89.2128788.7%53.6%90.2%38.4%110 t/s$10/M
888.8133089.2%68.5%90.5%55.2%55 t/s$15/M
988.4127288.7%65%92%49%82 t/s$15/M
1087.5132589.5%62.8%90.8%47.5%120 t/s$1.2/M
1186.7131086.5%62.3%89.8%48.2%203 t/s$0.6/M
12
DeepSeek V3
DeepSeek
오픈
86.1131888.5%59.1%89.4%42%68 t/s$1.1/M
13
오픈
84.5130587.8%58.3%88.7%41.3%95 t/s$1.2/M
14
오픈
82.1126587.3%51.1%89%35.2%29 t/s$1/M
1580.5129085.1%55.4%87.6%36.8%258 t/s$0.4/M
16
오픈
79.8125886%48.7%86.4%32.8%65 t/s$0.4/M
1779.2124884.1%48.2%88.1%40.6%148 t/s$4/M
18
Mistral Large
Mistral AI
76.5124584%46.5%84.3%30.1%48 t/s$6/M
19
오픈
76123085.2%45.6%82.4%26.5%55 t/s$0.4/M
2075.8127182%41.1%87.2%23.4%167 t/s$0.6/M
2174.8124083.2%44.8%82.1%28.3%60 t/s$10/M
22
오픈
74.3123583.7%42.3%80.5%27.3%62 t/s$0.4/M
23
Mixtral 8x22B
Mistral AI
오픈
65.2119577.8%33.5%75.8%18.2%82 t/s$0.5/M
24
Phi-4
Microsoft
64.5115078.5%38.5%72.4%12.5%125 t/s$0.14/M
2560.8118575.6%30.2%68.2%15.8%52 t/s$10/M