순위표

글쓰기 랭킹

콘텐츠 창작과 지시 준수: IFBench와 인간 선호(arena Elo) 혼합.

61개 모델
#모델명Podium Score속도
01
97.2
80 t/s
02
94.8
55 t/s
03
Claude Opus 5
Anthropic
93.2
60 t/s
4
92.4
208 t/s
5
Kimi K3
Moonshot AI · 오픈소스 · reasoning
90.4
37 t/s
6
89.6
233 t/s
7
GPT-5.4
OpenAI
87.1
60 t/s
8
GPT-5.2
OpenAI
86.7
90 t/s
9
GPT-6 Astra
OpenAI · reasoning
85.7
82 t/s
10
85.5
50 t/s
11
85.5
120 t/s
12
85.1
50 t/s
13
83.9
59 t/s
14
83.8
136 t/s
15
83.8
80 t/s
16
83.5
60 t/s
17
83.4
203 t/s
18
GPT-5.5
OpenAI
82.6
60 t/s
19
Claude Fable 5
Anthropic · reasoning
81.8
71 t/s
20
81.5
267 t/s
21
MiMo V2.5 Pro
Xiaomi · 오픈소스
81.3
65 t/s
22
81.2
72 t/s
23
81.1
96 t/s
24
Kimi K2.6
Moonshot AI · 오픈소스
80.7
40 t/s
25
80.6
120 t/s
26
79.9
54 t/s
27
Qwen3.8 Flash Next
Alibaba · 오픈소스
79.4
168 t/s
28
79.1
389 t/s
29
78.7
80 t/s
30
Seed 2.0 Pro
ByteDance
78.7
40 t/s
31
78.7
69 t/s
32
GLM-5.2
Z.ai · 오픈소스
78.6
164 t/s
33
MiniMax M3
MiniMax
78.6
93 t/s
34
GPT-5.1
OpenAI
78.3
60 t/s
35
77.4
127 t/s
36
Gemma 4 31B
Google · 오픈소스
76.7
35 t/s
37
DeepSeek V4.1 Flash
DeepSeek · 오픈소스 · reasoning
76.3
214 t/s
38
76.3
175 t/s
39
76.1
50 t/s
40
75.9
80 t/s
41
75.4
118 t/s
42
GLM-5.3 Flash
Z.ai · 오픈소스
75.2
182 t/s
43
74.6
55 t/s
44
Nemotron 3 Ultra 550B
NVIDIA · 오픈소스
74.1
142 t/s
45
73.1
129 t/s
46
Qwen3.5 397B-A17B
Alibaba · 오픈소스
73.1
71 t/s
47
Inkling
Thinking Machines
72.7
81 t/s
48
71.5
50 t/s
49
DeepSeek V4 Flash
DeepSeek · 오픈소스
71.5
113 t/s
50
Qwen3 Max
Alibaba · 오픈소스
70.3
85 t/s
51
GPT-5
OpenAI
69.9
60 t/s
52
o3
OpenAI · reasoning
68.7
90 t/s
53
DeepSeek V3.2
DeepSeek · 오픈소스
66.3
60 t/s
54
DeepSeek R1
DeepSeek · 오픈소스 · reasoning
65.1
60 t/s
55
Kimi K2.7 Code
Moonshot AI · 오픈소스
63.1
39 t/s
56
Qwen3.5 122B-A10B
Alibaba · 오픈소스
63.1
126 t/s
57
DeepSeek V4 Pro
DeepSeek · 오픈소스
62.7
66 t/s
58
Agnes 3.0 Flash
Agnes · reasoning
52.2
235 t/s
59
Granite 4.2 30B Instruct
IBM · 오픈소스
48.2
78 t/s
60
Granite 4.2 8B Instruct
IBM · 오픈소스
22.1
115 t/s
61
Granite 4.2 3B Instruct
IBM · 오픈소스
0.0
148 t/s
Podium Score는 5개 리더보드의 가중 평균입니다. 자세한 내용은 평가 방법을 참고하세요.
0 / 4