Benchmark

Arena ELO

Chatbot Arena Elo Rating

Crowd-sourced pairwise preference ranking from live human evaluations.

25
Models Tested
Gemini 2.5 Pro
Top Model
1398
Top Score
1600 ELO
Max Possible
#ModelArena ELO ScoreProviderComposite
11398Google97.5
2
Claude Opus 4
Anthropic
1385Anthropic97.8
3
o3
OpenAI
1380OpenAI97.1
4
DeepSeek R1
DeepSeek
1358DeepSeek92.3
5
o4-mini
OpenAI
1345OpenAI91.5
61340Anthropic90.3
71330xAI88.8
81325Meta87.5
9
DeepSeek V3
DeepSeek
1318DeepSeek86.1
101310Google86.7
111305Alibaba84.5
121290Google80.5
13
GPT-4o
OpenAI
1287OpenAI89.2
141272Anthropic88.4
151271OpenAI75.8
161265Meta82.1
171258Meta79.8
181248Anthropic79.2
19
Mistral Large
Mistral AI
1245Mistral AI76.5
201240xAI74.8
211235Meta74.3
221230Alibaba76
23
Mixtral 8x22B
Mistral AI
1195Mistral AI65.2
241185Cohere60.8
25
Phi-4
Microsoft
1150Microsoft64.5
Source: LMSYS, 2024