Benchmark
Arena ELO
Chatbot Arena Elo Rating
Crowd-sourced pairwise preference ranking from live human evaluations.
25
Models Tested
Gemini 2.5 Pro
Top Model
1398
Top Score
1600 ELO
Max Possible
| # | Model | Arena ELO Score |
|---|---|---|
| 1 | Gemini 2.5 Pro Google | 1398 |
| 2 | Claude Opus 4 Anthropic | 1385 |
| 3 | o3 OpenAI | 1380 |
| 4 | DeepSeek R1 DeepSeek | 1358 |
| 5 | o4-mini OpenAI | 1345 |
| 6 | Claude Sonnet 4 Anthropic | 1340 |
| 7 | Grok 3 xAI | 1330 |
| 8 | Llama 4 Maverick Meta | 1325 |
| 9 | DeepSeek V3 DeepSeek | 1318 |
| 10 | Gemini 2.5 Flash Google | 1310 |
| 11 | Qwen 3 235B Alibaba | 1305 |
| 12 | Gemini 2.0 Flash Google | 1290 |
| 13 | GPT-4o OpenAI | 1287 |
| 14 | Claude 3.5 Sonnet Anthropic | 1272 |
| 15 | GPT-4o Mini OpenAI | 1271 |
| 16 | Llama 3.1 405B Meta | 1265 |
| 17 | Llama 3.3 70B Meta | 1258 |
| 18 | Claude 3.5 Haiku Anthropic | 1248 |
| 19 | Mistral Large Mistral AI | 1245 |
| 20 | Grok 2 xAI | 1240 |
| 21 | Llama 3.1 70B Meta | 1235 |
| 22 | Qwen 2.5 72B Alibaba | 1230 |
| 23 | Mixtral 8x22B Mistral AI | 1195 |
| 24 | Command R+ Cohere | 1185 |
| 25 | Phi-4 Microsoft | 1150 |
Source: LMSYS, 2024