Classifica
Classifica: Chat e assistenti
Qualità conversazionale da preferenze umane dirette (Elo arena) e aderenza alle istruzioni.
Generale700Coding399Matematica53Reasoning413Agentico55Conoscenza412Multimodale382Agenti di codice55Reasoning scientifico82Multilingue12Scrittura61Chat e assistenti61Ricerca85Chiamata di strumenti32Contesto lungo82Velocità402Valore401Open weights170
61 modelli
| # | Modello | Podium Score | Velocità |
|---|---|---|---|
| 01 | Claude Opus 4.7 Anthropic | 97.2 | 80 t/s |
| 02 | Qwen3.8 Max Alibaba | 94.8 | 55 t/s |
| 03 | Claude Opus 5 Anthropic | 93.2 | 60 t/s |
| 4 | Muse Spark 1.1 Meta | 92.4 | 208 t/s |
| 5 | Kimi K3 Moonshot AI · Aperto · reasoning | 90.4 | 37 t/s |
| 6 | Gemini 3.6 Flash Google | 89.6 | 233 t/s |
| 7 | GPT-5.4 OpenAI | 87.1 | 60 t/s |
| 8 | GPT-5.2 OpenAI | 86.7 | 90 t/s |
| 9 | GPT-6 Astra OpenAI · reasoning | 85.7 | 82 t/s |
| 10 | Claude Opus 4.5 Anthropic | 85.5 | 50 t/s |
| 11 | Gemini 3 Flash Google | 85.5 | 120 t/s |
| 12 | Claude Sonnet 4.6 Anthropic | 85.1 | 50 t/s |
| 13 | Grok 4.5 xAI | 83.9 | 59 t/s |
| 14 | Gemini 3.1 Pro Google | 83.8 | 136 t/s |
| 15 | Muse Spark Meta | 83.8 | 80 t/s |
| 16 | ERNIE 5.1 Baidu | 83.5 | 60 t/s |
| 17 | Qwen3.7 Max Alibaba | 83.4 | 203 t/s |
| 18 | GPT-5.5 OpenAI | 82.6 | 60 t/s |
| 19 | Claude Fable 5 Anthropic · reasoning | 81.8 | 71 t/s |
| 20 | Gemini 3.5 Flash Google | 81.5 | 267 t/s |
| 21 | MiMo V2.5 Pro Xiaomi · Aperto | 81.3 | 65 t/s |
| 22 | GPT-5.6 Sol OpenAI | 81.2 | 72 t/s |
| 23 | Claude Sonnet 5 Anthropic | 81.1 | 96 t/s |
| 24 | Kimi K2.6 Moonshot AI · Aperto | 80.7 | 40 t/s |
| 25 | Gemini 3 Pro Google | 80.6 | 120 t/s |
| 26 | Qwen3.7 Plus Alibaba | 79.9 | 54 t/s |
| 27 | Qwen3.8 Flash Next Alibaba · Aperto | 79.4 | 168 t/s |
| 28 | Gemini 3.5 Flash-Lite Google | 79.1 | 389 t/s |
| 29 | Claude Sonnet 4.5 Anthropic | 78.7 | 80 t/s |
| 30 | Seed 2.0 Pro ByteDance | 78.7 | 40 t/s |
| 31 | Hunyuan Hy3 Tencent | 78.7 | 69 t/s |
| 32 | GLM-5.2 Z.ai · Aperto | 78.6 | 164 t/s |
| 33 | MiniMax M3 MiniMax | 78.6 | 93 t/s |
| 34 | GPT-5.1 OpenAI | 78.3 | 60 t/s |
| 35 | GPT-5.6 Terra OpenAI | 77.4 | 127 t/s |
| 36 | Gemma 4 31B Google · Aperto | 76.7 | 35 t/s |
| 37 | DeepSeek V4.1 Flash DeepSeek · Aperto · reasoning | 76.3 | 214 t/s |
| 38 | GPT-5.6 Luna OpenAI | 76.3 | 175 t/s |
| 39 | Claude Opus 4.8 Anthropic | 76.1 | 50 t/s |
| 40 | Claude Opus 4.1 Anthropic | 75.9 | 80 t/s |
| 41 | GPT-5.3 Codex OpenAI | 75.4 | 118 t/s |
| 42 | GLM-5.3 Flash Z.ai · Aperto | 75.2 | 182 t/s |
| 43 | Qwen3.6 Plus Alibaba | 74.6 | 55 t/s |
| 44 | Nemotron 3 Ultra 550B NVIDIA · Aperto | 74.1 | 142 t/s |
| 45 | Grok 4.3 xAI | 73.1 | 129 t/s |
| 46 | Qwen3.5 397B-A17B Alibaba · Aperto | 73.1 | 71 t/s |
| 47 | Inkling Thinking Machines | 72.7 | 81 t/s |
| 48 | Claude Opus 4.6 Anthropic | 71.5 | 50 t/s |
| 49 | DeepSeek V4 Flash DeepSeek · Aperto | 71.5 | 113 t/s |
| 50 | Qwen3 Max Alibaba · Aperto | 70.3 | 85 t/s |
| 51 | GPT-5 OpenAI | 69.9 | 60 t/s |
| 52 | o3 OpenAI · reasoning | 68.7 | 90 t/s |
| 53 | DeepSeek V3.2 DeepSeek · Aperto | 66.3 | 60 t/s |
| 54 | DeepSeek R1 DeepSeek · Aperto · reasoning | 65.1 | 60 t/s |
| 55 | Kimi K2.7 Code Moonshot AI · Aperto | 63.1 | 39 t/s |
| 56 | Qwen3.5 122B-A10B Alibaba · Aperto | 63.1 | 126 t/s |
| 57 | DeepSeek V4 Pro DeepSeek · Aperto | 62.7 | 66 t/s |
| 58 | Agnes 3.0 Flash Agnes · reasoning | 52.2 | 235 t/s |
| 59 | Granite 4.2 30B Instruct IBM · Aperto | 48.2 | 78 t/s |
| 60 | Granite 4.2 8B Instruct IBM · Aperto | 22.1 | 115 t/s |
| 61 | Granite 4.2 3B Instruct IBM · Aperto | 0.0 | 148 t/s |
Il Podium Score è una combinazione ponderata di cinque classifiche. Consulta la Metodologia per i dettagli.