Rangliste
Tool-Nutzung Rankings
Funktionsaufrufe und API-Orchestrierung in Agenten-Workflows: Toolathlon, MCP Atlas, τ²-Bench.
Gesamt700Coding399Mathematik53Reasoning413Agentic55Wissen412Multimodal382Coding-Agenten55Wissenschaft82Mehrsprachig12Schreiben61Chat & Assistenten61Research85Tool-Nutzung32Langkontext82Tempo402Preis-Leistung401Open Weights170
32 Modelle
| # | Modell | Podium Score | Geschwindigkeit |
|---|---|---|---|
| 01 | Claude Fable 5 Anthropic · reasoning | 98.5 | 71 t/s |
| 02 | Gemini 3.5 Flash Google | 95.3 | 267 t/s |
| 03 | MiMo V2.5 Pro Xiaomi · Offen | 94.2 | 65 t/s |
| 4 | Muse Spark Meta | 91.5 | 80 t/s |
| 5 | Kimi K2.7 Code Moonshot AI · Offen | 90.1 | 39 t/s |
| 6 | MiniMax M3 MiniMax | 88.9 | 93 t/s |
| 7 | GPT-6 Astra OpenAI · reasoning | 88.0 | 82 t/s |
| 8 | Gemini 3 Pro Google | 87.1 | 120 t/s |
| 9 | GPT-5.3 Codex OpenAI | 86.0 | 118 t/s |
| 10 | Qwen3.7 Max Alibaba | 85.6 | 203 t/s |
| 11 | Nemotron 3 Ultra 550B NVIDIA · Offen | 83.3 | 142 t/s |
| 12 | Gemini 3.1 Pro Google | 82.4 | 136 t/s |
| 13 | Claude Opus 4.8 Anthropic | 78.8 | 50 t/s |
| 14 | Kimi K3 Moonshot AI · Offen · reasoning | 78.7 | 37 t/s |
| 15 | Claude Opus 4.7 Anthropic | 77.3 | 80 t/s |
| 16 | GPT-5.5 OpenAI | 74.9 | 60 t/s |
| 17 | GLM-5.2 Z.ai · Offen | 74.7 | 164 t/s |
| 18 | Claude Opus 4.6 Anthropic | 73.8 | 50 t/s |
| 19 | Qwen3.7 Plus Alibaba | 73.2 | 54 t/s |
| 20 | DeepSeek V4 Pro DeepSeek · Offen | 72.2 | 66 t/s |
| 21 | GPT-5.6 Sol OpenAI | 71.6 | 72 t/s |
| 22 | Qwen3.6 Plus Alibaba | 70.5 | 55 t/s |
| 23 | GPT-5.6 Terra OpenAI | 69.7 | 127 t/s |
| 24 | Hunyuan Hy3 Tencent | 63.8 | 69 t/s |
| 25 | Claude Sonnet 4.6 Anthropic | 61.3 | 50 t/s |
| 26 | GPT-5.4 OpenAI | 60.9 | 60 t/s |
| 27 | DeepSeek V4 Flash DeepSeek · Offen | 58.4 | 113 t/s |
| 28 | GPT-5.2 OpenAI | 53.5 | 90 t/s |
| 29 | GPT-5.6 Luna OpenAI | 53.4 | 175 t/s |
| 30 | Gemini 3 Flash Google | 53.4 | 120 t/s |
| 31 | Kimi K2.6 Moonshot AI · Offen | 50.0 | 40 t/s |
| 32 | Qwen3.5 397B-A17B Alibaba · Offen | 38.3 | 71 t/s |
Der Podium Score ist eine gewichtete Mischung aus fünf Ranglisten. Siehe Methodik für Details.