순위표
도구 호출 랭킹
에이전트 워크플로의 함수 호출 및 API 오케스트레이션: Toolathlon, MCP Atlas, τ²-Bench.
종합700코딩399수학53추론413에이전트55지식412멀티모달382코딩 에이전트55과학 추론82다국어12글쓰기61채팅 어시스턴트61리서치85도구 호출32긴 컨텍스트82속도402가성비401오픈 웨이트170
32개 모델
| # | 모델명 | Podium Score | 속도 |
|---|---|---|---|
| 01 | Claude Fable 5 Anthropic · reasoning | 98.5 | 71 t/s |
| 02 | Gemini 3.5 Flash Google | 95.3 | 267 t/s |
| 03 | MiMo V2.5 Pro Xiaomi · 오픈소스 | 94.2 | 65 t/s |
| 4 | Muse Spark Meta | 91.5 | 80 t/s |
| 5 | Kimi K2.7 Code Moonshot AI · 오픈소스 | 90.1 | 39 t/s |
| 6 | MiniMax M3 MiniMax | 88.9 | 93 t/s |
| 7 | GPT-6 Astra OpenAI · reasoning | 88.0 | 82 t/s |
| 8 | Gemini 3 Pro Google | 87.1 | 120 t/s |
| 9 | GPT-5.3 Codex OpenAI | 86.0 | 118 t/s |
| 10 | Qwen3.7 Max Alibaba | 85.6 | 203 t/s |
| 11 | Nemotron 3 Ultra 550B NVIDIA · 오픈소스 | 83.3 | 142 t/s |
| 12 | Gemini 3.1 Pro Google | 82.4 | 136 t/s |
| 13 | Claude Opus 4.8 Anthropic | 78.8 | 50 t/s |
| 14 | Kimi K3 Moonshot AI · 오픈소스 · reasoning | 78.7 | 37 t/s |
| 15 | Claude Opus 4.7 Anthropic | 77.3 | 80 t/s |
| 16 | GPT-5.5 OpenAI | 74.9 | 60 t/s |
| 17 | GLM-5.2 Z.ai · 오픈소스 | 74.7 | 164 t/s |
| 18 | Claude Opus 4.6 Anthropic | 73.8 | 50 t/s |
| 19 | Qwen3.7 Plus Alibaba | 73.2 | 54 t/s |
| 20 | DeepSeek V4 Pro DeepSeek · 오픈소스 | 72.2 | 66 t/s |
| 21 | GPT-5.6 Sol OpenAI | 71.6 | 72 t/s |
| 22 | Qwen3.6 Plus Alibaba | 70.5 | 55 t/s |
| 23 | GPT-5.6 Terra OpenAI | 69.7 | 127 t/s |
| 24 | Hunyuan Hy3 Tencent | 63.8 | 69 t/s |
| 25 | Claude Sonnet 4.6 Anthropic | 61.3 | 50 t/s |
| 26 | GPT-5.4 OpenAI | 60.9 | 60 t/s |
| 27 | DeepSeek V4 Flash DeepSeek · 오픈소스 | 58.4 | 113 t/s |
| 28 | GPT-5.2 OpenAI | 53.5 | 90 t/s |
| 29 | GPT-5.6 Luna OpenAI | 53.4 | 175 t/s |
| 30 | Gemini 3 Flash Google | 53.4 | 120 t/s |
| 31 | Kimi K2.6 Moonshot AI · 오픈소스 | 50.0 | 40 t/s |
| 32 | Qwen3.5 397B-A17B Alibaba · 오픈소스 | 38.3 | 71 t/s |
Podium Score는 5개 리더보드의 가중 평균입니다. 자세한 내용은 평가 방법을 참고하세요.