💻 Coding · llmbase.ai
Terminal-Bench Hard
Multi-step command-line tasks in realistic terminal environments.
19
Model diuji
GPT-5.6 Sol
Model teratas
65.9%
Skor terbaik
OpenAI
Penyedia
| # | Model | Terminal-Bench Hard |
|---|---|---|
| 1 | GPT-5.6 Sol OpenAI | 65.9% |
| 2 | Claude Fable 5 Anthropic | 62.9% |
| 3 | GPT-5.5 OpenAI | 60.6% |
| 4 | Claude Opus 4.8 Anthropic | 58.3% |
| 5 | GPT-5.6 Terra OpenAI | 57.6% |
| 6 | Gemini 3.1 Pro Google | 53.8% |
| 7 | GPT-5.3 Codex OpenAI | 53% |
| 8 | GLM-5.2 Z.ai | 50.8% |
| 9 | Qwen3.7 Max Alibaba | 50.8% |
| 10 | Claude Opus 4.6 Anthropic | 48.5% |
| 11 | Muse Spark Meta | 45.5% |
| 12 | Kimi K2.7 Code Moonshot AI | 44.7% |
| 13 | Qwen3.6 Plus Alibaba | 43.9% |
| 14 | MiMo V2.5 Pro Xiaomi | 43.2% |
| 15 | MiniMax M3 MiniMax | 42.4% |
| 16 | Gemini 3 Pro Google | 41.7% |
| 17 | Gemini 3.5 Flash Google | 40.9% |
| 18 | DeepSeek V4 Pro DeepSeek | 36.4% |
| 19 | Nemotron 3 Ultra 550B NVIDIA | 36.4% |
Data benchmark digabungkan dari llmbase.ai. Selengkapnya di metodologi.