🤖 Agentic · llm-stats.com
τ²-Bench Retail
Dual-control conversational agent tasks in a simulated retail environment.
19
테스트된 모델
GLM-5.2
톱 모델
99.1%
최고 점수
Z.ai
제공업체
| # | 모델명 | τ²-Bench Retail |
|---|---|---|
| 1 | GLM-5.2 Z.ai | 99.1% |
| 2 | Claude Fable 5 Anthropic | 98.5% |
| 3 | Qwen3.6 Plus Alibaba | 97.7% |
| 4 | Gemini 3.1 Pro Google | 95.6% |
| 5 | Gemini 3.5 Flash Google | 95.3% |
| 6 | Qwen3.7 Max Alibaba | 94.7% |
| 7 | Claude Opus 4.8 Anthropic | 94.4% |
| 8 | MiMo V2.5 Pro Xiaomi | 94.2% |
| 9 | GPT-5.5 OpenAI | 93.9% |
| 10 | Muse Spark Meta | 91.5% |
| 11 | DeepSeek V4 Pro DeepSeek | 91.2% |
| 12 | Kimi K2.7 Code Moonshot AI | 90.1% |
| 13 | MiniMax M3 MiniMax | 88.9% |
| 14 | Gemini 3 Pro Google | 87.1% |
| 15 | GPT-5.6 Terra OpenAI | 86.3% |
| 16 | GPT-5.3 Codex OpenAI | 86% |
| 17 | GPT-5.6 Sol OpenAI | 85.1% |
| 18 | Claude Opus 4.6 Anthropic | 84.8% |
| 19 | Nemotron 3 Ultra 550B NVIDIA | 83.3% |
벤치마크 데이터는 llm-stats.com에서 집계. 자세한 내용은 방법론.