🤖 Agentic · llm-stats.com

τ²-Bench Retail

Dual-control conversational agent tasks in a simulated retail environment.

19
โมเดลที่ทดสอบ
GLM-5.2
โมเดลเด่น
99.1%
คะแนนสูงสุด
Z.ai
ผู้ให้บริการ
#โมเดลτ²-Bench Retailผู้ให้บริการPodium Score
1
99.1%
Z.ai59.1
2
98.5%
Anthropic93.4
3
97.7%
Alibaba32.4
4
95.6%
Google60.6
5
95.3%
Google50.0
6
94.7%
Alibaba51.0
7
94.4%
Anthropic76.0
8
94.2%
Xiaomi48.0
9
GPT-5.5
OpenAI
93.9%
OpenAI54.0
10
91.5%
Meta47.0
11
91.2%
DeepSeek46.0
12
Kimi K2.7 Code
Moonshot AI
90.1%
Moonshot AI41.8
13
MiniMax M3
MiniMax
88.9%
MiniMax39.6
14
87.1%
Google51.9
15
86.3%
OpenAI66.4
16
86%
OpenAI52.4
17
85.1%
OpenAI80.8
18
84.8%
Anthropic61.2
19
83.3%
NVIDIA19.0
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี