👁️ Multimodal · llm-stats.com
CharXiv Reasoning
Reasoning over scientific charts and figures from arXiv papers.
12
测试模型数
Claude Mythos Preview
最佳模型
93.2%
最高分
Anthropic
提供商
| # | 模型名称 | CharXiv Reasoning |
|---|---|---|
| 1 | Claude Mythos Preview Anthropic | 93.2% |
| 2 | Kimi K3 Moonshot AI | 91.3% |
| 3 | Claude Opus 4.7 Anthropic | 91% |
| 4 | Claude Opus 4.8 Anthropic | 89.9% |
| 5 | Kimi K2.6 Moonshot AI | 86.7% |
| 6 | Muse Spark Meta | 86.4% |
| 7 | Qwen3.7 Plus Alibaba | 85.9% |
| 8 | GPT-5.2 OpenAI | 82.1% |
| 9 | Qwen3.6 Plus Alibaba | 81.5% |
| 10 | Gemini 3 Pro Google | 81.4% |
| 11 | Gemini 3 Flash Google | 80.3% |
| 12 | Claude Opus 4.6 Anthropic | 77.4% |
基准数据聚合自 llm-stats.com。详见方法论。