👁️ Multimodal · llm-stats.com
CharXiv Reasoning
Reasoning over scientific charts and figures from arXiv papers.
12
테스트된 모델
Claude Mythos Preview
톱 모델
93.2%
최고 점수
Anthropic
제공업체
| # | 모델명 | CharXiv Reasoning |
|---|---|---|
| 1 | Claude Mythos Preview Anthropic | 93.2% |
| 2 | Kimi K3 Moonshot AI | 91.3% |
| 3 | Claude Opus 4.7 Anthropic | 91% |
| 4 | Claude Opus 4.8 Anthropic | 89.9% |
| 5 | Kimi K2.6 Moonshot AI | 86.7% |
| 6 | Muse Spark Meta | 86.4% |
| 7 | Qwen3.7 Plus Alibaba | 85.9% |
| 8 | GPT-5.2 OpenAI | 82.1% |
| 9 | Qwen3.6 Plus Alibaba | 81.5% |
| 10 | Gemini 3 Pro Google | 81.4% |
| 11 | Gemini 3 Flash Google | 80.3% |
| 12 | Claude Opus 4.6 Anthropic | 77.4% |
벤치마크 데이터는 llm-stats.com에서 집계. 자세한 내용은 방법론.