📜 Long Context · llm-stats.com
MRCR v2
Multi-round coreference resolution over needle-in-haystack long contexts.
8
โมเดลที่ทดสอบ
GPT-5.6 Sol
โมเดลเด่น
91.5%
คะแนนสูงสุด
OpenAI
ผู้ให้บริการ
| # | โมเดล | MRCR v2 |
|---|---|---|
| 1 | GPT-5.6 Sol OpenAI | 91.5% |
| 2 | GPT-5.6 Terra OpenAI | 89.6% |
| 3 | Claude Opus 4.6 Anthropic | 76% |
| 4 | GPT-5.5 OpenAI | 74% |
| 5 | GPT-5.6 Luna OpenAI | 41.3% |
| 6 | Gemini 3.1 Pro Google | 26.3% |
| 7 | Gemini 3 Pro Google | 26.3% |
| 8 | Gemini 3 Flash Google | 22.1% |
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี