reasoning Reasoning · llm-stats.com
GPQA Diamond
Graduate-level science questions in physics, chemistry and biology, designed to be Google-proof.
82
Modèles testés
GPT-6 Astra
Modèle phare
96%
Meilleur score
OpenAI
Fournisseur
| # | Modèle | GPQA Diamond |
|---|---|---|
| 1 | GPT-6 Astra OpenAI | 96% |
| 2 | Claude Mythos Preview Anthropic | 94.6% |
| 3 | GPT-5.6 Sol OpenAI | 94.6% |
| 4 | Gemini 3.1 Pro Google | 94.3% |
| 5 | Claude Opus 4.7 Anthropic | 94.2% |
| 6 | Claude Opus 4.8 Anthropic | 93.6% |
| 7 | GPT-5.5 OpenAI | 93.6% |
| 8 | Kimi K3 Moonshot AI | 93.5% |
| 9 | Claude Opus 5 Anthropic | 93.2% |
| 10 | Grok 4.5 xAI | 93% |
| 11 | GPT-5.6 Terra OpenAI | 92.9% |
| 12 | MiniMax M3 MiniMax | 92.9% |
| 13 | Gemini 3.6 Flash Google | 92.8% |
| 14 | GPT-5.4 OpenAI | 92.8% |
| 15 | Claude Fable 5 Anthropic | 92.6% |
| 16 | Qwen3.8 Max Alibaba | 92.6% |
| 17 | Qwen3.7 Max Alibaba | 92.4% |
| 18 | GPT-5.2 OpenAI | 92.4% |
| 19 | GPT-5.6 Luna OpenAI | 92.3% |
| 20 | Gemini 3.5 Flash Google | 92.2% |
| 21 | Gemini 3 Pro Google | 91.9% |
| 22 | GPT-5.3 Codex OpenAI | 91.5% |
| 23 | Claude Opus 4.6 Anthropic | 91.3% |
| 24 | GLM-5.2 Z.ai | 91.2% |
| 25 | Kimi K2.6 Moonshot AI | 90.5% |
| 26 | Gemini 3 Flash Google | 90.4% |
| 27 | Hunyuan Hy3 Tencent | 90.4% |
| 28 | Qwen3.6 Plus Alibaba | 90.4% |
| 29 | Qwen3.7 Plus Alibaba | 90.3% |
| 30 | DeepSeek V4 Pro DeepSeek | 90.1% |
| 31 | Claude Sonnet 4.6 Anthropic | 89.9% |
| 32 | Muse Spark 1.1 Meta | 89.8% |
| 33 | Kimi K2.7 Code Moonshot AI | 89.6% |
| 34 | Muse Spark Meta | 89.5% |
| 35 | Seed 2.0 Pro ByteDance | 88.9% |
| 36 | Grok 4 Heavy xAI | 88.4% |
| 37 | Qwen3.5 397B-A17B Alibaba | 88.4% |
| 38 | GPT-5.1 OpenAI | 88.1% |
| 39 | DeepSeek V4 Flash DeepSeek | 88.1% |
| 40 | Inkling Thinking Machines | 87.2% |
| 41 | Claude Opus 4.5 Anthropic | 87% |
| 42 | Nemotron 3 Ultra 550B NVIDIA | 87% |
| 43 | MiMo V2.5 Pro Xiaomi | 86.6% |
| 44 | Qwen3.5 122B-A10B Alibaba | 86.6% |
| 45 | GPT-5 OpenAI | 85.7% |
| 46 | Qwen3.8 Flash Next Alibaba | 81% |
| 47 | Claude Sonnet 5 Anthropic | 80% |
| 48 | GLM-5.3 Flash Z.ai | 78.5% |
| 49 | 68% | |
| 50 | GLM-5.1 Z.ai | 67% |
| 51 | Claude Sonnet 4.6 (max) Anthropic | 67% |
| 52 | MiniMax-M2.7 MiniMax | 64% |
| 53 | DeepSeek V4.1 Flash DeepSeek | 62% |
| 54 | 54% | |
| 55 | Mistral Medium 3.5 Mistral | 51% |
| 56 | Agnes 3.0 Flash Agnes | 49% |
| 57 | Claude 4.5 Haiku Anthropic | 48% |
| 58 | Nova 2.0 Pro Preview Amazon | 46% |
| 59 | Agnes 2.5 Pro Beta Agnes | 45% |
| 60 | GPT-oss-120B OpenAI | 43% |
| 61 | 42% | |
| 62 | DeepSeek V4 Flash Vision DeepSeek | 36% |
| 63 | G9v3-39A5B AI9Stars | 36% |
| 64 | G9v3-3B AI9Stars | 36% |
| 65 | GLM-5.3 Zhipu AI | 36% |
| 66 | 36% | |
| 67 | 36% | |
| 68 | 36% | |
| 69 | HyperNova 60B Multiverse | 36% |
| 70 | KAT-Coder-Pro V2 Kwai | 36% |
| 71 | LFM2.5-2.6B Liquid AI | 36% |
| 72 | LFM2.5-8B-A1B Liquid AI | 36% |
| 73 | LFM2.5-VL-1.6B Liquid AI | 36% |
| 74 | LongCat 2.0 LongCat | 36% |
| 75 | Magistral Small 1.2 Mistral | 36% |
| 76 | Qwen3.8 27B (xhigh) Alibaba | 36% |
| 77 | Qwen3.8 27B (low) Alibaba | 36% |
| 78 | Qwen3.8 27B (medium) Alibaba | 36% |
| 79 | Qwen3.8 27B (Non-reasoning) Alibaba | 36% |
| 80 | Solar Pro 3 Upstage | 34% |
| 81 | GPT-oss-20B OpenAI | 32% |
| 82 | 31% |
Données agrégées depuis llm-stats.com. Voir Méthodologie.