Benchmark
MMMU
Massive Multi-discipline Multimodal Understanding
College-level multimodal reasoning across art, business, science, health, humanities, tech.
25
Models Tested
o3
Top Model
80.4%
Top Score
100 %
Max Possible
| # | Model | MMMU Score |
|---|---|---|
| 1 | o3 OpenAI | 80.4% |
| 2 | Gemini 2.5 Pro Google | 79.5% |
| 3 | Claude Opus 4 Anthropic | 78.2% |
| 4 | o4-mini OpenAI | 74.8% |
| 5 | Llama 4 Maverick Meta | 73.1% |
| 6 | Grok 3 xAI | 72.8% |
| 7 | Claude Sonnet 4 Anthropic | 72.5% |
| 8 | DeepSeek R1 DeepSeek | 71.5% |
| 9 | Gemini 2.5 Flash Google | 70.1% |
| 10 | GPT-4o OpenAI | 69.1% |
| 11 | Claude 3.5 Sonnet Anthropic | 68.3% |
| 12 | Qwen 3 235B Alibaba | 66.5% |
| 13 | Llama 3.1 405B Meta | 64.5% |
| 14 | Gemini 2.0 Flash Google | 64.3% |
| 15 | DeepSeek V3 DeepSeek | 64.2% |
| 16 | Llama 3.3 70B Meta | 62.8% |
| 17 | Qwen 2.5 72B Alibaba | 61.2% |
| 18 | Claude 3.5 Haiku Anthropic | 60.2% |
| 19 | Mistral Large Mistral AI | 59.8% |
| 20 | GPT-4o Mini OpenAI | 59.4% |
| 21 | Grok 2 xAI | 58.5% |
| 22 | Llama 3.1 70B Meta | 58.2% |
| 23 | Phi-4 Microsoft | 52.3% |
| 24 | Mixtral 8x22B Mistral AI | 48.5% |
| 25 | Command R+ Cohere | 45.1% |
Source: Yue et al., 2024