GrokvsPhi

Comparing xAI and Microsoft. Average Podium Score across top models: Grok (73.6) vs Phi (58.4). Flagship showdown: Grok 4.20 Beta1 (74.0) vs Phi 3 Medium 4k Instruct (60.0).

Grok (xAI)

Real-time knowledge and frontier reasoning models from xAI.

Top Model: Grok 4.20 Beta1
Avg Score: 73.6
Licensing: Proprietary API

Phi (Microsoft)

Highly capable Small Language Models (SLMs) from Microsoft Research.

Avg Score: 58.4
Licensing: Open Weights Available

Top Models Showdown

RankModelLabScoreCodingReasoningSpeedPrice / 1M
#1Grok 4.20 Beta1xAI74.050 t/s$15/M
#2Grok 4.20 Beta 0309 ReasoningxAI74.050 t/s$15/M
#3Grok 4.20 Multi Agent Beta 0309xAI74.050 t/s$15/M
#4Grok 4.1 ThinkingxAI73.050 t/s$15/M
#5Grok 4.1xAI73.050 t/s$15/M
#6Phi 3 Medium 4k InstructMicrosoft60.050 t/s$3/M
#7Wizardlm 70bMicrosoft59.050 t/s$3/M
#8Phi 3 Small 8k InstructMicrosoft59.050 t/s$3/M
#9Wizardlm 13bMicrosoft57.050 t/s$3/M
#10Phi 3 Mini 4k Instruct June 2024Microsoft57.050 t/s$3/M
Looking for more ecosystem comparisons? Grok vs Claude · Grok vs ChatGPT / GPT · Grok vs Kimi · Grok vs DeepSeek · Grok vs Gemini · Grok vs Qwen
0 / 4 Models Selected