독립적이고 객관적인
AI 모델 벤치마크 분석
최신 프론티어 AI 환경을 분석하여 최적의 파운데이션 모델, 요금제 및 멀티 클라우드 추론 제공업체를 선택하세요.
주요 지표
종합 지능 품질
Podium 종합 품질 인덱스 · 높을수록 우수
출력 속도
초당 출력 토큰 수 · 높을수록 빠름
100만 토큰당 비용
혼합 가격(3:1) · 낮을수록 경제적
01 · Real-Time Rankings
최상위 모델
Podium 종합 점수 기준 Top 10 모델
전체 보기 →| # | 모델명 | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
용도별 최적 모델
코딩
레포지토리 수준 코딩: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
1위 모델: Claude Fable 5.1
수학
경시 수학부터 프런티어까지: AIME, MATH, FrontierMath.
1위 모델: Claude Mythos Preview
추론
심층 추론과 과학: GPQA Diamond, HLE, ARC-AGI-2.
1위 모델: Claude Mythos Preview
에이전트
자율 도구 사용: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
1위 모델: Kimi K3
지식
사실 지식과 환각 저항: SimpleQA, MMLU-Pro, MMMLU.
1위 모델: Claude Mythos Preview
멀티모달
비전·문서 이해: MMMU, CharXiv, ScreenSpot-Pro.
1위 모델: Claude Mythos Preview
03 · Research & Analysis
최신 아티클
04 · FAQ
자주 묻는 질문
각 모델은 Podium Score(0–100)를 받습니다: 사용자 블라인드 테스트 아레나 Elo 35%, 벤치마크 평균 30%, Artificial Analysis 지능 지수 20%, LLM Stats 점수 15%의 가중치를 종합하여 산출합니다.
현재 Claude Mythos Preview이(가) 97.4점으로 선두이며, Claude Fable 5(93.4점)와 Claude Fable 5.1(88.4점)가 뒤를 잇고 있습니다.
700개 주요 플래그십 모델을 18개 카테고리(코딩, 수학, 추론, 에이전트, 지식, 멀티모달, 긴 컨텍스트, 속도, 가성비, 오픈 웨이트)별로 추적하며, 726개 모델의 전체 아레나 표도 제공합니다.
5개의 공개 리더보드(Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase)에서 매주 정기 업데이트됩니다.