Независимый
анализ ИИ-моделей
Изучите ландшафт передовых языковых моделей для выбора оптимальной нейросети, тарифа и провайдера инференса под ваши задачи.
Ключевые метрики
Качество интеллекта
Индекс качества Podium · Чем выше, тем лучше
Скорость генерации
Токенов в секунду · Чем выше, тем лучше
Стоимость за 1M токенов
Смешанный тариф (3:1) · Чем ниже, тем выгоднее
01 · Real-Time Rankings
Топ моделей
Топ-10 моделей по общему счёту Podium
Смотреть все →| # | Модель | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Лучшие по задачам
Код
Инженерия кода: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench и HumanEval.
Лидер: Claude Fable 5.1
Математика
От олимпиадной математики до фронтирных задач: AIME, MATH и FrontierMath.
Лидер: Claude Mythos Preview
Рассуждения
Глубокие рассуждения и наука: GPQA Diamond, HLE и ARC-AGI-2.
Лидер: Claude Mythos Preview
Агентность
Автономные инструменты и работа с компьютером: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Лидер: Kimi K3
Знания
Факты и устойчивость к галлюцинациям: SimpleQA, MMLU-Pro и MMMLU.
Лидер: Claude Mythos Preview
Мультимодальность
Понимание изображений и документов: MMMU, CharXiv и ScreenSpot-Pro.
Лидер: Claude Mythos Preview
03 · Research & Analysis
Последние статьи
04 · FAQ
Частые вопросы
Каждая модель получает Podium Score (0–100) — взвешенную смесь четырёх сигналов: 35% Elo арены из очных сравнений людьми, 30% среднее по бенчмаркам, 20% индекс интеллекта Artificial Analysis и 15% оценка LLM Stats. Все сигналы нормализованы к общей шкале, поэтому оценка — правдоподобная середина между пятью независимыми лидербордами.
Лидирует Claude Mythos Preview с результатом 97.4. Далее — Claude Fable 5 (93.4) и Claude Fable 5.1 (88.4). Рейтинги меняются еженедельно по мере поступления новых голосов и результатов.
Мы курируем 700 флагманских моделей в 18 категориях (кодинг, математика, рассуждение, агенты, знания, мультимодальность, длинный контекст, скорость, цена/качество и открытые веса), плюс полная таблица арены на 726 моделей.
Из пяти публичных лидербордов: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Каждый источник синхронизируется еженедельно; точная формула — на странице методологии.