Новости ИИ

Релизы моделей, обновления бенчмарков и аналитика из нашего пайплайна данных.

2026-08-05
статья
Состояние LLM 2026: отчёт с пьедестала

Наш ежегодный срез данных: кто лидирует по Podium Score, насколько широк разрыв открытых весов, где оказались цены и какие бенчмарки решили исход года.

2026-08-03
статья
Лучшая LLM для кодинга в 2026: лидеры SWE-Bench, LiveCodeBench и Terminal-Bench

Какие ИИ-модели пишут лучший код в 2026? Сравниваем Claude Fable 5, Claude Mythos Preview, GPT-5.6 Sol и Kimi K3 на SWE-Bench Verified, LiveCodeBench и Terminal-Bench.

2026-08-02
статья
Открытые против проприетарных LLM в 2026: насколько велик разрыв?

Kimi K3 набирает 83.3 Podium Score — ближе к проприетарным флагманам, чем когда-либо. Оцениваем разрыв открытых весов 2026 по агрегированным данным рейтингов.

2026-08-01
статья
Сравнение цен LLM (2026): от $0.28 до $50 за миллион выходных токенов

Разброс 178×: самые дешёвые и дорогие флагманские LLM 2026, анализ «цена за интеллект» и где находится оптимум ценности.

2026-08-01
релиз
Anthropic releases Claude Mythos 5

Anthropic's next-generation model family, top-ranked on BenchLM with highest composite score.

2026-07-30
статья
Самые быстрые LLM 2026: сравнение скорости вывода и задержки

Gemini 3.5 Flash-Lite лидирует с 389 токенами/сек. Полный скоростной рейтинг флагманов и почему скорость — самый недооценённый бенчмарк.

2026-07-30
релиз
DeepSeek releases DeepSeek V4 Flash

DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total. This re-post-trained revision is suited for coding, reasoning, and agent workflows.

2026-07-29
релиз
Thinking Machines releases Inkling Small

Compact Inkling variant for fast, cheap inference.

2026-07-29
релиз
Anthropic releases Claude Mythos Preview

Research preview of Anthropic’s next-generation model family.

2026-07-28
модель
Added Qwen 3 235B

Added Alibaba Qwen 3 235B MoE model with hybrid thinking mode to all leaderboards.

2026-07-25
бенчмарк
LiveCodeBench scores updated

Updated LiveCodeBench scores for all models with latest contamination-free results.

2026-07-24
релиз
Alibaba releases Qwen3.8 Max

Alibaba’s newest hosted flagship, a fast riser on human preference arenas.

2026-07-23
релиз
Anthropic releases Claude Opus 5

Anthropic frontier model with adaptive reasoning effort levels, leading agentic coding benchmarks.

2026-07-20
модель
Added Llama 4 Maverick

Added Meta Llama 4 Maverick 400B MoE model with 1M context window support.

2026-07-20
релиз
Google releases Gemini 3.5 Flash-Lite

Lowest-cost Gemini 3.5 tier for extremely high-throughput serving.

2026-07-20
релиз
Google releases Gemini 3.6 Flash

Newest Flash-class Gemini, near-pro intelligence at 200+ tokens/s.

2026-07-15
обновление
Claude Opus 4 benchmark data

Added full benchmark suite for Claude Opus 4 including SWE-Bench and AIME scores.

2026-07-15
релиз
Moonshot AI releases Kimi K3

Moonshot’s frontier MoE with 1M context, top-tier agentic benchmark results.

2026-07-14
релиз
Thinking Machines releases Inkling

Thinking Machines’ first frontier model.

2026-07-10
статья
Что такое арена LLM и почему это важно?

Разбор концепции арены LLM — живых краудсорсинговых оценок, отражающих реальные предпочтения пользователей.

2026-07-10
функция
Multi-language support

LLMPodium now available in 10 languages: EN, ZH, JA, KO, TH, RU, DE, ES, IT, FR.

2026-07-08
релиз
Meta releases Muse Spark 1.1

Meta’s proprietary frontier model line, top-10 on blind human preference.

2026-07-08
релиз
OpenAI releases GPT-5.6 Luna

Fast, cheap GPT-5.6 variant built for high-volume production traffic.

2026-07-08
релиз
OpenAI releases GPT-5.6 Terra

Mid-tier GPT-5.6 model balancing intelligence with very high throughput.

2026-07-08
релиз
OpenAI releases GPT-5.6 Sol

Flagship of the GPT-5.6 series for complex reasoning, coding and multi-step agentic workflows.

2026-07-07
релиз
xAI releases Grok 4.5

xAI flagship with real-time knowledge and strong agentic results.

2026-07-05
модель
Added Gemini 2.5 Pro/Flash

Added Google Gemini 2.5 Pro and 2.5 Flash with thinking capabilities.

2026-07-05
релиз
Tencent releases Hunyuan Hy3

Tencent’s latest Hunyuan generation model.

2026-07-01
статья
Лучшие практики бенчмаркинга LLM в 2026 году

Как избежать утечки данных, учитывать чувствительность к промптам и строить надежные тесты.

2026-07-01
обновление
Pricing data refresh

Updated pricing data for all models from official API documentation.

2026-06-29
релиз
Anthropic releases Claude Sonnet 5

Balanced Claude tier with adaptive reasoning, strong speed-to-intelligence ratio.

2026-06-28
бенчмарк
SWE-Bench Verified scores

Updated SWE-Bench Verified scores for frontier models.

2026-06-20
модель
Added DeepSeek R1

Added DeepSeek R1 reasoning model with chain-of-thought capabilities.

2026-06-15
статья
Понимание методологии оценки LLM

Подробный разбор того, как LLMPodium нормализует и взвешивает оценки с нескольких независимых лидербордов.

2026-06-15
функция
Arena page launched

New Arena page for side-by-side model comparison launched.

2026-06-15
релиз
Z.ai releases GLM-5.2

Z.ai flagship with strong agent tool use and 150+ tokens/s.

2026-06-11
релиз
Moonshot AI releases Kimi K2.7 Code

Code-specialized Kimi variant for repository-level engineering.

2026-06-08
релиз
Anthropic releases Claude Fable 5

Anthropic flagship with adaptive reasoning and Opus-class fallback, tuned for the hardest open-ended and agentic tasks.

2026-06-03
релиз
NVIDIA releases Nemotron 3 Ultra 550B

NVIDIA’s 550B open MoE built for enterprise reasoning pipelines.

2026-06-01
релиз
Nex AGI releases Nex N2 Pro

Nex AGI’s efficiency-focused frontier model.