Actualités IA
Sorties de modèles, mises à jour de benchmarks et analyses dans un seul flux.
Notre instantané annuel des données : qui mène le Podium Score, l’ampleur de l’écart poids ouverts, où se sont stabilisés les prix et quels benchmarks ont décidé l’année.
Quels modèles d’IA écrivent le meilleur code en 2026 ? Nous comparons Claude Fable 5, Claude Mythos Preview, GPT-5.6 Sol et Kimi K3 sur SWE-Bench Verified, LiveCodeBench et Terminal-Bench.
Kimi K3 score 83.3 au Podium Score — plus proche que jamais des modèles propriétaires frontier. Nous quantifions l’écart open-weight 2026 avec les données agrégées des classements.
Un écart de 178× : les LLMs frontier les moins chers et les plus chers de 2026, l’analyse prix-par-intelligence et où se trouve le meilleur rapport qualité-prix.
Anthropic's next-generation model family, top-ranked on BenchLM with highest composite score.
Gemini 3.5 Flash-Lite mène à 389 tokens/seconde. Le classement complet de vitesse des modèles frontière et pourquoi la vitesse est le benchmark le plus sous-estimé.
DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total. This re-post-trained revision is suited for coding, reasoning, and agent workflows.
Compact Inkling variant for fast, cheap inference.
Research preview of Anthropic’s next-generation model family.
Added Alibaba Qwen 3 235B MoE model with hybrid thinking mode to all leaderboards.
Updated LiveCodeBench scores for all models with latest contamination-free results.
Alibaba’s newest hosted flagship, a fast riser on human preference arenas.
Anthropic frontier model with adaptive reasoning effort levels, leading agentic coding benchmarks.
Added Meta Llama 4 Maverick 400B MoE model with 1M context window support.
Lowest-cost Gemini 3.5 tier for extremely high-throughput serving.
Newest Flash-class Gemini, near-pro intelligence at 200+ tokens/s.
Added full benchmark suite for Claude Opus 4 including SWE-Bench and AIME scores.
Moonshot’s frontier MoE with 1M context, top-tier agentic benchmark results.
Thinking Machines’ first frontier model.
Comprendre les arènes LLM : des évaluations en direct révélant les modèles préférés par les utilisateurs.
LLMPodium now available in 10 languages: EN, ZH, JA, KO, TH, RU, DE, ES, IT, FR.
Meta’s proprietary frontier model line, top-10 on blind human preference.
Fast, cheap GPT-5.6 variant built for high-volume production traffic.
Mid-tier GPT-5.6 model balancing intelligence with very high throughput.
Flagship of the GPT-5.6 series for complex reasoning, coding and multi-step agentic workflows.
xAI flagship with real-time knowledge and strong agentic results.
Added Google Gemini 2.5 Pro and 2.5 Flash with thinking capabilities.
Tencent’s latest Hunyuan generation model.
Comment éviter la contamination des données et construire des tests fiables.
Updated pricing data for all models from official API documentation.
Balanced Claude tier with adaptive reasoning, strong speed-to-intelligence ratio.
Updated SWE-Bench Verified scores for frontier models.
Added DeepSeek R1 reasoning model with chain-of-thought capabilities.
Comment LLMPodium normalise les scores issus de plusieurs classements.
New Arena page for side-by-side model comparison launched.
Z.ai flagship with strong agent tool use and 150+ tokens/s.
Code-specialized Kimi variant for repository-level engineering.
Anthropic flagship with adaptive reasoning and Opus-class fallback, tuned for the hardest open-ended and agentic tasks.
NVIDIA’s 550B open MoE built for enterprise reasoning pipelines.
Nex AGI’s efficiency-focused frontier model.