Glossaire LLM

Les concepts essentiels que vous rencontrerez en lisant les classements. Chaque terme avec une explication courte et un lien vers la page associée.

Podium Score

Le score composite 0–100 de LLMPodium : 0.35·Elo d'arène + 0.30·moyenne des benchmarks + 0.20·Indice d'intelligence + 0.15·LLM Stats, normalisé min-max avec repondération des signaux manquants. — voir les données

Classement Elo

Un système de notation emprunté aux échecs. Dans les arènes LLM, les modèles gagnent de l'Elo en remportant des duels de préférence humaine ; la différence entre deux Elo prédit la probabilité de victoire. — voir les données

Benchmark

Un jeu de tests standardisé avec des tâches notées (maths, code, sciences) pour mesurer une capacité précise du modèle dans des conditions comparables. — voir les données

Tokens

Les fragments de sous-mots que les LLM lisent et écrivent. Environ 1 token ≈ 4 caractères de texte anglais ; les prix sont indiqués par million (M) de tokens.

Fenêtre de contexte

La quantité maximale de texte (en tokens) qu'un modèle peut considérer à la fois — prompt plus réponse. Les modèles frontière de 2026 vont de 128K à 1M de tokens. — voir les données

TTFT (temps avant le premier token)

La latence avant l'arrivée du premier token de sortie. Elle domine la réactivité perçue en chat ; mesurée en millisecondes. — voir les données

Débit de sortie (tokens/s)

Combien de tokens par seconde un modèle génère après le premier token. Détermine la vitesse des réponses longues. — voir les données

Mixture of Experts (MoE)

Une architecture où seul un sous-ensemble des paramètres (« experts ») s'active par token : beaucoup de connaissances pour un coût d'inférence réduit — ex. Qwen3.8 Max ou DeepSeek V4. — voir les données

Poids ouverts

Des modèles dont les paramètres entraînés sont publiés, permettant l'auto-hébergement et le fine-tuning (Kimi K3, GLM-5.2, Llama 4). Par opposition aux modèles propriétaires par API uniquement. — voir les données

Modèle de raisonnement

Un modèle entraîné à dépenser des tokens de « réflexion » supplémentaires avant de répondre : il échange de la latence contre de la précision sur les problèmes difficiles (GPQA, HLE, maths de compétition). — voir les données

Hallucination

Une affirmation assurée mais sans fondement. Les benchmarks de factualité comme SimpleQA mesurent la fréquence à laquelle les modèles les évitent. — voir les données

SWE-Bench Verified

Résoudre de vraies issues GitHub dans de vrais dépôts, vérifié par des humains. Le benchmark standard de l'ingénierie logicielle agentique. — voir les données

GPQA Diamond

Des questions scientifiques de niveau doctoral rédigées par des experts et « résistantes à la recherche » ; un benchmark central de raisonnement. — voir les données

Humanity's Last Exam

Un ensemble de questions rédigées par des experts à la frontière de la connaissance humaine ; les modèles frontière actuels scorent encore 40–60%. — voir les données

MMLU-Pro

Le successeur renforcé de MMLU : 14 catégories et des choix plus difficiles pour mesurer de larges connaissances académiques. — voir les données

Normalisation min-max

Remettre à l'échelle n'importe quelle métrique brute sur 0–100 sur l'ensemble des modèles suivis, afin de pouvoir mélanger des scores de sources différentes. 80 signifie toujours « 80% du chemin du pire au meilleur ». — voir les données

Intervalle de confiance (±CI)

L'incertitude statistique d'un Elo d'arène. Des intervalles qui se chevauchent signifient que deux modèles sont effectivement à égalité. — voir les données

$/M tokens

Prix par million de tokens, indiqué séparément pour l'entrée et la sortie. Les tokens de sortie sont généralement 3 à 5 fois plus chers que les tokens d'entrée. — voir les données