Glossaire LLM
Les concepts essentiels que vous rencontrerez en lisant les classements. Chaque terme avec une explication courte et un lien vers la page associée.
Podium Score
Le score composite 0–100 de LLMPodium : 0.35·Elo d'arène + 0.30·moyenne des benchmarks + 0.20·Indice d'intelligence + 0.15·LLM Stats, normalisé min-max avec repondération des signaux manquants. — voir les données
Classement Elo
Un système de notation emprunté aux échecs. Dans les arènes LLM, les modèles gagnent de l'Elo en remportant des duels de préférence humaine ; la différence entre deux Elo prédit la probabilité de victoire. — voir les données
Benchmark
Un jeu de tests standardisé avec des tâches notées (maths, code, sciences) pour mesurer une capacité précise du modèle dans des conditions comparables. — voir les données
Tokens
Les fragments de sous-mots que les LLM lisent et écrivent. Environ 1 token ≈ 4 caractères de texte anglais ; les prix sont indiqués par million (M) de tokens.
Fenêtre de contexte
La quantité maximale de texte (en tokens) qu'un modèle peut considérer à la fois — prompt plus réponse. Les modèles frontière de 2026 vont de 128K à 1M de tokens. — voir les données
TTFT (temps avant le premier token)
La latence avant l'arrivée du premier token de sortie. Elle domine la réactivité perçue en chat ; mesurée en millisecondes. — voir les données
Débit de sortie (tokens/s)
Combien de tokens par seconde un modèle génère après le premier token. Détermine la vitesse des réponses longues. — voir les données
Mixture of Experts (MoE)
Une architecture où seul un sous-ensemble des paramètres (« experts ») s'active par token : beaucoup de connaissances pour un coût d'inférence réduit — ex. Qwen3.8 Max ou DeepSeek V4. — voir les données
Poids ouverts
Des modèles dont les paramètres entraînés sont publiés, permettant l'auto-hébergement et le fine-tuning (Kimi K3, GLM-5.2, Llama 4). Par opposition aux modèles propriétaires par API uniquement. — voir les données
Modèle de raisonnement
Un modèle entraîné à dépenser des tokens de « réflexion » supplémentaires avant de répondre : il échange de la latence contre de la précision sur les problèmes difficiles (GPQA, HLE, maths de compétition). — voir les données
Hallucination
Une affirmation assurée mais sans fondement. Les benchmarks de factualité comme SimpleQA mesurent la fréquence à laquelle les modèles les évitent. — voir les données
SWE-Bench Verified
Résoudre de vraies issues GitHub dans de vrais dépôts, vérifié par des humains. Le benchmark standard de l'ingénierie logicielle agentique. — voir les données
GPQA Diamond
Des questions scientifiques de niveau doctoral rédigées par des experts et « résistantes à la recherche » ; un benchmark central de raisonnement. — voir les données
Humanity's Last Exam
Un ensemble de questions rédigées par des experts à la frontière de la connaissance humaine ; les modèles frontière actuels scorent encore 40–60%. — voir les données
MMLU-Pro
Le successeur renforcé de MMLU : 14 catégories et des choix plus difficiles pour mesurer de larges connaissances académiques. — voir les données
Normalisation min-max
Remettre à l'échelle n'importe quelle métrique brute sur 0–100 sur l'ensemble des modèles suivis, afin de pouvoir mélanger des scores de sources différentes. 80 signifie toujours « 80% du chemin du pire au meilleur ». — voir les données
Intervalle de confiance (±CI)
L'incertitude statistique d'un Elo d'arène. Des intervalles qui se chevauchent signifient que deux modèles sont effectivement à égalité. — voir les données
$/M tokens
Prix par million de tokens, indiqué séparément pour l'entrée et la sortie. Les tokens de sortie sont généralement 3 à 5 fois plus chers que les tokens d'entrée. — voir les données