LLM 용어집
순위표를 볼 때 마주치는 핵심 개념들입니다. 각 용어에 간단한 설명과 관련 페이지 링크를 달았습니다.
Podium Score
LLMPodium의 0–100 종합 순위 점수: 0.35·아레나 Elo + 0.30·벤치마크 평균 + 0.20·지능 지수 + 0.15·LLM Stats. min-max 정규화하며 결측 신호는 재가중합니다. — 실시간 데이터 보기
Elo 레이팅
체스에서 온 레이팅 시스템. LLM 아레나에서는 인간 선호 대결에서 이기면 Elo가 오르며, 두 Elo의 차이는 승률을 예측합니다. — 실시간 데이터 보기
벤치마크
채점되는 과제(수학, 코딩, 과학 문제)를 갖춘 표준화된 테스트 세트로, 비교 가능한 조건에서 모델의 특정 능력을 측정합니다. — 실시간 데이터 보기
토큰
LLM이 읽고 쓰는 하위 단어 조각. 영어 약 1토큰 ≈ 4자, 한국어는 1음절 ≈ 1토큰 안팎. 가격은 백만(M) 토큰 단위로 표시됩니다.
컨텍스트 창
모델이 한 번에 고려할 수 있는 최대 텍스트량(토큰) — 프롬프트와 답변 합계. 2026년 프론티어 모델은 128K~1M 토큰. — 실시간 데이터 보기
TTFT(첫 토큰까지 시간)
첫 출력 토큰이 도착할 때까지의 지연. 채팅의 체감 반응성을 좌우하며 밀리초로 측정합니다. — 실시간 데이터 보기
출력 처리량(tokens/s)
첫 토큰 이후 모델이 초당 생성하는 토큰 수. 긴 답변의 스트리밍 속도를 결정합니다. — 실시간 데이터 보기
Mixture of Experts(MoE)
토큰마다 파라미터의 일부("전문가")만 활성화하는 아키텍처. 작은 추론 비용으로 큰 지식을 확보 — 예: Qwen3.8 Max, DeepSeek V4. — 실시간 데이터 보기
오픈 웨이트
학습된 파라미터가 공개되어 자체 호스팅과 파인튜닝이 가능한 모델(Kimi K3, GLM-5.2, Llama 4). API 전용 독점 모델과 대비됩니다. — 실시간 데이터 보기
추론 모델
답변 전에 추가 "사고" 토큰을 쓰도록 훈련된 모델. 어려운 문제(GPQA, HLE, 경시 수학)에서 지연 대신 정확도를 취합니다. — 실시간 데이터 보기
환각
자신 있지만 근거 없는 진술. SimpleQA 같은 사실성 벤치마크가 그 빈도를 측정합니다. — 실시간 데이터 보기
SWE-Bench Verified
실제 저장소에서 실제 GitHub 이슈를 해결하고 사람이 검증합니다. 에이전틱 소프트웨어 엔지니어링의 표준 벤치마크. — 실시간 데이터 보기
GPQA Diamond
도메인 전문가가 작성한 대학원 수준의 "검색 방지" 과학 문제. 핵심 추론 벤치마크입니다. — 실시간 데이터 보기
Humanity's Last Exam
인간 지식의 최전선에 놓이도록 설계된 전문가 출제 문제 세트. 현재 프론티어 모델도 40–60% 수준. — 실시간 데이터 보기
MMLU-Pro
MMLU의 강화판으로 14개 카테고리에서 더 어려운 선택지로 폭넓은 학술 지식을 측정합니다. — 실시간 데이터 보기
Min-max 정규화
모든 원본 지표를 추적 모델 집합 전체에서 0–100으로 재조정해 서로 다른 출처의 점수를 혼합할 수 있게 합니다. 80은 항상 "최하와 최고 사이 80% 지점". — 실시간 데이터 보기
신뢰 구간(±CI)
아레나 Elo의 통계적 불확실성. 구간이 겹치면 두 모델은 사실상 동률입니다. — 실시간 데이터 보기
$/M 토큰
백만 토큰당 가격으로, 입력과 출력을 별도로 표시합니다. 출력 토큰은 보통 입력보다 3–5배 비쌉니다. — 실시간 데이터 보기