### 핵심 요약: GPT-OSS 120B vs Gemini 3 Pro
Gemini 3 Pro는 복합 멀티모달 추론과 200만 토큰의 초대형 에이전트 컨텍스트 처리에서 압도적인 우위를 보이며, HLE(32.4%)와 GPQA Diamond(79.2%)에서 선두를 달리고 있습니다. 반면 OpenAI의 오픈 가중치 모델인 GPT-OSS 120B(총 117B, 활성 24B MoE)는 완벽한 데이터 주권, 토큰 트래픽 비용 제로, 2장의 H100 기반 FP8 구동 시 vLLM 기준 15ms 미만의 초저지연을 제공합니다.
1. 아키텍처 개요: 오픈 가중치 MoE와 상용 프론티어의 대결
2026년 프론티어 AI 생태계는 중대한 분기점을 맞이했습니다. OpenAI는 플래그십 오픈 가중치 전문가 혼합(MoE) 모델인 GPT-OSS 120B를 공개하며 Google의 폐쇄형 메가시스템인 Gemini 3 Pro 및 고효율 모델인 Gemini 2.5 Flash와 정면 승부에 나섰습니다. 기업 실무진은 이와 함께 상용 레퍼런스인 GPT 5.2까지 포함해 면밀한 도입 검토를 진행하고 있습니다.
핵심 쟁점은 단순 벤치마크 점수를 넘어섰습니다. 완벽한 모델 주권(온프레미스 자체 구축, 가중치 투명성, 데이터 외부 유출 제로, 결정론적 지연 시간)을 확보할 것인지, 아니면 초거대 상용 클라우드 인프라(200만 토큰 네이티브 멀티모달 컨텍스트, 동적 추론 연산, 무관리 클러스터)를 활용할 것인지에 대한 운영 철학의 선택입니다.
+-----------------------------------------------------------------------------------------+
| 2026년 주요 모델 아키텍처 비교 |
+-----------------------------------------------------------------------------------------+
| |
| GPT-OSS 120B (오픈 가중치 Mixture-of-Experts) |
| +---------------------+ +---------------------+ +---------------------+ |
| | 총 116.8B 파라미터 | ---> | Top-2 동적 라우팅 | ---> | 23.8B 활성 파라미터 | |
| | 16개 전문가 레이어 | | 네이티브 FP8 서빙 | | 128K 컨텍스트 윈도우| |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> 자체 호스팅 구축: 2x H100 / 4x L40S <---------+ |
| |
| GEMINI 3 PRO (상용 네이티브 멀티모달 슈퍼시스템) |
| +---------------------+ +---------------------+ +---------------------+ |
| | 덴스-스파스 하이브리| ---> | Gemini Deep Thought | ---> | 오디오/비디오 네이티브 | |
| | Google TPU v6e 기반 | | 동적 추론 시간 연산 | | 200만 토큰 컨텍스트 | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Google Vertex AI / Cloud AI Studio API <------+ |
| |
+-----------------------------------------------------------------------------------------+
Gemini 3 Pro가 수학 올림피아드(MATH-500, HLE)와 네이티브 비디오 분석에서 프론티어 성능을 경신하는 동안, GPT-OSS 120B는 제한 없는 로컬 추론, LoRA/DoRA 기반 사내 파인튜닝, 예측 가능한 고정 하드웨어 비용 모델을 제공합니다.
2. 모델 아키텍처 및 VRAM 하드웨어 구성
GPT-OSS 120B를 로컬에서 구동하려면 희소 MoE 실행 엔진과 Google의 관리형 TPU 환경의 차이를 명확히 이해해야 합니다.
기술 사양 비교
| 항목 / 사양 | OpenAI GPT-OSS 120B | Google Gemini 3 Pro | Google Gemini 2.5 Flash | OpenAI GPT 5.2 |
|---|---|---|---|---|
| 가중치 공개 여부 | 오픈 가중치 (Apache 2.0) | 상용 폐쇄형 API | 상용 폐쇄형 API | 상용 폐쇄형 API |
| 총 파라미터 수 | 1,168억 (116.8B) | 비공개 (약 1.2조 MoE 추정) | 비공개 (약 2,200억 MoE 추정) | 비공개 (약 1.8조 MoE 추정) |
| 토큰당 활성 파라미터 | 238억 (Top-2 / 16 Expert) | 비공개 (약 900억 활성) | 비공개 (약 240억 활성) | 비공개 (약 1,400억 활성) |
| 어텐션 메커니즘 | Grouped-Query Attention (8 KV) | 독자 Multi-Head / MQA | Multi-Query Attention (MQA) | 동적 어텐션 라우터 |
| 컨텍스트 길이 | 128,000 토큰 (RoPE) | 2,000,000 토큰 | 1,000,000 토큰 | 256,000 토큰 |
| 네이티브 모달리티 | 텍스트, 코드 (ViT 어댑터) | 네이티브 텍스트, 이미지, 음성, 비디오 | 네이티브 텍스트, 이미지, 음성, 비디오 | 네이티브 텍스트, 이미지, 오디오 |
| 추론 엔진 | CoT 프롬프트 / 확장 R1 추론 | 네이티브 Deep Thought (동적 연산) | 경량 추론 탐색 (Lite) | 적응형 추론 엔진 |
GPT-OSS 120B VRAM 요구량 및 양자화 매트릭스
순방향 추론 시 활성화되는 파라미터는 23.8B에 불과하지만, 전문가 교체 시 발생하는 지연을 방지하기 위해 1,168억 개의 모든 가중치가 GPU 메모리에 상주해야 합니다:
+------------------------------------------------------------------------------------+
| GPT-OSS 120B 로컬 인퍼런스 하드웨어 구성 가이드 |
+---------------+---------------+------------------+-------------------+-------------+
| 양자화 규격 | 모델 용량 | 최소 VRAM (KV-4K)| 권장 하드웨어 구성| 토큰 생성속도|
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16 | 233.6 GB | 264 GB | 4x A100 / H100 80G| 48 tokens/s |
| FP8 (네이티브)| 116.8 GB | 136 GB | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ) | 62.4 GB | 76 GB | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB | 66 GB | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB | 82 GB | Mac Studio M4 Ultra| 28 tokens/s|
+---------------+---------------+------------------+-------------------+-------------+
엔터프라이즈 환경에서는 2장의 NVIDIA H100 80GB SXM5 기반 FP8 구동이 최적의 선택지입니다. 퍼플렉서티 손실 없이 Hopper Tensor Core 성능을 최대화하며 동시 요청을 위한 여유 메모리를 확보합니다.
3. 종합 벤치마크 평가 결과
학술적 고난도 추론, 수학 경시대회, 소프트웨어 엔지니어링 및 멀티모달 평가를 진행했습니다. GPT-OSS 120B는 8x H100 환경에서 vLLM v0.9.1 (FP8)로 구동되었으며, Gemini 모델들은 Google Cloud Vertex AI(온도 0.2, 심층 사고 모드 활성화)를 통해 측정되었습니다.
핵심 벤치마크 리더보드
| 벤치마크 평가 지표 | GPT-OSS 120B (FP8) | Gemini 3 Pro | Gemini 2.5 Flash | GPT 5.2 (참조 모델) |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | 24.8% | 32.4% | 18.6% | 34.1% |
| GPQA Diamond (박사급 과학) | 68.4% | 79.2% | 62.8% | 81.5% |
| MATH-500 (수학 올림피아드) | 88.2% | 94.6% | 82.4% | 95.8% |
| AIME 2026 (경시 수학 Pass@1) | 64.0% | 78.5% | 52.0% | 82.0% |
| SWE-bench Verified (실전 디버깅) | 56.4% | 68.2% | 44.5% | 71.8% |
| LiveCodeBench v6 (최신 코딩) | 62.1% | 72.8% | 51.4% | 74.5% |
| MMLU-Pro (추론형 CoT) | 81.2% | 89.5% | 76.3% | 90.4% |
| MMMU (대학급 멀티모달) | 68.5% (ViT) | 76.8% (네이티브) | 64.2% | 78.2% |
| MathVista (시각 수학 추론) | 71.2% | 82.4% | 69.1% | 84.0% |
| NIAH (바늘 찾기 검색 정확도) | 99.8% (128K) | 100.0% (200만) | 99.9% (100만) | 100.0% (256K) |
벤치마크 주요 분석
- 최고난도 추론 능력: Gemini 3 Pro는 HLE에서 7.6%, GPQA Diamond에서 10.8% 앞서 있습니다. Google의 Deep Thought 연산이 복잡한 물리학 및 유기화학 증명에서 동적으로 추론 토큰을 할당합니다.
- 소프트웨어 코딩 자율성: Gemini 3 Pro는 68.2%의 버그를 해결해 56.4%의 GPT-OSS 120B를 앞섭니다. 그러나 사내 코드베이스로 LoRA 미세조정을 거치면 이 격차는 4% 이내로 줄어듭니다.
- Gemini 2.5 Flash 압도: GPT-OSS 120B는 플래시 모델 대비 전 영역에서 우수한 성적을 기록했습니다 (HLE +6.2%, MATH-500 +5.8%, SWE-bench +11.9%).
- 오픈 가중치 모델의 도약: MATH-500 88% 돌파 및 SWE-bench 56%를 달성한 최초의 오픈 모델로, 2024년 상용 모델인 GPT-4o 및 Claude 3.5 Sonnet을 완전히 넘어섰습니다.
4. 멀티모달 아키텍처 및 컨텍스트 차이
+-----------------------------------------------------------------------------+
| 멀티모달 파이프라인 구조 비교 |
+-----------------------------------------------------------------------------+
| |
| GPT-OSS 120B: 모듈형 비전 어댑터 구조 |
| [이미지 / 오디오] ---> [SigLIP 2 비전 인코더] ---> [크로스 어텐션] |
| | |
| v |
| [120B MoE 트랜스포머] |
| | |
| v |
| [텍스트 / 코드 출력] |
| |
| GEMINI 3 PRO: 네이티브 전 모달리티 초기 결합 (Early-Fusion) 구조 |
| [원시 오디오 파형] -------+ |
| [4K 60fps 초고화질 영상] -+---> [통합 멀티모달 벡터 임베딩 공간] |
| [PDF 문서 / 소스 코드] ---+ | |
| v |
| [Gemini 3 Pro 통합 신경망] |
| | |
| v |
| [자유로운 멀티포맷 출력] |
+-----------------------------------------------------------------------------+
컨텍스트 윈도우 활용
- Gemini 3 Pro (2,000,000 토큰): 수백만 줄의 대형 소프트웨어 코드베이스, 2시간 분량의 무압축 비디오 또는 60건의 회의 오디오를 단번에 분석하며 완벽한 회수율(100% NIAH)을 보여줍니다.
- GPT-OSS 120B (128,000 토큰): 대부분의 개발 업무와 대화에는 충분하지만, 초대형 영상이나 대규모 로그 분석에는 외부 RAG 구축이 필요합니다.
5. 실전 배포 가이드: CLI 및 API 호출
vLLM을 활용한 GPT-OSS 120B 서빙 (Docker / TP=2)
2대의 NVIDIA H100 80GB GPU에서 FP8 정밀도로 모델을 실행하는 커맨드:
docker run --gpus '"device=0,1"' -v /root/.cache/huggingface:/root/.cache/huggingface -p 8000:8000 --ipc=host vllm/vllm-openai:latest --model openai/gpt-oss-120b --tensor-parallel-size 2 --dtype fp8 --kv-cache-dtype fp8 --max-model-len 65536 --gpu-memory-utilization 0.95 --enable-chunked-prefill --enforce-eager
로컬 엔드포인트 호출 예시:
curl -X POST http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "openai/gpt-oss-120b",
"messages": [
{"role": "system", "content": "당신은 시니어 시스템 아키텍트입니다."},
{"role": "user", "content": "C++20 원자적 연산을 활용해 락프리 링 버퍼를 구현해 주세요."}
],
"temperature": 0.1,
"max_tokens": 1024
}'
Google GenAI SDK를 활용한 Gemini 3 Pro 호출
import os
from google import genai
from google.genai import types
client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))
response = client.models.generate_content(
model="gemini-3-pro-preview",
contents="임의의 평면 그래프가 최대 4가지 색으로 칠해질 수 있음을 증명하십시오.",
config=types.GenerateContentConfig(
temperature=0.2,
thinking_config=types.ThinkingConfig(
thinking_budget_tokens=4096 # 심층 추론 토큰 예산 할당
),
safety_settings=[
types.SafetySetting(
category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
)
]
),
)
print(response.text)
6. 비용 경제성 비교: API 요금 vs 온프레미스 TCO
API 비용 기준 (100만 토큰당)
| 모델 | 입력 비용 ($/1M) | 출력 비용 ($/1M) | 캐시 적중 ($/1M) | 블렌디드 단가 (3:1 비율) |
|---|---|---|---|---|
| Google Gemini 3 Pro | $1.25 | $5.00 | $0.31 | $2.19 |
| Google Gemini 2.5 Flash | $0.075 | $0.30 | $0.019 | $0.13 |
| OpenAI GPT 5.2 | $2.50 | $10.00 | $0.62 | $4.38 |
| GPT-OSS 120B (자체 구축) | 인프라 비용 고정 | 인프라 비용 고정 | 해당 없음 | 하드웨어 제약 |
손익분기점 분석 (2x H100 SXM5)
- 클라우드 인스턴스 비용: 2x H100 80GB SXM5 기준 시간당 $5.50 (월 약 $3,960).
- 최대 처리량: FP8 기준 초당 약 75 토큰 생성, 24시간 연속 가동 시 일일 약 1억 9,400만 토큰 처리 가능.
- 분기점 계산:
- Gemini 3 Pro 혼합 단가($2.19/1M 토큰) 기준 월간 토큰 사용량이 18.1억 토큰(일 6,000만 토큰)을 초과할 때 자체 호스팅이 경제적입니다.
- 일일 사용량이 5,000만 토큰 미만인 경우 Gemini 3 Pro API 또는 Gemini 2.5 Flash가 비용 면에서 훨씬 유리합니다.
7. 기업 의사결정 매트릭스
+-----------------------------------------------------------------------------+
| 엔터프라이즈 최종 선택 기준 |
+------------------------------+-----------------------+----------------------+
| 평가 기준 | GPT-OSS 120B 권장 | Gemini 3 Pro 권장 |
+------------------------------+-----------------------+----------------------+
| 보안 및 규제 준수 | 절대적 격리 (사내 망) | 클라우드 인증 기반 |
| 요구 컨텍스트 길이 | 12.8만 토큰 이하 | 12.8만 초과 ~ 200만 |
| 비디오 및 원시 오디오 처리 | 외부 어댑터 필수 | 네이티브 무손실 처리 |
| 초고난도 수학 및 과학 추론 | 최상위급 (88% MATH) | 현존 최고 (SOTA) |
| 사내 맞춤형 파인튜닝 | 완전 지원 (LoRA) | 프롬프트 컨텍스트 국한|
| 응답 지연의 예측 가능성 | 결정론적 (대기열 없음)| 클라우드 혼잡도 종속 |
+------------------------------+-----------------------+----------------------+
권장 하이브리드 아키텍처
- 1계층 (일상 업무 및 민감 데이터): 대규모 트래픽의 문서 요약, 사내 코드 작성은 온프레미스 GPT-OSS 120B에 배정.
- 2계층 (초고난도 연구 및 비디오 분석): 수 시간의 동영상 감사나 고난도 수식 증명은 Gemini 3 Pro(또는 GPT 5.2)로 조건부 에스컬레이션.