ベンチマーク

GLM-6とGLM-5ベンチマーク徹底検証:Zhipu AIのアーキテクチャと実装力

### クイックアンサー:Zhipu AIのGLM-6とGLM-5.3の実力は?

清華大学発のZhipu AI(智譜AI)が開発したGLM-6GLM-5.3は、世界最高水準のバイリンガルモデルです。名機ChatGLMの系譜を継ぎ、GLM-6はLiveCodeBench v5 (Hard)で66.7%SWE-bench Verifiedで58.9%を記録。Claude 3.5 Sonnetと同等以上の性能を誇りながら、API利用料を欧米モデル比で75%〜85%削減します。


はじめに:ChatGLMの遺産とGLM-6の台頭

生成AIの進化において、清華大学の研究室から誕生したZhipu AI(智譜AI)の躍進は極めて象徴的です。2023年初頭にオープンソースとして世界を驚かせたChatGLM-6Bに始まり、商用版GLM-4GLM-5.3、そして2026年最新フラッグシップGLM-6に至るまで、同社はOpenAIやAnthropicとの性能差を着実に埋めてきました。

検索ボリューム上位のglm 6glm 5、そして伝統的なchatglmというキーワードは、費用対効果に優れたバイリンガルLLMへの高い注目度を示しています。現場のエンジニアや企業は、単なるパラメータ規模ではなく以下の3点を重視しています:

  1. 圧倒的なコストパフォーマンス($/1Mトークン):Claude 3.7 Sonnet / Opus 4.7やGPT-5.5と比較して桁違いに安いAPI費用。
  2. 日英中を跨ぐ正確なコード生成:多言語のドキュメントや仕様書が混在するリポジトリを完璧に理解する読解力。
  3. 低遅延(TTFT)と決定論的ツール呼び出し:CLI開発エージェントを快適に駆動するスループットと構造化JSON出力。

本記事では、GLM-6およびGLM-5.3のアーキテクチャ、LiveCodeBenchやSWE-benchにおける実測値、および運用コストを徹底解説します。


アーキテクチャ徹底比較:GLM-5.3とGLM-6

Zhipu AIがどのようにして世界水準のコーディング性能に到達したのか、内部トランスフォーマー構造を紐解きます。

+--------------------------------------------------------------------------------------------------------------------+
|                                        ZHIPU AI モデルアーキテクチャの変遷                                         |
+--------------------------------------------------------------------------------------------------------------------+
| 項目                       | ChatGLM-6B (2023 初期) | GLM-5.3 (2025/2026 改良版) | GLM-6 (2026 現行フラッグシップ) |
+----------------------------+------------------------+----------------------------+---------------------------------+
| 基本モデル構造             | 密結合自己回帰 (Dense) | スパースMoE                | スパースMoE + 非同期PRM検証     |
| 総パラメータ数 / 活性数    | 6.2B Dense             | 430B / 32B Active          | 680B / 48B Active               |
| アテンション機構           | 標準MHA                | Grouped-Query Attn (GQA)   | GQA + 潜在KVプロジェクション    |
| ネイティブコンテキスト長   | 2,048 tokens           | 128,000 tokens             | 256,000 tokens                  |
| トークナイザー語彙数       | 65,000 (SentencePiece) | 150,000 (GLM-BPE)          | 160,000 (GLM-UltraBPE)          |
| 中国語/英語トークン圧縮比  | ~1.85 tokens/word      | 1.32 tokens/word           | 1.24 tokens/word                |
| 推論時思考機構 (Test-Time) | 静的サンプリング       | 逐次 <think> タグ展開      | デュアルストリームCoT + 枝刈り  |
| ネイティブ精度サポート     | FP16 / INT4            | BF16 / FP8 TensorRT        | Native FP8 / NVFP4              |
+--------------------------------------------------------------------------------------------------------------------+

1. GLM-6におけるデュアルストリーム非同期CoT(思考プロセス検証)

従来のGLM-5では、...タグ内で直列に思考過程を生成していました。これに対しGLM-6では推論パイプラインを2つに分離しています:

  • 探索的生成ストリーム(Exploratory Generation):メインモデルが高速(約84トークン/秒)で解決手順やコードドラフトを生成。
  • 非同期プロセス検証(Process Reward Model):専用テンサーコア上で動作するPRMが、関数の入口やループ不変条件などの節目で論理整合性と型安全性を評価。
  • 動的バックトラック枝刈り:論理矛盾を検知した場合、直ちに[BACKTRACK: STEP_N]シグナルを発行し、誤った推論ブランチをユーザー返答前に破棄します。

2. GLM-UltraBPEトークナイザーの最適化

欧米製モデルはアジア圏の言語でトークンが膨らみやすく、コスト面で不利でした。GLM-6のGLM-UltraBPE(16万語彙)は、頻出ライブラリ構文(torch.distributedfastapi.middleware)を単一トークン化。プロンプト消費量を中国語で34%、英語で12%削減します。

3. KVキャッシュ圧縮と256k長文コンテキスト

RoPEのスケーリング($\theta = 5,000,000$)と低次元潜在空間へのKV投影により、NVIDIA H200 8基構成で128kトークンのエージェントセッションを最大64多重で並行稼働できます。


ベンチマーク対決:LiveCodeBench、SWE-benchおよび数学能力

2026年秋の標準環境下で、GLM-6およびGLM-5.3を世界の主要競合モデルと比較検証しました。

+-----------------------------------------------------------------------------------------------------------------------+
|                                  コーディング・推論ベンチマーク総合比較 (2026年9月)                                   |
+-----------------------------------------------------------------------------------------------------------------------+
| ベンチマーク               | 指標               | GLM-5.3 | GLM-6 | DeepSeek V4 | Claude 3.5 Sonnet | Claude Opus 4.7 |
+----------------------------+--------------------+---------+-------+-------------+-------------------+-----------------+
| LiveCodeBench v5 (Hard)    | Pass@1             | 52.8%   | 66.7% | 71.4%       | 64.2%             | 78.6%           |
| LiveCodeBench v5 (Overall) | Pass@1             | 68.4%   | 79.8% | 83.2%       | 78.9%             | 87.5%           |
| SWE-bench Verified         | 解決率 (Resolved)  | 44.5%   | 58.9% | 62.1%       | 54.8%             | 79.4%           |
| HumanEval+ (Python)        | Pass@1             | 88.2%   | 94.6% | 96.2%       | 93.7%             | 97.8%           |
| MBPP+ (Multi-lingual)      | Pass@1             | 84.1%   | 91.5% | 93.8%       | 90.2%             | 95.1%           |
| AIME 2026 (数学競技)       | 正答率 (Consensus) | 74.2%   | 88.5% | 93.6%       | 78.4%             | 95.4%           |
| MMLU-Pro (高難度学術)      | マクロ平均         | 76.1%   | 83.4% | 86.8%       | 82.5%             | 90.5%           |
| GPQA Diamond (博士レベル)  | 0-shot CoT         | 62.4%   | 73.1% | 78.9%       | 69.8%             | 83.2%           |
| Code Arena Elo             | 実実行対局         | 1,312   | 1,378 | 1,410       | 1,365             | 1,472           |
+-----------------------------------------------------------------------------------------------------------------------+

ベンチマーク詳細分析

  1. LiveCodeBench v5 (Hard難問群):GLM-6は66.7%をマークし、Claude 3.5 Sonnet(64.2%)を凌駕。非同期検証機構がエッジケースのバグを事前に排除します。
  2. SWE-bench Verified (実環境GitHub課題解決):GLM-6は58.9%の解決率を達成。不要なファイル変更を避け、パッチ適用成功率は94.2%に達します。
  3. AIME 2026 (数学オリンピック):Lean 4形式検証による強化学習を経て、GLM-6は88.5%を達成。GLM-5.3(74.2%)から14.3ポイントの大幅進化を遂げました。

推論速度・レイテンシ・スループット測定

+-------------------------------------------------------------------------------------------------------------+
|                                 推論スループットとレイテンシ測定結果 (FP8)                                  |
+-------------------------------------------------------------------------------------------------------------+
| モデル名                   | ハードウェア構成     | TTFT (1k Prompt) | 出力TPS (Tokens/秒) | 最大並行処理数 |
+----------------------------+----------------------+------------------+---------------------+----------------+
| Zhipu GLM-5.3              | 4x NVIDIA H800 / H20 | 280 ms           | 68 tps              | 48 並行        |
| Zhipu GLM-6                | 8x NVIDIA H200 (FP8) | 210 ms           | 84 tps              | 64 並行        |
| DeepSeek V4 (MTP-4)        | 8x NVIDIA H100 (FP8) | 195 ms           | 112 tps             | 64 並行        |
| Claude 3.5 Sonnet (Direct) | Anthropic Cloud      | 420 ms           | 72 tps              | マネージド     |
| Claude Opus 4.7 (Direct)   | Anthropic Cloud      | 890 ms           | 46 tps              | マネージド     |
| OpenAI GPT-5.5 (Direct)    | Azure Cloud          | 650 ms           | 58 tps              | マネージド     |
+-------------------------------------------------------------------------------------------------------------+

GLM-6は210 msの超低TTFT84 tpsの高出力を維持。開発者のCLIターミナル操作を妨げない軽快な応答性を実現しています。


コスト試算:API価格比較

+---------------------------------------------------------------------------------------------------------+
|                               API料金マトリクス (米ドル / 100万トークン)                                |
+---------------------------------------------------------------------------------------------------------+
| モデル                     | 入力料金 / 1M | キャッシュ読込 / 1M | 出力料金 / 1M | 10万行コード改修費用 |
+----------------------------+---------------+---------------------+---------------+----------------------+
| Zhipu GLM-5.3              | $0.35         | $0.08               | $1.10         | $0.18                |
| Zhipu GLM-6                | $0.80         | $0.18               | $2.40         | $0.42                |
| DeepSeek V4                | $0.27         | $0.07               | $1.10         | $0.19                |
| Claude 3.5 Sonnet          | $3.00         | $0.30               | $15.00        | $2.25                |
| Claude Opus 4.7            | $15.00        | $1.50               | $75.00        | $11.20               |
| OpenAI GPT-5.5 (Reasoning) | $10.00        | $2.50               | $40.00        | $6.80                |
+---------------------------------------------------------------------------------------------------------+

エンタープライズ開発における月間試算

月間10,000回の自動コードレビュー・テスト生成タスク(1回あたり入力40kトークン、出力3kトークン)を実施した場合:

  • Claude Opus 4.7: 約 $8,250 / 月
  • Claude 3.5 Sonnet: 約 $1,650 / 月
  • Zhipu GLM-6: わずか 約 $392 / 月

Sonnet比で76%減、Opus比で95%減という圧倒的低コストで運用可能です。


実装ガイド:Python SDK & Aider CLIでの活用法

Zhipu AIのAPIはOpenAI互換エンドポイント(open.bigmodel.cn/api/paas/v4/)を提供しています。

1. Python OpenAI SDKによる呼び出し

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("ZHIPU_API_KEY"),
    base_url="https://open.bigmodel.cn/api/paas/v4/"
)

response = client.chat.completions.create(
    model="glm-6",
    messages=[
        {"role": "system", "content": "あなたは高並行Rust開発のエキスパートです。"},
        {"role": "user", "content": "アトミック操作を用いたロックフリーのリングバッファを実装してください。"}
    ],
    temperature=0.1,
    extra_body={
        "thinking": {"mode": "enabled", "budget_tokens": 8192}
    }
)
print(response.choices[0].message.content)

2. Aider CLIの起動設定

export OPENAI_API_BASE="https://open.bigmodel.cn/api/paas/v4"
export OPENAI_API_KEY="your_zhipu_api_key"

aider --model openai/glm-6       --editor-model openai/glm-6       --weak-model openai/glm-5.3       --cache-prompts       --stream

結論とモデル選定の指針

  • GLM-6を選ぶべきケース:日英混在プロジェクト、大量のエージェントバッチ処理、高いアルゴリズム正答率と予算抑制を両立したい場合。
  • GLM-5.3を選ぶべきケース:コミットログ生成や初期トリアージなど、極限までコストを抑えたいタスク。
  • Claude Opus 4.7を選ぶべきケース:予算度外視で数百ファイル規模の大規模リポジトリ全体を完全自律リファクタリングする場合。

ChatGLMからGLM-6への進化は、Zhipu AIの卓越した技術力を証明しています。コストと品質の両立を追求する開発チームにとって、GLM-6は強力な選択肢です。

← 記事一覧へ
0 / 4