GLM ベンチマーク:GLM-5.2 の全17評価結果

公表されたGLMベンチマークの全体を1ページにまとめました。8モデル×17評価で、推論、コーディング、エージェントのツール利用に加え、第三者が実施した3つの長時間評価を含みます。このページの内容はすべて、モデル開発元または評価を実施した組織が公表した結果です。glmmodel.com はこれらの数値を掲載しているだけで、自ら実施してはいません。

この区別は形式的な免責のためではありません。ベンチマークのスコアは驚くほどハーネスに依存します。同じモデルの同じ評価でも、Terminus-2 と Claude Code では数ポイント動きます。そのため、ページ下部の方法論のセクションは表そのものより有用かもしれません。数値は、明示された条件下で報告された能力として読み、自分のワークロードへの約束とは考えないでください。

3つの長時間GLMベンチマーク

このページの数値はすべてモデル開発元が公表した結果です。glmmodel.com はそれを掲載しているだけで、これらの評価を自ら実施してはいません。

74.4%
FrontierSWE

Dominance、最長20時間のタスク

オープンソース首位
34.3%
PostTrainBench

H100 1枚で最長10時間

総合2位
13.0%
SWE-Marathon

超長時間のソフトウェア開発、最長10時間

Opus シリーズに次ぐ2位

長時間タスクの3点セットこそ、現行世代のGLMモデルが目指した領域であり、いずれもモデル開発元ではなく外部組織が実施しました。FrontierSWE は最長20時間のタスクにおける優位を測り、PostTrainBench は H100 1枚で最長10時間、SWE-Marathon は同じく最長10時間の超長時間ソフトウェア開発です。GLM-5.2 は3つすべてでオープンソース首位です。FrontierSWE では Claude Opus 4.8 に0.7ポイント届かないものの、GPT-5.5 を1.8ポイント、前世代の Opus 4.7 を11ポイント以上上回っています。

世代間のGLMベンチマーク向上

GLM-5.2 を GLM-5.1 と比べれば1世代分の成果だけを切り出せ、両者を各項目の最強クローズドモデルと比べれば残る距離が分かります。以下の差分チップは、公表された GLM-5.2 のスコアから GLM-5.1 のスコアを引いた値です。その不均一さに注目してください。SWE-bench Pro が3.7ポイントなのに対し、DeepSWE は28.2ポイントです。持続的な実行を評価するベンチマークは、良いパッチ1つを評価するベンチマークよりはるかに大きく動きました。

Terminal-Bench 2.1+17.5
SWE-bench Pro+3.7
NL2Repo+6.2
DeepSWE+28.2 (2.6×)
ProgramBench+12.8
MCP-Atlas+5.0
Tool-Decathlon+7.5
HLE+9.5

8モデルにわたる全17のGLMベンチマーク

下の完全な表が決定版で、推論・コーディング・エージェントのセクションに分かれています。GLM-5.2 の列を強調表示しています。ダッシュは、そのモデルのそのベンチマークについてモデル開発元がスコアを公表していないことを意味し、当サイトは推定値でセルを埋めません。すべてのモデル列を見るには横にスクロールしてください。

全評価・全モデルにわたる、公表されたGLMモデルのベンチマーク結果
ベンチマークGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
推論
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
コーディング
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
エージェント
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* フルセットでのスコア。

公表されたGLMモデルのベンチマーク結果。8モデル×17評価。

これらのGLMベンチマークはどう評価されたか

以下の評価設定は、結果とともに公表されたものです。どの数値を引用するにせよ、事前に読む価値があります。文脈長、サンプリングパラメータ、ハーネスのバージョン、タイムアウト予算はいずれもスコアを大きく動かしますし、これらの評価のいくつかはモデル開発元ではなく第三者が実施しているためです。

HLE とその他の推論タスク

temperature 1.0、top-p 0.95 でサンプリングし、最大生成長は163,840トークン。既定ではテキストのみのサブセットを報告し、アスタリスク付きの結果はフルセットのものです。AIME、HMMT、IMOAnswerBench は回答形式を固定するシステムプロンプトを用い、判定モデルは GPT-5.5(medium)です。ツールありの HLE は300,000トークンの文脈を用い、文脈管理の工夫は行いません。

SWE-bench Pro

OpenHands 上で専用の指示プロンプトを用いて実行。temperature 1、top-p 1、新規トークン上限32K、文脈ウィンドウ400Kです。

NL2Repo

temperature 1.0、top-p 1.0、新規トークン上限48K、文脈400K で評価。無許可のパッケージインストールやネットワーク通信といった悪意ある挙動を遮断するため、ルールベースとLLMベースの判定を適用しています。

DeepSWE

公式の評価フレームワークと mini-swe-agent ハーネスを用い、temperature 1.0、top-p 1.0、2時間のタイムアウト、文脈400K で実行。各タスクは CPU 2コア、RAM 8GB、インターネット接続なしの隔離コンテナで動作します。

ProgramBench

200インスタンスを Claude Code 2.1.156 で評価。temperature 1.0、top-p 1.0、64,000トークン上限、最大2,000ターン、1サンプルあたり6時間のタイムアウト、推論強度は最大、文脈400K です。各インスタンスは CPU 4コア、8GB のサンドボックスで動作し、インターネット接続は無効です。

Terminal-Bench 2.1(Terminus-2)

Terminus-2 フレームワークで JSON パースを用い、4時間のタイムアウト、temperature 1.0、top-p 1.0、新規トークン上限48K、最大500エピソード、文脈ウィンドウ256K で評価。リソースは CPU 4コア、RAM 8GB に制限されています。

Terminal-Bench 2.1(Claude Code)

Claude Code 2.1.167 上で temperature 1.0、top-p 0.95、新規トークン131,072 で評価。CLI の64K出力上限は透過プロキシで回避しています。実時間の制限は解除しつつ、タスクごとの CPU とメモリの制約は維持。スコアは5回の実行の平均です。

MCP-Atlas

全モデルを thinking モードで、500タスクの公開サブセットに対し1タスクあたり10分のタイムアウトで評価。判定モデルは Gemini-3.0-Pro です。

Tool-Decathlon

公式の評価サービスを通じ、最大トークン予算を128K に設定して実行しています。

FrontierSWE

モデル開発元ではなく Proximal が実施。文脈長100万トークン、推論強度は最大、最大出力トークンは128K。Dominance スコアは2026年6月16日時点のものです。

PostTrainBench

モデル開発元ではなく PostTrainBench が実施。文脈長100万トークン、推論強度は最大、最大出力トークンは128K です。

SWE-Marathon

モデル開発元ではなく Abundant AI が実施。文脈長100万トークン、推論強度は最大、最大出力トークンは128K です。

GLM ベンチマークのよくある質問

GLM-5.2 のベンチマークスコアは?
公表された主要な数値は、Terminal-Bench 2.1 で81.0、SWE-bench Pro で62.1、FrontierSWE Dominance で74.4、PostTrainBench で34.3、DeepSWE で46.2、MCP-Atlas 公開セットで76.8、AIME 2026 で99.2 です。3つの長時間評価すべてでオープンソース首位です。
これらのGLMベンチマークは誰が実施しましたか?
大半はモデル開発元が実施し、設定を公表しています。3つの長時間評価は第三者によるもので、FrontierSWE は Proximal、PostTrainBench は PostTrainBench、SWE-Marathon は Abundant AI が実施しました。glmmodel.com はいずれも実施しておらず、すべて公表値として掲載しています。
なぜ Terminal-Bench 2.1 には2つのスコアがあるのですか?
ハーネスが結果を変えるからです。Terminus-2 では GLM-5.2 が81.0、Claude Opus 4.8 が85.0。Claude Code では GLM-5.2 が82.7、Opus 4.8 が78.9。同じベンチマークで勝者が逆転します。だからこそ数値には必ずハーネスを併記すべきなのです。
表の一部のセルが空欄なのはなぜですか?
ダッシュは、そのモデルのそのベンチマークについてスコアが公表されていないことを意味します。当サイトは欠落セルを推定・補間・推測で埋めません。比較表における捏造された数値は、正直な空欄より悪いからです。
これらのGLMベンチマーク結果を再現できますか?
公表された設定に合わせれば可能性はあります。文脈長、サンプリングパラメータ、ハーネスのバージョン、タイムアウト、リソース制限はいずれも上の方法論セクションに記載されています。それでも変動は見込んでください。単一実行はノイズが大きいため、複数回の平均を取っている評価もあります。

稼働中のAIモデルを無料で試す — アカウント不要

GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。