GLM vs Gemini 3.1 Pro:GLMモデルが優位な領域

GLM vs Gemini 3.1 Pro は当サイトで最も一方的な比較であり、しかもオープンウェイト側に傾いています。19の公表評価のうち GLM-5.2 が15項目を獲得し、コーディングと長時間タスクの項目はすべて制しています。Gemini 3.1 Pro の勝ちは、知識重視の推論ベンチマークという狭い帯に集中しています。

この構図は取り繕わずにそのまま述べる価値があります。両者は最適化している対象が異なるということです。すべての数値はモデル開発元が公表した結果をそのまま転載したもので、glmmodel.com はこれらの評価を実施していません。勝敗チップは公表値に対する算術です。

結論

GLM-5.2 が 19 項目中 15 勝Gemini 3.1 Pro が 4 勝

GLM-5.2 は Gemini 3.1 Pro を相手に公表19項目中15項目を獲得し、コーディングのブロックは完勝です。FrontierSWE Dominance が74.4 対 39.6、DeepSWE が46.2 対 10.0、ProgramBench が63.7 対 39.5、NL2Repo が48.9 対 33.4、SWE-bench Pro が62.1 対 54.2、Terminal-Bench 2.1 が81.0 対 74.0。Gemini 3.1 Pro の4勝は HLE(45.0 対 40.5)、GPQA-Diamond(94.3 対 91.2)、HMMT Nov. 2025 が0.4ポイント差、Tool-Decathlon が0.6ポイント差です。ソフトウェア開発が仕事なら公表データは明確にGLMモデルを指し、幅広い学術的知識が必要ならGemini に分があります。

GLM vs Gemini:スペック早見表

他のクローズドウェイトとの比較と同様、構造的な違いは所有権にあります。GLM-5.2 は1,000,000トークンのウィンドウと、標準的なオープン推論スタックで動く MIT ライセンスのウェイトを公表しています。Gemini 3.1 Pro はホスト型のプロプライエタリモデルで、その文脈上限は当サイトが依拠する公表比較対象の外にあるため、表では推定せずその旨を記載しています。

GLM vs Gemini:スペック早見表
項目GLM-5.2Gemini 3.1 Pro
文脈ウィンドウ1,000,000 トークン未公表
オープン性オープンウェイトクローズドAPI
ライセンスMIT ライセンスプロプライエタリ
推論強度の制御明示的 — Non-Thinking、High、Max暗黙的
セルフホスティング可 — transformers、vLLM、SGLang、xLLM、ktransformers不可 — ホスト型APIのみ

項目別比較:GLM vs Gemini 3.1 Pro

コーディングと長時間タスクのブロックには多くの説明は要りません。9項目すべてで GLM-5.2 が勝ち、いくつかは20ポイント以上の差です。推論とエージェントのブロックは本当に混戦です。Gemini は幅広い学術知識が問われる HLE と GPQA-Diamond でリードし、HMMT Nov. 2025 と Tool-Decathlon をコンマ数ポイント差で制します。GLM-5.2 は AIME 2026、HMMT Feb. 2026、CritPt、IMOAnswerBench、ツールありの HLE、MCP-Atlas のエージェントセットを取ります。この分かれ方は恣意的ではなく筋が通っています。幅広い事実知識を一度の応答で想起し適用させるベンチマークは Gemini 3.1 Pro に有利、計画し、実行し、ツール出力を読み、何ターンにもわたって修正させるベンチマークは GLM-5.2 に有利で、軌跡が長いほど差は広がります。勝ち数を合計するより、自分の仕事がこの2つの形のどちらに近いかを見極めるほうがずっと有用です。

項目別比較:GLM vs Gemini 3.1 Pro
ベンチマークGLM-5.2Gemini 3.1 Pro勝者
コーディングと長時間タスク
FrontierSWE Dominance74.439.6GLM-5.2
PostTrainBench34.321.6GLM-5.2
SWE-Marathon13.04.0GLM-5.2
SWE-bench Pro62.154.2GLM-5.2
NL2Repo48.933.4GLM-5.2
ProgramBench63.739.5GLM-5.2
DeepSWE46.210.0GLM-5.2
Terminal-Bench 2.1 (Terminus-2)81.074.0GLM-5.2
Terminal-Bench 2.1 (best harness)82.770.7GLM-5.2
推論とエージェント
MCP-Atlas (public set)76.869.2GLM-5.2
Tool-Decathlon48.248.8Gemini 3.1 Pro
HLE40.545.0Gemini 3.1 Pro
HLE w/ Tools54.751.4GLM-5.2
AIME 202699.298.2GLM-5.2
HMMT Nov. 202594.494.8Gemini 3.1 Pro
HMMT Feb. 202692.587.3GLM-5.2
CritPt20.917.7GLM-5.2
IMOAnswerBench91.081.0GLM-5.2
GPQA-Diamond91.294.3Gemini 3.1 Pro

* フルセットでのスコア。

このページの数値はすべてモデル開発元が公表した結果です。glmmodel.com はそれを掲載しているだけで、これらの評価を自ら実施してはいません。

17件のGLMベンチマークをすべて詳しく見る →

どちらを選ぶべきか

GLM-5.2 を選ぶべきとき

この公表データでは、ソフトウェア開発は僅差の話ではありません。コーディングと長時間タスクの項目はすべて、しかも多くは大差でGLMモデルが取り、さらに1,000,000トークンの文脈ウィンドウとオープンウェイトが加わります。エージェント用途でも MCP-Atlas 公開セットを76.8 対 69.2 でリードしています。

  • ワークロードがコーディング、デバッグ、エージェント型エンジニアリングである(このブロックの公表項目はすべて GLM-5.2 の勝ち)。
  • 長時間の能力が必要。FrontierSWE Dominance の74.4 対 39.6 は、ハーネスの違いで説明できる差ではありません。
  • MIT のオープンウェイトと、自社インフラ内でモデルを配信できることが必要。
  • 実測で探るしかない非公表の上限ではなく、公表された1,000,000トークンのウィンドウが欲しい。

Gemini 3.1 Pro を選ぶべきとき

Gemini 3.1 Pro の優位は本物ですが、範囲は狭いものです。HLE で45.0 対 40.5、GPQA-Diamond で94.3 対 91.2 とリードしており、いずれも長い軌跡での実行力ではなく、幅広い大学院レベルの事実知識を評価するベンチマークです。それを求めているなら、この表ではより強いモデルです。

  • 仕事がソフトウェア開発ではなく、知識重視の質問応答である。
  • この2モデルの中で最強の GPQA-Diamond と HLE の公表結果が必要。
  • すでにマネージドAPIに移行済みで、推論インフラを運用したくない。
  • 連携がモデルのウェイトそのものより、周辺のホスト型プラットフォームに依存している。

トップページの無料AIプレイグラウンドを試す →

GLM vs Gemini のよくある質問

GLM-5.2 は Gemini 3.1 Pro に勝っていますか?
公表データ上は勝っています。GLM-5.2 が19項目中15項目を獲得。Gemini 3.1 Pro が勝つのは HLE、GPQA-Diamond、HMMT Nov. 2025、Tool-Decathlon の4項目で、うち後者2つは1ポイントを大きく下回る差です。
コーディングでは GLM と Gemini のどちらが優れていますか?
GLM-5.2 が公表されたコーディングと長時間タスクの項目をすべて制しており、いくつかは20ポイント以上の差です。DeepSWE が46.2 対 10.0、ProgramBench が63.7 対 39.5、FrontierSWE Dominance が74.4 対 39.6。この証拠に照らせば接戦ではありません。
Gemini 3.1 Pro が今もリードしているのはどこですか?
知識重視の推論です。HLE では GLM-5.2 の40.5 に対して45.0、GPQA-Diamond では91.2 に対して94.3 を記録しています。これらは持続的な実行ではなく幅広い学術的知識の想起を評価するもので、明確に別種の能力です。
Gemini 3.1 Pro はオープンソースですか?
いいえ。Gemini 3.1 Pro はプロプライエタリなホスト型モデルです。GLM-5.2 は MIT ライセンスのオープンウェイトGLMモデルで、ウェイトは HuggingFace と ModelScope にあり、ダウンロード、ファインチューニング、自前ハードウェアでの配信が可能です。
決める前にここでモデルを試せますか?
はい。トップページには登録不要でオープンソースLLMからストリーミングする無料AIプレイグラウンドがあります。GLM-5.2 ではなく、GLMのウェイトも使っていません。公表された比較を読みながら稼働中のモデルを試せるように置いてあります。

稼働中のAIモデルを無料で試す — アカウント不要

GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。