GLM vs Qwen3.7-Max:オープンモデルのベンチマーク比較

GLM vs Qwen3.7-Max は、最も強力なオープンウェイトのリリース同士をぶつける比較であり、結果は DeepSeek との比較より接戦です。両者にスコアがある13の公表評価では GLM-5.2 が10項目、Qwen3.7-Max が3項目を取ります。ただし Qwen の3項目はすべて数学と知識重視の推論なので、分かれ方は理解しやすいものです。

ここでの数値はすべて、各モデルについてモデル開発元が公表した結果を調整なしで転載したものです。当サイトは評価を実施しませんし、開発元が公表していない項目にスコアを外挿することもありません。そのためこの比較にはいくつかのベンチマークが単に登場しません。

結論

GLM-5.2 が 13 項目中 10 勝Qwen3.7-Max が 3 勝

GLM-5.2 は13項目中10項目を取り、その中にはコーディングの全項目が含まれます。SWE-bench Pro が62.1 対 60.6、NL2Repo が48.9 対 47.2、Terminal-Bench 2.1 が81.0 対 75.0、そしてこのページ最大の差である DeepSWE が46.2 対 18.0 です。Qwen3.7-Max は HLE を41.4 対 40.5、HMMT Nov. 2025 を95.0 対 94.4、HMMT Feb. 2026 を97.1 対 92.5 で獲得しています。うち2つは1ポイント未満の差です。正直に読むなら、知識と数学では両者はほぼ互角であり、タスクが長くエージェント寄りになるほど GLM-5.2 が引き離す、ということになります。

GLM vs Qwen:スペック早見表

どちらもオープンウェイトの世界にあるため、意味のある構造的な差はライセンス思想ではなく文脈と制御にあります。GLM-5.2 は1,000,000トークンのウィンドウと3つの明示的な推論強度を公表していますが、Qwen3.7-Max の公表比較対象にはどちらの数値も含まれていないため、この表では推測で埋めずその旨を記載しています。

GLM vs Qwen:スペック早見表
項目GLM-5.2Qwen3.7-Max
文脈ウィンドウ1,000,000 トークン未公表
オープン性オープンウェイトオープンウェイト系
ライセンスMIT ライセンスベンダーのリリース条件を参照
推論強度の制御明示的 — Non-Thinking、High、Max未公表
セルフホスティング可 — transformers、vLLM、SGLang、xLLM、ktransformersベンダー依存

項目別比較:GLM vs Qwen3.7-Max

コーディングのブロックは GLM-5.2 の完勝ですが、4項目中3項目は差が小さく、SWE-bench Pro と NL2Repo は1〜2ポイントです。例外は DeepSWE の46.2 対 18.0 で、測定ノイズではなく長時間実行の実力差を示すのに十分な開きです。推論のブロックでは多くの項目で1ポイント以内の応酬になりますが、CritPt(20.9 対 13.4)と AIME 2026(99.2 対 97.0)では GLM-5.2 が明確に上です。ここで勝ち数を数えると差を過大評価してしまいます。1ポイント未満で決まった項目をすべて除くと、意味のある結果は3つに絞られます。DeepSWE と CritPt が GLM-5.2、HMMT Feb. 2026 が Qwen3.7-Max です。うち2つは持続的な実行を、1つは数学的な深さを評価するもので、スコアボードではなく日々の実務でこの2つのオープンウェイトモデルがどう違うかを、これがよく要約しています。

項目別比較:GLM vs Qwen3.7-Max
ベンチマークGLM-5.2Qwen3.7-Max勝者
コーディングと長時間タスク
SWE-bench Pro62.160.6GLM-5.2
NL2Repo48.947.2GLM-5.2
DeepSWE46.218.0GLM-5.2
Terminal-Bench 2.1 (Terminus-2)81.075.0GLM-5.2
推論とエージェント
MCP-Atlas (public set)76.876.4GLM-5.2
HLE40.541.4Qwen3.7-Max
HLE w/ Tools54.753.5GLM-5.2
CritPt20.913.4GLM-5.2
AIME 202699.297.0GLM-5.2
HMMT Nov. 202594.495.0Qwen3.7-Max
HMMT Feb. 202692.597.1Qwen3.7-Max
IMOAnswerBench91.090.0GLM-5.2
GPQA-Diamond91.290.0GLM-5.2

* フルセットでのスコア。

このページの数値はすべてモデル開発元が公表した結果です。glmmodel.com はそれを掲載しているだけで、これらの評価を自ら実施してはいません。

17件のGLMベンチマークをすべて詳しく見る →

どちらを選ぶべきか

GLM-5.2 を選ぶべきとき

タスクに長さがあるならGLMモデルを選んでください。ここでのコーディングの勝ちは、範囲の限られた問題では僅差、DeepSWE では圧倒的です。これは、1,000,000トークンのウィンドウを背景に長いコーディングエージェント軌跡で学習されたモデルに期待される通りのパターンです。

  • コーディングエージェントを動かしている(このページの公表コーディング4項目はすべて GLM-5.2 の勝ち)。
  • 長時間の実行が重要である。DeepSWE の差は46.2 対 18.0 です。
  • 明記された1,000,000トークンの文脈ウィンドウと、Non-Thinking、High、Max の明示的な推論強度が必要。
  • 地域制限のない MIT ライセンスと、HuggingFace および ModelScope 上のウェイトが欲しい。

Qwen3.7-Max を選ぶべきとき

この表では、数学と幅広い知識について Qwen3.7-Max のほうが強いモデルです。HMMT Feb. 2026 の97.1 は本物のリードであり、HLE と HMMT Nov. 2025 でもコンマ数ポイント GLM-5.2 を上回ります。難しく自己完結した問いが中心のワークロードなら、有力なオープンウェイトの選択肢です。

  • 競技数学が評価の中心である(HMMT Feb. 2026 は97.1 対 92.5)。
  • この2モデル中で最強の HLE の結果(41.4 対 40.5)が欲しい。
  • タスクが長いエージェント軌跡ではなく、範囲の限られた問いである。
  • すでに Qwen のウェイトを運用しており、ここでのコーディングの差は移行を正当化するには小さすぎる。

トップページの無料AIプレイグラウンドを試す →

GLM vs Qwen のよくある質問

GLM-5.2 は Qwen3.7-Max に勝っていますか?
公表13項目のうち10項目では勝っています。Qwen3.7-Max は HLE、HMMT Nov. 2025、HMMT Feb. 2026 を取り、うち2つは1ポイント未満の差です。GLM-5.2 はコーディング全項目と、残るエージェント・推論の比較を制しています。
数学ではどちらのモデルが優れていますか?
HMMT では Qwen3.7-Max、AIME では GLM-5.2 です。Qwen は HMMT Feb. 2026 で92.5 に対し97.1 を記録し、HMMT Nov. 2025 でも0.6ポイント上回ります。一方 GLM-5.2 は AIME 2026 を99.2 対 97.0、IMOAnswerBench を91.0 対 90.0 でリードします。
コーディングでは GLM と Qwen のどちらが優れていますか?
GLM-5.2 が公表されたコーディング4項目すべてを取りますが、うち3項目は僅差です。例外は DeepSWE の46.2 対 18.0 で、これは長時間評価であり、タスクが長くなるほど両者が乖離することを最も明確に示しています。
どちらもオープンウェイトですか?
どちらもホスト専用APIではなくオープンウェイトのリリースです。GLM-5.2 の条件はここに明記しています。MIT ライセンス、HuggingFace と ModelScope で公開、地域制限なし。Qwen の正確なライセンス条件は、ベンダー自身のリリースノートをご確認ください。
このサイトでオープンモデルを試せますか?
はい。トップページのプレイグラウンドは、アカウント不要で OpenRouter 経由の無料オープンソースLLMを動かしています。GLM-5.2 ではなく、GLMのウェイトも使っていません。公表ベンチマークを読みながら稼働中のモデルを試せるように置いてあります。

稼働中のAIモデルを無料で試す — アカウント不要

GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。