GLM vs Qwen3.7-Max は、最も強力なオープンウェイトのリリース同士をぶつける比較であり、結果は DeepSeek との比較より接戦です。両者にスコアがある13の公表評価では GLM-5.2 が10項目、Qwen3.7-Max が3項目を取ります。ただし Qwen の3項目はすべて数学と知識重視の推論なので、分かれ方は理解しやすいものです。
ここでの数値はすべて、各モデルについてモデル開発元が公表した結果を調整なしで転載したものです。当サイトは評価を実施しませんし、開発元が公表していない項目にスコアを外挿することもありません。そのためこの比較にはいくつかのベンチマークが単に登場しません。
GLM-5.2 は13項目中10項目を取り、その中にはコーディングの全項目が含まれます。SWE-bench Pro が62.1 対 60.6、NL2Repo が48.9 対 47.2、Terminal-Bench 2.1 が81.0 対 75.0、そしてこのページ最大の差である DeepSWE が46.2 対 18.0 です。Qwen3.7-Max は HLE を41.4 対 40.5、HMMT Nov. 2025 を95.0 対 94.4、HMMT Feb. 2026 を97.1 対 92.5 で獲得しています。うち2つは1ポイント未満の差です。正直に読むなら、知識と数学では両者はほぼ互角であり、タスクが長くエージェント寄りになるほど GLM-5.2 が引き離す、ということになります。
どちらもオープンウェイトの世界にあるため、意味のある構造的な差はライセンス思想ではなく文脈と制御にあります。GLM-5.2 は1,000,000トークンのウィンドウと3つの明示的な推論強度を公表していますが、Qwen3.7-Max の公表比較対象にはどちらの数値も含まれていないため、この表では推測で埋めずその旨を記載しています。
| 項目 | GLM-5.2 | Qwen3.7-Max |
|---|---|---|
| 文脈ウィンドウ | 1,000,000 トークン | 未公表 |
| オープン性 | オープンウェイト | オープンウェイト系 |
| ライセンス | MIT ライセンス | ベンダーのリリース条件を参照 |
| 推論強度の制御 | 明示的 — Non-Thinking、High、Max | 未公表 |
| セルフホスティング | 可 — transformers、vLLM、SGLang、xLLM、ktransformers | ベンダー依存 |
コーディングのブロックは GLM-5.2 の完勝ですが、4項目中3項目は差が小さく、SWE-bench Pro と NL2Repo は1〜2ポイントです。例外は DeepSWE の46.2 対 18.0 で、測定ノイズではなく長時間実行の実力差を示すのに十分な開きです。推論のブロックでは多くの項目で1ポイント以内の応酬になりますが、CritPt(20.9 対 13.4)と AIME 2026(99.2 対 97.0)では GLM-5.2 が明確に上です。ここで勝ち数を数えると差を過大評価してしまいます。1ポイント未満で決まった項目をすべて除くと、意味のある結果は3つに絞られます。DeepSWE と CritPt が GLM-5.2、HMMT Feb. 2026 が Qwen3.7-Max です。うち2つは持続的な実行を、1つは数学的な深さを評価するもので、スコアボードではなく日々の実務でこの2つのオープンウェイトモデルがどう違うかを、これがよく要約しています。
| ベンチマーク | GLM-5.2 | Qwen3.7-Max | 勝者 |
|---|---|---|---|
| コーディングと長時間タスク | |||
| SWE-bench Pro | 62.1 | 60.6 | GLM-5.2 |
| NL2Repo | 48.9 | 47.2 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 75.0 | GLM-5.2 |
| 推論とエージェント | |||
| MCP-Atlas (public set) | 76.8 | 76.4 | GLM-5.2 |
| HLE | 40.5 | 41.4 | Qwen3.7-Max |
| HLE w/ Tools | 54.7 | 53.5 | GLM-5.2 |
| CritPt | 20.9 | 13.4 | GLM-5.2 |
| AIME 2026 | 99.2 | 97.0 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 95.0 | Qwen3.7-Max |
| HMMT Feb. 2026 | 92.5 | 97.1 | Qwen3.7-Max |
| IMOAnswerBench | 91.0 | 90.0 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 90.0 | GLM-5.2 |
* フルセットでのスコア。
このページの数値はすべてモデル開発元が公表した結果です。glmmodel.com はそれを掲載しているだけで、これらの評価を自ら実施してはいません。
17件のGLMベンチマークをすべて詳しく見る →タスクに長さがあるならGLMモデルを選んでください。ここでのコーディングの勝ちは、範囲の限られた問題では僅差、DeepSWE では圧倒的です。これは、1,000,000トークンのウィンドウを背景に長いコーディングエージェント軌跡で学習されたモデルに期待される通りのパターンです。
この表では、数学と幅広い知識について Qwen3.7-Max のほうが強いモデルです。HMMT Feb. 2026 の97.1 は本物のリードであり、HLE と HMMT Nov. 2025 でもコンマ数ポイント GLM-5.2 を上回ります。難しく自己完結した問いが中心のワークロードなら、有力なオープンウェイトの選択肢です。
GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。