GLM-5-Turbo は、長い連鎖のエージェント作業に特化して調整された5シリーズのGLMモデルです。計画が繰り返し修正され、ツールが予期せぬ出力を返し、それでも数十から数百ターンにわたって実行可能であり続けなければならない軌跡が対象です。GLM-5 のベースを、単発の回答ではなくこの動的なパターンに最適化しています。
長い連鎖の実行は、素の推論品質とは別の問題です。難しい単問には見事に答えられるモデルでも、すでに試したことを見失い、制約をひそかに落とし、途中で目標を言い換えてしまえば、50ターンで破綻します。GLM-5-Turbo が存在するのは、その失敗モードこそが本番のエージェントを実際に止めるものだからであり、この特性は5シリーズから GLM-5.1 と GLM-5.2 へ受け継がれています。
登録もアカウントもクレジットも不要。プロンプトを入力すれば、その場で回答がストリーミングされます。
ここに回答がストリーミングされます...
このプレイグラウンドは OpenRouter 経由で無料のオープンソースLLMを実行しています。GLM-5.2 ではなく、GLMのウェイトも使用していません。以下に掲載したGLMの公表ベンチマークを読みながら、稼働中のモデルを実際に試せるように用意したものです。
長い連鎖のエージェントシナリオとは、モデルがタスクを受け取って答えを返すのではなく、目標を受け取り、ツールを呼び、予測できなかった結果を読み、計画を修正し、それを繰り返すものです。失敗の形は具体的です。すでに失敗した行動を繰り返す、40ターン前に述べられた制約を見失う、ハーネスが実際には実行できない計画ステップを出す、といったものです。このパターンに向けた調整とは、ターン単位の流暢さではなく軌跡単位の挙動を最適化すること、つまり目標を安定させ、ツール呼び出しを正しい形式に保ち、想定外の結果からやり直さずに立て直すことを意味します。GLM-5-Turbo はその性質を中心に作られており、同じ設計思想は、まったく同じ理由で長いコーディングエージェント軌跡を学習した100万トークン文脈のフラッグシップにも貫かれています。
公表された比較表がカバーするのは GLM-5.2 と GLM-5.1 です。以下の列は GLM-5.1 のもので、GLM-5 世代に最も近い公表参照点になります。GLM-5-Turbo 自体のベンチマーク列は公表されていません。
GLM-5-Turbo の公表行はないため、当サイトも数値を掲載しません。参照列から読み取れるのは、その周辺世代がエージェント評価でどこに着地したかです。GLM-5.1 は MCP-Atlas 公開セットで71.8、Tool-Decathlon で40.7、GLM-5.2 はそれぞれ76.8 と48.2 です。エージェントのツール利用は Turbo が調整対象とした領域に最も近いベンチマーク群であり、フラッグシップが最も一貫して改善した領域の1つでもあります。
MCP-Atlas 公開セットでの比較。モデル開発元の公表値です。
MCP-Atlas は長い連鎖のツール挙動に最も近い公表指標であり、競争は僅差です。Claude Opus 4.8 が77.8、GLM-5.2 が76.8、GPT-5.5 が75.3、GLM-5.1 が71.8、Gemini 3.1 Pro が69.2。エージェントのツール利用でクローズドなフロンティアとの差が1ポイントというのは、標準的なコーディング項目で見られる10ポイント差とはまったく異なる図であり、エージェントハーネスの中でオープンウェイトのGLMモデルを動かす最も強い論拠になります。
GLM-5-Turbo は GLM-5 の後継というより兄弟にあたり、どちらも GLM-5.1、次いで GLM-5.2 に置き換えられました。長い連鎖のエージェント実行がワークロードなら、フラッグシップは Turbo の設計目的をすべて受け継いだうえで100万トークンのウィンドウと明示的な推論強度を加えているため、今日構築するならそちらが選択肢です。
GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。