GLMモデルはローカルで実行できます。ウェイトが申請フォームやホスト型エンドポイントの陰に隠されず、本当に公開されているからです。このページでは、ローカル配備が成功するかどうかを決める4点を扱います。適用されるライセンス、ウェイトの所在、対応する配信フレームワーク、そしてパラメータ数だけでなく実際に必要な文脈長に合わせたハードウェアの見積りです。個々は難しくありませんが、4つを同時に正しく押さえられるかどうかが、動く配備と週末まるごとのデバッグを分けます。
取り組む理由は単純です。自前のハードウェアで動くオープンソースのGLMモデルは、すべてのプロンプトを自社ネットワーク内にとどめ、勝手に廃止されることがなく、第三者には決して渡さないデータでファインチューニングできます。ホスト型モデルのスコアが数ポイント高くても、チームがオープンウェイトを選ぶのはこうした性質のためです。
中核となるGLMモデルのウェイトは、地域制限のない MIT ライセンスで公開されています。MIT はソフトウェアライセンスとしてほぼ最大限に寛容です。利用、改変、再配布、商用配備が可能で、必要なのは著作権表示だけ、保証はありません。ライセンスが本来与える権利を狭める別途の利用規定もなければ、どこで配信してよいかを定める地理条項もありません。
これは通常のソフトウェアよりモデルにおいて重要です。名目上オープンなリリースの多くには、本番配備を法的にあいまいにする付則が付いているからです。ダウンロードした特定のチェックポイントに同梱されたライセンスファイルを必ず確認してください。それが正式な文面であり、読むのに30秒もかかりません。
ウェイトは HuggingFace と ModelScope に公開されています。どちらもアダプタや部分公開ではなく完全なチェックポイントをホストしているため、いずれのプラットフォームの標準ツールでも取得できます。ロールアウト前に自社のアーティファクトストアへミラーしておくのは良い習慣です。コンテナイメージと同じ理由で、スケールアップする瞬間に外部ホストへ到達できるかどうかに配備を依存させるべきではありません。
モデル開発元は5つの推論スタックへの対応を挙げており、これらを合わせればワークステーション1台からマルチノードのクラスタまで、ローカル配備のほぼすべての形をカバーできます。
リファレンス実装。本番配信としては最も遅いものの、より速いスタックに投資する前にチェックポイントが正しく読み込まれ生成できるかを確認する最も簡単な方法です。デバッグはここから始めましょう。
通常の本番の既定値。ページドアテンションと継続バッチングにより同時負荷に強く、ダウンロードしたチェックポイントから自前ハードウェア上の OpenAI 互換エンドポイントまで最短で到達できます。
構造化生成とプレフィックスの大量再利用に最適化。多数のリクエストが長いシステムプロンプトや共通の文書プレフィックスを共有する場合に有力で、それはまさに大半のエージェントワークロードの形です。
モデル開発元が挙げるもう1つの対応配信経路。その配備特性が他の選択肢より自社インフラに合う場合に有用です。
CPU と GPU を組み合わせた異種混在の推論を狙っており、制約のあるハードウェアで興味深い選択肢になります。モデルの一部をシステムメモリへオフロードし、本来なら載らない大きなモデルをそのマシンで使えるようにできます。
ローカル配備で最もよくある間違いは、ウェイトのメモリだけを見積もり、KV キャッシュを忘れることです。パラメータ数は下限を決めますが、キャッシュは文脈長と同時実行数に比例して増え、長文脈では支配的になります。これはモデル開発元がフラッグシップを配信する際にぶつかったのと同じ壁です。数十万トークンを超えると、ボトルネックは計算ではなくキャッシュ容量、カーネル効率、CPU オーバーヘッドになります。
実務上の帰結は、モデルの最大値ではなく実際の文脈長の分布に合わせて設計すべきだということです。GLM-5.2 を128Kのウィンドウで動かすのと、フルの100万で動かすのとでは、ハードウェアの要件はまったく別物ですし、多くのワークロードは上限に近づくことすらありません。ハードウェアが逼迫しているなら、軽量な GLM-4.7-Flash と GLM-4.5-Air のティア、あるいは200K文脈の GLM-5.1 が、フラッグシップの入らない場所に収まります。
モデルをマシンに合わせてください。ワークステーションのアクセラレータ1枚なら、30B の GLM-4.7-Flash か GLM-4.5-Air が現実的な選択肢で、分類、抽出、要約、日常的なコード修正には十分に有能です。本格的なマルチGPUノードなら、GLM-5.1 がフラッグシップよりはるかに小さいキャッシュコストで200,000トークンのウィンドウを提供します。クラスタなら、GLM-5.2 がフルの100万トークン文脈、明示的な推論強度、そしてファミリー最強の公表ベンチマーク列をもたらします。生成ではなく音声認識なら、GLM-ASR が同じライセンスの下で文字起こしの段階を担います。
このページの数値はすべてモデル開発元が公表した結果です。glmmodel.com はそれを掲載しているだけで、これらの評価を自ら実施してはいません。
GLMモデルのベンチマークを読んだら、実際のモデルを動かしてみてください。上のプレイグラウンドは無料で、何の登録も必要ありません。より本格的なAIツールが必要なら、パートナーの無料プランをどうぞ。