室谷代表取締役GLM-5.3(ジーエルエム・ファイブ・スリー)は、Z.aiが2026年10月5日にAmazon Bedrockでの提供を開始したフラッグシップのオープンウェイト・テキスト生成モデルで、複雑なソフトウェアエンジニアリングとエージェントタスクに使えるモデルなんですよね。Z.ai公式が「GLM-5.3 is now available on Amazon Bedrock」と発表しました。
テキトー教師DotAI 認定講師これは単に「また1モデル増えた」という話じゃないんですよ。BedrockはAWSのマネージドサービスなので、企業が自前でインフラを組まなくてもAPI経由でモデルを業務システムに組み込める。
そこにZ.aiの最新フラッグシップが入ったというのがポイントです。
そこにZ.aiの最新フラッグシップが入ったというのがポイントです。
室谷代表取締役そうなんですよね。しかもBedrockのZ.AI欄にはGLM 4.7、GLM 4.7 Flash、GLM 5、そして今回のGLM 5.3が並ぶ形になっていて、Z.aiのラインナップが着実に厚くなってきているのが分かります。
テキトー教師DotAI 認定講師講座でも「オープンウェイトのモデルを業務で使いたい」という受講生さんが増えているので、これはタイムリーな話題です。
GLM-5.3とは?Z.aiがAmazon Bedrockで提供開始した最新モデルの正体
GLM-5.3の基本情報
提供元
Z.ai(Amazon Bedrockでの提供開始日は2026年10月5日)
位置づけ
フラッグシップのオープンウェイト・テキスト生成モデル。複雑なソフトウェアエンジニアリングとエージェントタスク向け
アーキテクチャ
Mixture-of-Experts(MoE)。総パラメータ744B、トークンあたり約40Bを活性化
ベースモデル
GLM 5.2と同一。性能向上はすべてpost-training(追加学習)のスケーリングによるもの
コンテキストウィンドウ
1Mトークン、最大出力128Kトークン
室谷代表取締役まず正体から整理すると、GLM 5.3はZ.AIのフラッグシップのオープンウェイト・テキスト生成モデルで、複雑なソフトウェアエンジニアリングとエージェントタスク向けに作られています。Mixture-of-Experts(MoE)アーキテクチャを採用していて、総パラメータ744B、トークンあたり約40Bを活性化する構成です。
テキトー教師DotAI 認定講師ここで大事なのが「GLM 5.2と同じベースモデルを使っている」という点なんですよ。Z.aiのブログでも「Scaling post-training is all we did for GLM-5.3」と明言されていて、性能向上はすべてpost-training(追加学習)の拡大から来ている。
ベースを差し替えたのではなく、学習の積み上げで伸ばしたという説明の仕方をしています。
ベースを差し替えたのではなく、学習の積み上げで伸ばしたという説明の仕方をしています。
室谷代表取締役そこは面白いですよね。GLM-5.2の時点でIndexShareによる長文脈処理、長期的タスク向けのRLであるSAO、大規模非同期学習のslimeといったスタックを組んでいて、その上で環境・タスク・計算量を増やし続けたのがGLM-5.3だという流れです。
テキトー教師DotAI 認定講師整理するとこうです。
- 提供元: Z.ai(Amazon Bedrockでの提供開始日は2026年10月5日)
- 位置づけ: フラッグシップのオープンウェイト・テキスト生成モデル
- アーキテクチャ: Mixture-of-Experts、総パラメータ744B、トークンあたり約40Bを活性化
- ベースモデル: GLM 5.2と同一。改善はpost-trainingのスケーリングによるもの
- コンテキストウィンドウ: 1Mトークン、最大出力128Kトークン
室谷代表取締役ちなみにZ.aiはブログ公開が2026年8月14日で、Bedrockでの提供開始が2026年10月5日。重みの公開は「ローンチから2週間後、安全性評価とハードニングが完了してから」とされています。
テキトー教師DotAI 認定講師つまりモデル自体の発表と、Bedrockという企業向けの入口が整ったタイミングは別なんですね。ここを混同すると「いつから使えるのか」で混乱するので注意です。
GLM-5.3でできること——1Mトークン・エージェントコーディング・推論努力レベル
GLM-5.3の主な機能・特徴
コンテキストウィンドウ1Mトークン
従来のGLM 5は200Kトークンで、一気に5倍に拡大。大規模コードベースの分析や長時間のエージェント作業を想定した拡張。
エージェントコーディング/自律的ソフトウェアエンジニアリング
AWSのモデルカードでは、ターミナルやCLIでのタスク実行、リポジトリ規模のコード生成とリファクタリング、多数のツール呼び出しにまたがる長期的マルチステップのエンジニアリングタスク、インフラ診断、大規模コードベースの長文脈分析を想定用途として挙げている。
推論努力レベル(reasoning effort)
応答の質とレイテンシ・トークン消費のトレードオフを選べる仕組み。
エージェント組み込み向け機能
function calling、構造化JSON出力、レスポンスストリーミング(推論内容のストリーミングを含む)に対応。
室谷代表取締役機能面でまず大きいのがコンテキストウィンドウ1Mトークンです。従来のGLM 5は200Kトークンだったので、一気に5倍に広がったことになります。
大規模コードベースの分析や、長時間のエージェント作業を想定した拡張なんですよね。
大規模コードベースの分析や、長時間のエージェント作業を想定した拡張なんですよね。
テキトー教師DotAI 認定講師想定用途がかなり実務寄りなんですよ。AWSのモデルカードには、エージェントコーディングと自律的なソフトウェアエンジニアリング、ターミナルやCLIでのタスク実行、リポジトリ規模のコード生成とリファクタリング、多数のツール呼び出しにまたがる長期的なマルチステップのエンジニアリングタスク、インフラ診断、大規模コードベースの長文脈分析が挙がっています。
室谷代表取締役「コードを書く」というより「エンジニアの作業単位を任せる」方向に振っている感じですよね。Z.aiのブログでも、MLインフラのタスクで計算クラスタやストレージ、内部ドキュメント、コードベース、実験結果にアクセスできる環境を与え、トレーニングスタックのボトルネックを診断して最適化を実装し、実験を回してエンドツーエンドの高速化を出す、といった例が紹介されています。
熟練エンジニアで数日かかる作業を想定した環境もあるとのことです。
熟練エンジニアで数日かかる作業を想定した環境もあるとのことです。
テキトー教師DotAI 認定講師もう一つの特徴が推論努力レベル(reasoning effort)です。応答の質とレイテンシ・トークン消費のトレードオフを選べる仕組みで、これは実際の運用では効いてきます。
室谷代表取締役あと地味に嬉しいのが、function calling、構造化JSON出力、レスポンスストリーミング(推論内容のストリーミングを含む)に対応している点です。エージェントに組み込む前提の機能が揃っているんですよね。
テキトー教師DotAI 認定講師講座でエージェント系の実装を教えている立場からすると、ストリーミングで推論過程が流れてくるのは受講生さんのデバッグがかなり楽になります。
GLM-5.3の性能はどこまで上がった?GLM-5.2からのベンチマーク改善幅
GLM-5.3 vs GLM-5.2 ベンチマーク比較
| ベンチマーク | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 |
| CyberGym | 84.5 | 77.2 |
| ExploitBench | 54.4 | 24.4 |
| ExploitGym(2時間) | 105 | 29 |
| ExploitGym(6時間) | 130 | 39 |
室谷代表取締役ここが今回いちばん気になる数字のところです。Z.aiのブログでは、社内ベンチマークのZ.ai Code BenchでGLM-5.2比50%改善、公開ベンチマークではTerminal Bench 3.0とAgents' Last ExamでオープンソースSOTAを達成したと報告されています。
テキトー教師DotAI 認定講師具体的な数字を並べるとこうなります。
| ベンチマーク | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 |
| CyberGym | 84.5 | 77.2 |
| ExploitBench | 54.4 | 24.4 |
| ExploitGym(2時間/6時間) | 105 / 130 | 29 / 39 |
室谷代表取締役Terminal Bench 3.0が4.6から28.3というのは、かなり大きな跳ね方ですよね。Z.aiは「環境スケーリング」という言い方をしていて、コーディング演習というより実際の専門業務に近いタスク環境を大量に用意して学習させたと説明しています。
テキトー教師DotAI 認定講師その環境を作る仕組みも面白いんですよ。研究エージェントが実務からタスクパターンを集めて、マルチステップの依存関係と隠れた状態を持つ実行可能な長期的環境に変換し、judgeエージェントがそのタスクを実際に解いてみて解けるかどうかを検証する。
参照解にアクセスせずに検証器を合成し、solverの軌跡を使って報酬ショートカットを見つけて塞ぐ。oracle・no-op・未解決状態のチェックを通過した検証器だけが、学習に使える信頼できるバイナリ報酬を出す、という流れです。
参照解にアクセスせずに検証器を合成し、solverの軌跡を使って報酬ショートカットを見つけて塞ぐ。oracle・no-op・未解決状態のチェックを通過した検証器だけが、学習に使える信頼できるバイナリ報酬を出す、という流れです。
室谷代表取締役ただ、Z.ai自身が「これらのパイプラインにはまだ相当量のhuman-in-the-loopの作業が必要」と書いているので、完全自動化された環境生成は次のステップという位置づけなんですよね。
テキトー教師DotAI 認定講師トークン効率の話も見逃せません。Z.ai Code BenchのMax effortで、GLM-5.3は1タスクあたり約75K出力トークンで34.5%に到達していて、GLM-5.2は96Kトークンで23.4%。
High effortでは約50Kトークンで31.4%に達し、これは120Kトークンで29.5%のClaude Opus 4.8を上回る、とZ.aiは報告しています。
High effortでは約50Kトークンで31.4%に達し、これは120Kトークンで29.5%のClaude Opus 4.8を上回る、とZ.aiは報告しています。
室谷代表取締役一方で、Claude Fable 5はMax effortで39.5%に達していてGLM-5.3は及ばない、ともZ.aiは率直に書いています。自社ブログで自社が負けている比較もきちんと載せているのは誠実ですよね。
テキトー教師DotAI 認定講師サイバー能力については、Z.aiが「予想より速く伸びた」と表現しているのが印象的です。脆弱性の発見だけでなく、複数段階の悪用チェーンをまたいで一貫した計画を立てるようになったと。
CyberGymでは84.5%で、Mythos 5の83.8%、GPT-5.6 Solの83.6%を上回るベンチマーク最高の結果だとしています。
CyberGymでは84.5%で、Mythos 5の83.8%、GPT-5.6 Solの83.6%を上回るベンチマーク最高の結果だとしています。
室谷代表取締役ただ、ExploitBenchではGLM-5.3が54.4%に対してMythos 5が78.0%、GPT-5.6 Solが76.5%。ExploitGymでもMythos 5が181と247タスクで先行していて、Z.ai自身が「悪用チェーンの上流に行くほど、クローズドフロンティアとの差が広がる」と分析しています。
テキトー教師DotAI 認定講師実世界での取り組みも書かれていますね。中国の複数のセキュリティチームと協力して実際のコードベースに対してモデルを走らせ、専門家のレビュー・スクリーニング・重複排除を経て、269プロジェクトで2,436件の脆弱性を特定。
うち1,097件が中〜高深刻度で、システムカーネルやOS、ブラウザエンジン、オープンソース基盤、Webアプリケーション、ネットワークプロトコルにまたがり、最も古いものは約40年前にさかのぼるものもあったと。
うち1,097件が中〜高深刻度で、システムカーネルやOS、ブラウザエンジン、オープンソース基盤、Webアプリケーション、ネットワークプロトコルにまたがり、最も古いものは約40年前にさかのぼるものもあったと。
室谷代表取締役これは防御側にとっては朗報で、同時に悪用可能性という意味では緊張感もある話ですよね。Z.aiはこの取り組みをZ.ai Security Disclosure Ledgerという公開記録として継続していくとしています。
テキトー教師DotAI 認定講師セキュリティ系のエージェント活用に関心がある方は、こういう動きも追っておくと良いと思います。AIエージェントが実際の開発フローに入ってくる流れはCodex入門でも解説しているので、あわせて読むと解像度が上がります。
GLM-5.3の使い方・始め方——Bedrockで利用するまでの流れと対象条件
室谷代表取締役ここからは実務の話です。BedrockでGLM 5.3を使うには、まずAWSアカウントが必要で、Bedrockコンソールで長期APIキーを発行します。
SDKはPythonならboto3、Chat Completions APIを使うならopenaiもインストールする形です。
SDKはPythonならboto3、Chat Completions APIを使うならopenaiもインストールする形です。
テキトー教師DotAI 認定講師環境変数の設定が2パターンあるのがポイントです。Chat Completions APIならOPENAI_API_KEYにBedrockのAPIキーを、OPENAI_BASE_URLにリージョンごとのエンドポイントを入れます。
Invoke/Converse APIならAWS_BEARER_TOKEN_BEDROCKにAPIキーを設定する形ですね。
Invoke/Converse APIならAWS_BEARER_TOKEN_BEDROCKにAPIキーを設定する形ですね。
室谷代表取締役コードはこんな感じです。AWSのモデルカードにChat Completions APIの例が載っています。
python
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="us.zai.glm-5.3",
messages=[{"role": "user", "content": "Can you explain the features of Amazon Bedrock?"}]
)
print(response)
テキトー教師DotAI 認定講師ここで注意が必要なのがモデルIDです。GLM 5.3はcross-Region推論のみの提供なので、ベースのモデルID(zai.glm-5.3)ではなく、地理プロファイルのus.zai.glm-5.3か、グローバルプロファイルのglobal.zai.glm-5.3を使う必要があります。
室谷代表取締役しかもアクセスは「eligible customers(適格な顧客)」に限定されていて、詳細はAWSアカウントチームに問い合わせる必要があるとモデルカードに明記されています。ここは最初のハードルになりそうですね。
テキトー教師DotAI 認定講師あと、サービスティアも選べます。Standardはコミットなしのトークン従量課金、Priorityは割増で最速応答、Flexは時間に敏感でないワークロード向けの低コスト、Reservedはアカウント単位で設定する専用スループットです。
ReservedはAWSアカウントチームへの連絡が必要とされています。
ReservedはAWSアカウントチームへの連絡が必要とされています。
室谷代表取締役プロンプトキャッシュまわりも整理しておきたいです。GLM 5.3はデフォルトで暗黙的(自動)プロンプトキャッシュに対応していて、さらに明示的プロンプトキャッシュも使えます。
明示的キャッシュは最小1,024トークン単位で、TTLは少なくとも30分。AWSは明示的キャッシュを設定することでキャッシュヒット率が上がり、レイテンシとコストを下げられるとして推奨しています。
明示的キャッシュは最小1,024トークン単位で、TTLは少なくとも30分。AWSは明示的キャッシュを設定することでキャッシュヒット率が上がり、レイテンシとコストを下げられるとして推奨しています。
テキトー教師DotAI 認定講師長いコードベースを何度も参照するエージェント運用では、このキャッシュ設計が効いてきます。講座でも「同じ文脈を毎回投げ直している」という受講生さんが多いので、ここは押さえておきたいところです。
GLM-5.3の料金と日本での利用は?提供範囲・リージョン制約を整理
室谷代表取締役料金についてですが、AWSのモデルカードには「For pricing information, see the Amazon Bedrock Pricing page」としか書かれておらず、GLM 5.3の具体的なトークン単価は今回のソースでは確認できません。現時点では明らかにされていない、という扱いになります。
テキトー教師DotAI 認定講師ここは推測で数字を書かないほうがいいですね。Bedrockの料金ページはプロバイダーごとにタブが分かれているので、Z AIのタブを確認するのが確実です。
室谷代表取締役日本からの利用可否については、リージョン表が重要です。GLM 5.3はIn-Region推論が非対応で、USリージョンからのGeo Cross-Region推論と、表に載っているリージョンからのGlobal Cross-Region推論に対応する形になっています。
テキトー教師DotAI 認定講師その表にap-northeast-1(東京)とap-northeast-3(大阪)が入っているんですよ。つまり日本のリージョンからもGlobal Cross-Region推論の対象にはなっている、という整理になります。
室谷代表取締役ただしIn-Region推論は非対応なので、リクエストが単一リージョン内で完結する構成にはできない、という制約は押さえておく必要があります。データレジデンシーの要件が厳しい案件ではここが判断ポイントですよね。
テキトー教師DotAI 認定講師整理するとこうです。
- 対応する推論方式: Geo Cross-Region(USリージョンから)、Global Cross-Region(表に記載の各リージョンから)
- 非対応: In-Region on-demand推論
- 東京(ap-northeast-1)・大阪(ap-northeast-3): Global Cross-Regionの対象リージョンに含まれる
- 利用条件: eligible customers限定。AWSアカウントチームへの問い合わせが必要
- 料金: 具体的な単価は今回のソースでは未確認
室谷代表取締役ちなみに従来のGLM 5は2026年2月11日開始でコンテキスト200Kトークン、Geo/Global推論は非対応でした。GLM 5.3では1Mトークンに拡大しつつcross-Region推論に対応した、という変化の方向性が見えます。
テキトー教師DotAI 認定講師競合と比較したGLM-5.3の立ち位置——Claude/GPT/DeepSeek勢との構図
室谷代表取締役Z.aiの比較表にはKimi K3、DeepSeek-V4 Pro-0813、Qwen3.8-Max、Opus 4.8、Fable 5、GPT-5.6 Solが並んでいて、コーディングとサイバー系で競合する構図が示されています。
テキトー教師DotAI 認定講師数字を素直に読むと、Terminal Bench 2.1ではGLM-5.3が88.2で、Kimi K3の88.3、DeepSeek-V4 Pro-0813の87.9、GPT-5.6 Solの88.8とほぼ横並び。一方でTerminal Bench 3.0は28.3で、Fable 5の33.7、GPT-5.6 Solの34.6には届いていません。
室谷代表取締役DeepSWE v1.1は66.9で、Kimi K3の67.5、Fable 5の69.7、GPT-5.6 Solの72.7と近い位置にいます。NL2Repoは58.0でKimi K3と同値、Opus 4.8の69.7が上にいますね。
テキトー教師DotAI 認定講師エージェント系ではToolathlon Verifiedが73.0、AutomationBench v1.0.6が48.2、HLE w/ Toolsが62.5、GDPval-AA v2が1769。GDPval-AA v2はQwen3.8-Maxの1739、Fable 5の1743を上回り、GPT-5.6 Solの1730も上回る数字になっています。
室谷代表取締役全体として「オープンウェイトの中ではコーディング最強を主張しつつ、クローズドの最先端には一部で届いていない」というのがZ.ai自身の説明と一致する構図ですよね。
テキトー教師DotAI 認定講師BedrockのモデルカタログにはAnthropic、Meta、Mistral、DeepSeek、Qwen、OpenAIなど多数のプロバイダーが並んでいるので、企業としては「同じBedrockの中でモデルを選べる」状態になっているのが大きいです。乗り換え判断もしやすくなります。
室谷代表取締役
テキトー教師DotAI 認定講師あと、エージェントに長期的な作業を任せるなら、クォータや使用量の管理もセットで考えたいところです。Antigravityの使用量を徹底解説!で扱っているような監視の考え方は、Bedrockのトークン消費を追うときにも参考になります。
GLM-5.3に関するよくある質問
室谷代表取締役ここからは、よく聞かれるポイントを整理していきます。
テキトー教師DotAI 認定講師まず「GLM-5.3はいつから使えるのか」。Z.aiのブログ公開が2026年8月14日、Amazon Bedrockでのモデル提供開始日が2026年10月5日です。
Bedrock経由で使いたい場合は10月5日以降が起点になります。
Bedrock経由で使いたい場合は10月5日以降が起点になります。
室谷代表取締役「パラメータ数と構成は?」については、Mixture-of-Expertsアーキテクチャで総パラメータ744B、トークンあたり約40Bを活性化。GLM 5.2と同じベースモデルで、改善はpost-trainingのスケーリングによるものです。
テキトー教師DotAI 認定講師「コンテキスト長は?」は1Mトークン、最大出力は128Kトークンです。従来のGLM 5は200Kトークンだったので大幅に拡大しています。
室谷代表取締役「料金はいくら?」については、AWSのモデルカードがBedrockの料金ページを参照する形になっていて、今回のソースでは具体的な単価が確認できません。現時点では明らかにされていない、という答えになります。
テキトー教師DotAI 認定講師「日本から使えるのか?」は、東京(ap-northeast-1)と大阪(ap-northeast-3)がGlobal Cross-Region推論の対象リージョンに含まれています。ただしIn-Region推論は非対応で、利用はeligible customersに限定され、AWSアカウントチームへの問い合わせが必要です。
室谷代表取締役「オープンウェイト最強のコーディングモデルと言えるのか?」については、Z.ai自身が「most capable open-weights model for coding」とうたっていて、社内のZ.ai Code BenchでGLM-5.2比50%改善、Terminal Bench 3.0とAgents' Last ExamでオープンソースSOTAを達成したと報告しています。ただし比較表ではKimi K3やDeepSeek-V4 Pro-0813が近い数字を出している項目もあり、優劣はベンチマークと用途次第という見方になります。
テキトー教師DotAI 認定講師「サイバーセキュリティ上のリスクは?」については、Z.aiが脆弱性発見データと環境を学習に混ぜた結果、悪用チェーンをまたぐ推論ができるようになったと説明しています。CyberGymでは最高スコア、ExploitBenchやExploitGymではクローズドの最先端に及ばないもののGLM-5.2から大幅に伸びている、というのがソースに書かれている事実です。
室谷代表取締役「重みはいつ公開されるのか?」は、ローンチから2週間後、安全性評価とハードニングが完了してからとZ.aiが明言しています。
テキトー教師DotAI 認定講師「APIのドキュメントはどこにあるのか」は、AWSのモデルカードとZ.aiのドキュメントガイドが公開されています。Bedrock経由ならAWSのモデルカード、Z.ai側のAPI仕様はZ.aiのガイドを見る形ですね。
室谷代表取締役「GLM-5.2からの乗り換えを判断するポイントは?」については、同じベースモデルでpost-trainingだけを伸ばしているので、長期的なマルチステップのエンジニアリングタスクとトークン効率の改善が効いてくる場面で差が出る、というのがZ.aiの説明です。逆に短いタスクでは差が小さい可能性があります。
テキトー教師DotAI 認定講師講座で受講生さんに伝えているのは「ベンチマークの数字だけで決めず、自分の業務のタスクで測る」ということです。GLM-5.3は推論努力レベルでトークン消費と性能のバランスを選べるので、コスト感度の高い案件ではそこを調整しながら試すのが現実的ですね。
室谷代表取締役企業のエージェント基盤としてBedrock経由で使えるようになったのは大きいので、まずは適格顧客の条件をAWSのアカウントチームに確認するところから始めるのが良さそうです。
