GLM-5.3 MODEL DOSSIER

OPEN WEIGHTS · 2026

GLM-5.3 系列檔案SERIES DOSSIER

把後訓練推到極限的開源編碼旗艦,加上一台壓到 18B 活躍參數的原生多模態機體。同一套權重哲學,兩種部署打法——把前沿智能,壓進你的成本表。

旗艦基座
743B MoE
Flash 活躍
18B / 320B
Flash 上下文
1M tokens
授權
MIT open weights

Lineup 編組陣容

點選檔案卡展開規格,或用 ← → 鍵切換機型。

把後訓練推到極限的開源編碼旗艦

GLM-5.3 沿用 GLM-5.2 的 743B 級 MoE 基座,把力氣全部花在後訓練:以 IndexShare 處理高效長上下文、以 SAO 在長程任務上做強化學習。官方在自家的 Z.ai Code Bench 上,編碼能力較 GLM-5.2 相對提升 50%,定位為「最強開源權重編碼模型」。

  • Agentic Coding
  • 長程任務 RL
  • 工具調用
  • 開源權重
發布日期
2026-08-14
架構
MoE · 743B 級基座
定位
最強開源權重編碼模型
訓練重點
IndexShare 長上下文 · SAO 長程 RL
編碼戰績
Z.ai Code Bench +50% vs GLM-5.2

Blueprint 架構解剖

稀疏化、混合注意力、原生多模態——1M 上下文的三根柱子。

MOE

MoE 稀疏化

每個 token 只喚醒必要的專家。Flash 以 320B 總參數、18B 活躍參數運行——大腦很大,出手很省。

GLM-5.3 基座743B

Flash 總參數320B

Flash 活躍參數18B / token

ATTENTION

混合注意力

linear attention 管局部依賴、sparse attention 管長程依賴,首次疊進同一個開源前沿模型——這是 1M 上下文能以 Flash 成本運轉的原因。

MODALITY

原生多模態

GLM-5 系列首個原生多模態機型:文字、圖像、影片理解直接進同一個模型,不必外掛視覺編碼器。

CONTEXT

1M 上下文

1,048,576 tokens。配合 vLLM Day-0 支援(NVIDIA / AMD),長程 agent 任務可以直接上車。

Field Report 實測戰報

只登記有來源的數字;沒查證的,不寫。

  1. R-01

    SWE-bench Verified 96.4%——開源權重編碼第一梯隊(第三方彙整;2026-02 起 scaffold 升級為 v2.0.3,跨代比較請留意基準一致性)

    來源 ↗
  2. R-02

    官方戰報:編碼較 GLM-5.2 +50%(Z.ai Code Bench in-house 數據)

    來源 ↗
  3. R-03

    智能體任務:Terminal-Bench 2.1 達 84.3(GLM-5.3-Flash,第三方實測)

    來源 ↗
  4. R-04

    DeepSWE v1.1 63.4,較 GLM-5.2 的 46.2 躍升(GLM-5.3-Flash)

    來源 ↗
  5. R-05

    CyberGym 84.5%——官方公告以「emergent cyber capabilities」為題

    來源 ↗
  6. R-06

    MIT 授權,權重完全開放(Hugging Face:zai-org/GLM-5.3-Flash)

    來源 ↗

數據整理自官方公告與第三方分析(截至 2026-08);分數依測試框架版本而異,以各來源原文為準。

Quick Start 部署上線

OpenAI 相容端點,三分鐘接上。

python · OpenAI-compatible
# OpenAI 相容端點;細節以官方文件為準
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.z.ai/api/paas/v4",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",  # 或 "glm-5.3"
    messages=[
        {"role": "user", "content": "用三句話介紹 GLM-5.3 系列。"}
    ],
)
print(resp.choices[0].message.content)

上車路線

  • API:OpenAI 相容端點;Flash 牌價低至輸入 ≈$0.075/輸出 ≈$0.25(每百萬 tokens,第三方平台報價)。
  • 本地:GLM-5.3-Flash 1-bit 量化約 102GB RAM/VRAM 即可運行(llama.cpp / Unsloth)。
  • 推理框架:vLLM Day-0 支援(NVIDIA / AMD)。
  • 權重:Hugging Face zai-org/GLM-5.3-Flash,MIT 授權。