MOE
MoE 稀疏化
每個 token 只喚醒必要的專家。Flash 以 320B 總參數、18B 活躍參數運行——大腦很大,出手很省。
OPEN WEIGHTS · 2026
把後訓練推到極限的開源編碼旗艦,加上一台壓到 18B 活躍參數的原生多模態機體。同一套權重哲學,兩種部署打法——把前沿智能,壓進你的成本表。
點選檔案卡展開規格,或用 ← → 鍵切換機型。
GLM-5.3 沿用 GLM-5.2 的 743B 級 MoE 基座,把力氣全部花在後訓練:以 IndexShare 處理高效長上下文、以 SAO 在長程任務上做強化學習。官方在自家的 Z.ai Code Bench 上,編碼能力較 GLM-5.2 相對提升 50%,定位為「最強開源權重編碼模型」。
GLM-5.3-Flash 以 320B 總參數、僅 18B 活躍參數運行,是 GLM-5 系列第一個原生多模態機型(文字、圖像、影片理解直接進同一個模型),也是第一個把 sparse attention 與 linear attention 疊進同一個開源前沿模型的嘗試。1,048,576 tokens 的上下文窗口,配上 MIT 授權與極低推論成本。
稀疏化、混合注意力、原生多模態——1M 上下文的三根柱子。
MOE
每個 token 只喚醒必要的專家。Flash 以 320B 總參數、18B 活躍參數運行——大腦很大,出手很省。
ATTENTION
linear attention 管局部依賴、sparse attention 管長程依賴,首次疊進同一個開源前沿模型——這是 1M 上下文能以 Flash 成本運轉的原因。
MODALITY
GLM-5 系列首個原生多模態機型:文字、圖像、影片理解直接進同一個模型,不必外掛視覺編碼器。
CONTEXT
1,048,576 tokens。配合 vLLM Day-0 支援(NVIDIA / AMD),長程 agent 任務可以直接上車。
只登記有來源的數字;沒查證的,不寫。
SWE-bench Verified 96.4%——開源權重編碼第一梯隊(第三方彙整;2026-02 起 scaffold 升級為 v2.0.3,跨代比較請留意基準一致性)
來源 ↗官方戰報:編碼較 GLM-5.2 +50%(Z.ai Code Bench in-house 數據)
來源 ↗智能體任務:Terminal-Bench 2.1 達 84.3(GLM-5.3-Flash,第三方實測)
來源 ↗DeepSWE v1.1 63.4,較 GLM-5.2 的 46.2 躍升(GLM-5.3-Flash)
來源 ↗CyberGym 84.5%——官方公告以「emergent cyber capabilities」為題
來源 ↗MIT 授權,權重完全開放(Hugging Face:zai-org/GLM-5.3-Flash)
來源 ↗數據整理自官方公告與第三方分析(截至 2026-08);分數依測試框架版本而異,以各來源原文為準。
OpenAI 相容端點,三分鐘接上。
# OpenAI 相容端點;細節以官方文件為準
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.z.ai/api/paas/v4",
)
resp = client.chat.completions.create(
model="glm-5.3-flash", # 或 "glm-5.3"
messages=[
{"role": "user", "content": "用三句話介紹 GLM-5.3 系列。"}
],
)
print(resp.choices[0].message.content)