GLM-5.3 的技術規格
| 規格 | GLM-5.3 |
|---|---|
| 開發者 | Z.ai / Zhipu AI |
| 發布 | 2026 年 8 月 14 日 |
| 模型類型 | 旗艦級基礎模型 |
| 輸入 | 文字 |
| 輸出 | 文字 |
| 上下文視窗 | 1,000,000 個詞元 |
| 最大輸出 | 128,000 個詞元 |
| 思考 | 多種模式 |
| 串流 | 是 |
| 函式呼叫 | 是 |
| 結構化輸出 | 是 |
| 上下文快取 | 是 |
| MCP | 是 |
| 主要應用 | 程式設計、代理、工程、網路安全 |
Z.ai 的公開模型倉庫仍然明顯顯示 GLM-5.2,而非可下載的 GLM-5.3 構件,因此尚未公布的規格應明確標註為未確認。
GLM-5.3 是什麼?
GLM-5.3 是 Z.ai 的 GLM 系列最新一代,代表著向「能夠自主執行複雜安全與工程任務的 AI 系統」轉變。
這次發布特別值得注意,因為網路安全不再僅被當作另一個基準測試類別。Z.ai 正使用 GLM-5.3 來展示一個能夠發現軟體漏洞並參與攻擊開發工作流程的 AI 系統。
據 Reuters 報導,Z.ai 計劃在完成安全評估後公開發布該模型,而更進階的能力將先透過一種「受信任存取機制」加以限制。
這與 GLM-5.2 的側重點相比是顯著的變化。
GLM-5.2 主要定位於「長期任務的軟體工程與代理式程式編寫」。Z.ai 6 月的研究頁面將 GLM-5.2 描述為「Built for Long-Horizon Tasks」。
GLM-5.3 將這種代理式理念帶入更敏感的領域:
「軟體工程 → 漏洞發現 → 資安防禦 → 受控的進攻性安全」
GLM-5.3 的主要特性是什麼?
以網路安全為核心的推理
最醒目的能力是網路安全。
GLM-5.3 達成:
CyberGym 84.5%
CyberGym 評估 AI 系統識別軟體漏洞的能力。這一結果略高於 Mythos 5 公佈的 83.8%。
這一點很重要,因為網路安全不僅僅是產生語法正確的程式碼。
一個有能力的安全代理需要能夠:
- 理解不熟悉的程式碼。
- 識別攻擊面。
- 針對漏洞形成假設。
- 追蹤資料與控制流程。
- 驗證假設。
- 開發合適的概念驗證。
- 判定該漏洞是否確實可被利用。
GLM-5.3 的 CyberGym 分數顯示在這條鏈的前半段有了實質進展。
強大的漏洞發現能力
這個 84.5% 的 CyberGym 分數 可以說是目前最令人印象深刻的早期結果。
它讓 GLM-5.3 在漏洞識別上略勝 Mythos 5 一籌:
| 模型 | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
差距只有 0.7 個百分點,因此將 GLM-5.3 描述為決定性優勢是不恰當的。
更有意思的是,Z.ai 的一個開放權重模型正在進入與一個高度受限的網路安全系統相近的表現區間。
漏洞利用開發仍是弱項
GLM-5.3 並未在所有網路安全任務上佔優。
在 ExploitBench 上:
| 模型 | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
這是 23.6 個百分點的差距。
這揭示了一個重要區別:
發現漏洞與能夠可靠地加以利用,並不是同一回事。
GLM-5.3 在識別弱點方面顯得相當有能力,但早期結果顯示,將這些發現轉化為穩定可靠的漏洞利用開發仍然困難得多。
對企業安全團隊而言,這反而使該模型作為一個「防禦性漏洞分析助手」更具吸引力,而不僅僅是進攻自動化引擎。
GLM-5.3 vs GLM-5.2
GLM-5.2 提供了最有用且已確認的基線。
| 功能 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 狀態 | 已發布 | 已公告 |
| 主要定位 | 長期任務代理 | 網路安全 + 代理 |
| 程式設計 | 優異 | 預期仍將強勢 |
| 網路安全 | 具備強大潛力 | 明確的旗艦重點 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| 上下文 | 1M | 未確認 |
| 參數 | ~753B | 未確認 |
| 授權 | MIT | 已宣布開放權重 |
| API 定價 | 已公布 | 尚未公布 |
| 公開權重 | 可用 | 計畫中 |
GLM-5.2 的已確認架構約為 753B 參數,其公開模型目錄仍列出 753B 模型與 FP8 版本。
根據第三方基於 Z.ai 模型評估材料的報導,GLM-5.2 亦在 Terminal-Bench 2.1 上取得 81.0,在 SWE-bench Pro 上取得 62.1。
但這些數據應仍視為 GLM-5.2 的基準,不應歸於 GLM-5.3。
GLM-5.3 vs Mythos 5
這目前是最具意義的基準比較。
| 基準 | GLM-5.3 | Mythos 5 | 差異 |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 個百分點 |
| ExploitBench | 54.4% | 78.0% | −23.6 個百分點 |
這帶來一個較為細緻的結論。
GLM-5.3 在漏洞識別上勝出。
但是:
Mythos 5 在漏洞利用開發上仍然顯著更強。
因此,說「GLM-5.3 擊敗 Mythos 5」會是不準確解讀現有數據。
更好的描述是:
GLM-5.3 在漏洞發現上達到接近 Mythos 5 的水準,但在漏洞利用開發上仍然落後。