GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

GLM-5.3 是什麼?只靠後訓練衝高的 Z.ai 開放權重寫程式模型解析

GLM-5.3 是智譜 Z.ai 於 2026 年 8 月 14 日發布的開放權重寫程式模型,沿用 GLM-5.2 基座、進步全來自後訓練,1M context、128K 輸出,並長出 CyberGym 級的資安能力。本文對照官方自跑成績與獨立榜、拆解 Coding Plan 點數制與三條路成本試…

GLM-5.3 開放權重寫程式模型解析,涵蓋後訓練、1M context、跑分、資安與成本

先給一句話定位。GLM-5.3 是智譜(Zhipu AI,海外品牌 Z.ai)在 2026 年 8 月 14 日推出的寫程式模型,官方給它的頭銜是「最強開放權重 coding 模型」;開放權重(open weights)指模型檔案會公開讓人下載、下載後可以自己部署的發布方式。規格重點:context window(上下文視窗,模型一次讀得進來的內容量)1M tokens、最大輸出 128K、總參數約 753B,純文字輸入,不能吃圖片。它跟別家新模型不一樣的地方有兩件:這一版完全不換基座,帳面進步全部來自後訓練(post-training,基座練好之後接著做的強化訓練階段);資安能力在後訓練過程中長得比 Z.ai 自己預期的快,官方還為此開了一本公開的漏洞披露帳本。付費使用 5.3 本體,截至 8 月 15 日只有 GLM Coding Plan 一個入口,Lite 每月 $18 起。

重點先看

GLM-5.3 於 2026 年 8 月 14 日發布,基座沿用 GLM-5.2,官方公告第一句就寫「Scaling post-training is all we did for GLM-5.3.」,等於昭告這一版只加強後訓練。

規格:context window 1M、最大輸出 128K、總參數約 753B 的 MoE 模型;思考分 low/high/max 三檔且關不掉;純文字、無視覺輸入。

成績單上 Terminal-Bench 2.1 拿 88.2、CyberGym 84.5、GDPval-AA v2 Elo 1769,但整張表是 Z.ai 自己跑的;獨立側只有 GDPval 一條機構數字,SWE-bench Verified 到 8 月 15 日仍沒有 GLM 5.x 的提交。

資安是最特別的支線:Z.ai 的披露帳本登記 2,436 個漏洞、269 個專案,Apple 的 iOS 安全公告曾在 WebKit 段落致謝 GLM 與 z.ai。

付費入口目前只有 GLM Coding Plan(Lite 每月 $18);per-token API 官方只說 coming soon;模型權重承諾在發布後兩週內、安全評估完成後釋出,時間落在 8 月 28 日前後。

GLM-5.3 是什麼?不換基座的賭注與半年六版的產品線

GLM-5.3 最不尋常的決定,是這一版完全不換基座。Z.ai 在 2026 年 8 月 14 日的發布公告開頭寫了一句很直接的話:「Scaling post-training is all we did for GLM-5.3.」公告並說明,5.3 用的基座與 GLM-5.2 同一顆,每一分進步都來自後訓練。基座模型(base model)是先用大量資料練出來的原始模型,後訓練是在它之後、決定模型實際行為的階段。拿球隊來比喻:基座是球員名單,後訓練是教練團與訓練課表,5.2 升到 5.3,名單一個人都沒換,換掉的是整套戰術演練。比喻只到此為止:教練團再強,救不了天賦不足的名單,後訓練的天花板終究由基座決定,Z.ai 等於把寶押在教練團身上。

GLM-5.3 沿用 GLM-5.2 基座,透過後訓練提升寫程式與 Agent 能力的流程圖
GLM-5.3 沿用同一基座,把能力增幅押在後訓練與工作流強化。

對使用者的含義其實很實際。5.2 的手感、長處與老毛病,5.3 大部分會原封不動繼承;帳面的跳升倒是真的,官方自跑的 GDPval-AA v2 從 Elo 1508 拉到 1769,SWE-Marathon v1.1 從 19.4 翻到 42.5。同一顆基座能練出這種幅度,後訓練投入的規模不難想像。

東家順便認識一下。智譜是北京的公司,海外平台叫 z.ai,中國境內平台叫 bigmodel.cn,兩邊跑同一條 GLM 模型線,出貨節奏很快:GLM-5 在 2026 年 2 月 12 日發布,3 月 15 日是 GLM-5-Turbo,4 月 1 日多了走視覺路線的 GLM-5V-Turbo,4 月 7 日的 GLM-5.1 主打 8 小時等級的長任務,6 月 16 日的 GLM-5.2,再到 8 月 14 日的 5.3,半年六個版本。基座訓練吃重資本,後訓練疊代相對輕,這個節奏本身就是策略:把寫程式模型當滾動出貨的產品線,而不是一年改版一次的大工程。對你的影響是,今天的 5.3 過不久就會有下一版,不必為了追版本焦慮。

中國模型這兩年的分工也看得出來:MiniMax H3 守全模態影片生成,Kimi K3 拚寫程式訂閱,智譜押開放權重加資安的組合。市場採用有實績:GLM 5.2 是 OpenRouter 上最大的單一模型,約 22% 的 token 量、累積跑過 3.65T tokens 以上、約 20 家 provider 供應。5.3 截至 8 月 15 日還沒上架 OpenRouter,訂閱端已經先換上。

1M 上下文、753B MoE,與官方留白的那一格

規格先攤開,再講怎麼讀。

GLM-5.3 的 1M context、128K 輸出、753B MoE 與每個 token 啟用 8 個專家的規格圖
1M context 與 128K 輸出拉長工作記憶;MoE 每個 token 只啟用部分專家。
項目數值
Context window1M tokens
最大輸出128K tokens
總參數753,329,940,480(約 753B)
架構BF16 MoE,每個 token 啟用 8 個專家
輸入形式純文字,無視覺輸入
Thinking effortlow/high/max 三檔,無關閉選項

官方文件的規格卡沒有掛 beta 標註,是正式規格。token 是模型讀寫文字的基本單位,計費也按它算,大小約一個中文字到半個英文詞。總參數那串數字出自GLM-5.2 在 HuggingFace 上的儲存庫,5.3 重用同一顆基座,數字共用。

753B 聽起來嚇人,但架構是 MoE(mixture of experts,混合專家架構):模型內部像一間分成好幾百個科別的大型醫院,每處理一個 token,真正出手的是其中 8 個科。你付的錢與等待的時間,取決於每次會診的 8 個科,不是全院規模。這個比喻只解釋計算量,不代表品質,品質還看專家本身練得好不好。

表格裡有一格是官方留白:每個 token 實際啟用的參數量。第三方流傳的 743B、744B 都沒有官方依據,引用前先扣住。這格空白為什麼重要:MoE 的成本取決於啟用的部分,啟用參數量不公布,這顆模型的效率上限就算不出來,只能直接看牌價。BF16 則是數值精度格式,標示模型權重用什麼精確度儲存,直接決定檔案體積;5.2 的整套權重在這個格式下約 1.4 到 1.5TB,本機部署的門檻就從這個數字開始算。

1M 的 context window 放進工作情境才有感。agent(代理)指你交辦之後,它自己連續操作、做完回報的那種用法;agent 的失誤多半來自忘記自己先前為什麼那樣改,幾十萬行的 codebase 加上來回對話,舊模型會在中途開始失憶,1M 等級把這個臨界點往後推很多。128K 的輸出上限對應另一端:一整份重構計畫可以一次寫完,不必拆成好幾段接龍。要真的吃到 1M,呼叫時得指定長上下文的模型 tag,接線段落再講。具體場景幫助理解:把一個幾十萬行的專案連同兩週的修改歷史一次餵進去,1M 吃得下;換成小視窗的模型,內容超過容量只能摘要或截斷,摘要就會漏細節,而漏掉的那一行,常常正是 bug 的藏身處。

行為面最容易踩的是 thinking(模型的思考過程)。三檔 low、high、max,沒有 off。從 Anthropic 格式遷移過來的程式要特別注意:沿用把 thinking.type 設成 disabled 的寫法,請求會直接失敗,正確做法是改成 enabled 並把 reasoning_effort 降到 low。官方文件把這條寫成遷移提示,代表踩到的人不少。檔位怎麼選官方沒給建議,但邏輯不難推:小改動、補測試用 low,回來得快;跨檔重構、找不出來的 bug 留給 max。麻煩在於沒有 off,任務再簡單,模型還是會跑一段思考,token 就這樣花掉。

視覺能力明確缺席。UI 截圖對照、設計稿還原、圖片除錯這類任務直接出局,這是純文字模型的邊界,沒有修不修的問題。PTT 討論串裡鄉民抱怨的第一件事就是它。需要看圖的工作,現階段交給別家模型;這條產品線上雖有 GLM-5V-Turbo 走視覺路線,它與 5.3 是不同產品,看圖與寫程式各有各的型號,別混為一談。

誰跑的分?讀 GLM-5.3 成績單前先分三層證據

讀 5.3 的任何一個分數前,先問一句:這個分數是誰跑的?它的成績分三層證據:Z.ai 自己跑的對照表、第三方機構執行的評比、官方排行榜的提交紀錄。三層的可信度用途不同,混用就會得出錯誤結論。

判讀 GLM-5.3 跑分時區分官方自跑、第三方機構與官方排行榜提交的三層證據
同一個分數,出題者與提交流程不同,能支持的結論也不同。

廠商自跑的 benchmark(跑分,模型的考卷)像補習班自己辦的模擬考:題目可以很紮實,前後屆的進步看得出來,但拿 A 補習班的模擬考分數跟 B 補習班比沒有意義,因為出題與批改是同一方。能跨校比較的,是學測那種統一命題、統一閱卷的考試。模擬考不是假考試,它只是不能拿來跨校排名。

官方對照表:連競品分數都是 Z.ai 跑的

BenchmarkGLM-5.3GLM-5.2Kimi K3Opus 4.8Fable 5GPT-5.6 Sol
Terminal-Bench 2.188.281.088.385.088.088.8
Terminal-Bench 3.028.34.617.421.133.734.6
DeepSWE v1.166.946.267.558.069.772.7
FrontierSWE78.167.5未列66.588.2未列
SWE-Marathon v1.142.519.448.148.833.142.5
CyberGym84.577.280.078.183.883.6
ExploitBench54.424.432.240.078.076.5
GDPval-AA v2(Elo)176915081682158817431730

榜的名字先分類:Terminal-Bench 測終端機裡的任務執行,DeepSWE、FrontierSWE、SWE-Marathon 是不同難度與時長的真實軟體工程題,CyberGym 與 ExploitBench 從漏洞發現排到完整利用,GDPval-AA v2 是通用任務的 Elo 評比(Elo,把勝負換算成分數的積分制)。

Z.ai 官方公布的 GLM-5.3 與其他模型六項基準測試比較圖
Z.ai 官方公布的六項基準比較;跨廠分數皆由 Z.ai 自行執行,解讀時應與獨立榜分開。 查看官方來源

站上前的格子先看。CyberGym 84.5 是全表最高,壓過 GPT-5.6 Sol 的 83.6 與 Fable 5 的 83.8;GDPval 的 Elo 1769 也是表內最高;Terminal-Bench 2.1 的 88.2 排第三,落後 Sol 的 88.8 與 Kimi K3 的 88.3,差距不到 1 分,換個隨機種子可能就翻盤,前面幾個名字實質並排。

沒贏的格子也要看。Terminal-Bench 3.0 拿 28.3,落後 Sol 的 34.6 與 Fable 5 的 33.7,而那一排全場最高才 34.6,代表新版題目難度跳了一級,所有模型一起重排,此時的贏家不代表格局底定。FrontierSWE 78.1 對 Fable 5 的 88.2 差了 10 分;DeepSWE 的 66.9 輸給 Sol、Fable 5、Kimi K3;SWE-Marathon 42.5 平 Sol,輸 Opus 4.8 的 48.8 與 K3 的 48.1;ExploitBench 54.4 跟 78.0、76.5 有一大段距離。公告裡還有一批長任務與工具使用的榜:Toolathlon 73.0、HLE w/Tools 62.5、NL2Repo 58.0、AutomationBench 48.2、ProgramBench 19.0,好壞互見,讀法與上面相同,看形狀不看單格。

整張表最乾淨的比較,其實是 5.2 對 5.3 那兩欄:同一顆基座、同一家跑法、同一天發布,變數最少,所以 81.0 到 88.2、19.4 到 42.5、24.4 到 54.4 這些跳升,是公告裡可信度最高的一段。跨廠的格子拆開看形狀就好:對 Opus 4.8 八格贏七格,只在 SWE-Marathon 落後;對 Fable 5 是四比四;對 Sol 寫程式類多半落後,cyber 與 GDPval 兩格站前面。Opus 這條產品線的節奏與定位,站上對Claude Opus 5 的完整拆解有整理。

官方宣傳的「進步 50%」也要看清楚出題人是誰。那個數字出自 Z.ai 內部私有基準 Z.ai Code Bench:max effort 通過率 34.5%、每題約 75K tokens,5.2 是 23.4%、每題約 96K;high effort 31.4%、約 50K tokens,贏 Opus 4.8 的 29.5%,而 Opus 每題吃到約 120K;Fable 5 同榜 39.5%,5.3 仍落後。講白了,50% 的分子分母都在 Z.ai 家裡,進步是真的,比較基準是私有的。

Z.ai Code Bench 比較 GLM-5.3、GLM-5.2 與 Claude 模型在不同思考強度的準確率與輸出 token
官方私有 Z.ai Code Bench 顯示準確率與輸出 token 的取捨;它適合看同廠前後代,不宜直接當跨廠定論。 查看官方來源

幫 Z.ai 說句公平話:它把沒贏的格子照列,沒只貼勝場,這點比多數官方公告好看。私有榜也不必然不可信,公共榜怕的是考題早已出現在模型的參考書裡(訓練資料污染),私有榜反而沒這個問題,關鍵始終是出題人的立場。資安段的 Semgrep 測試,就是私有榜做出分量的例子。

獨立機構成績:能直接引用的只有一條

GDPval-AA v2 由 Artificial Analysis 執行,這是 5.3 少數能直接引用的第三方機構數字:Elo 1769,高於 Fable 5 的 1743、Qwen3.8-Max 的 1739、GPT-5.6 Sol 的 1730、Opus 4.8 的 1588。注意它贏的是通用任務,不是寫程式專科。這條數字的價值在出題人:同一套題目、同一套評比流程,所有模型站在同一個基準上,1769 這個位置別家廠商拿不走也改不了。限制也一樣清楚:它量的是通用任務的勝負,拿去推論寫程式強弱,中間還隔著一段沒有證據的路。

官方排行榜:連續三代的提交缺口

SWE-bench 官方排行榜到 8 月 15 日為止,Verified 榜上看不到任何 GLM 5.x;整個 GLM 家族唯一的條目,是 2026 年 2 月 17 日提交的 GLM 5(high)搭 mini-SWE-agent,72.80%,每題成本 $0.53。5.1、5.2、5.3 三代都沒送測。5.3 的公告也完全沒列 SWE-bench Verified 或 Pro,舊版的自述裡有 SWE-bench Pro:5.2 是 62.1、5.1 是 58.4。「5.3 跟 Claude 差幾分」這題,目前沒有公信答案。

Terminal-Bench 官方榜的狀況更微妙。2.1 版榜上 GLM 系列唯一的提交,是 2026 年 5 月 1 日送測的 GLM-5.1(max)搭 Claude Code,58.7%,在榜上墊底;5.2、5.3 未提交;3.0 版榜還在建置中。而 Z.ai 自跑給 Opus 4.8 的 Terminal-Bench 2.1 是 85,Opus 4.8 在官方榜的提交成績是 78.9,差了 6 分。這不是誰動手腳,是自跑環境與官方提交流程本來就不可比;跨廠比較要拿同一個榜的提交數字才算數。真正的麻煩在結構:當一家廠商只公布自跑、不提交公信榜,你手上就永遠只有一種證據。GLM 5.x 現在正是這個狀態,所以「5.3 寫程式到底多強」這題,目前拿得到的答案只有官方版本,獨立驗證還沒到。

引用 5.3 數字時,幫自己分三類:前後代對照,最可信;跨廠自跑,僅供參考;獨立機構,目前只有 GDPval 一條。把自跑的 88.2 直接講成「比 Claude 強」,就是把類別搞混了。

找漏洞的支線:一本 2,436 筆的披露帳本

寫程式之外,5.3 還長出一條別家前沿模型沒有的支線:資安。官方說法有兩句,後訓練過程中,資安能力長得比預期快;CyberGym 的漏洞發現項目拿到 SOTA(state of the art,該項目目前已知最好成績)。跑分之外更有意思的是 Z.ai 把這個能力拿去做了什麼:他們開了一本公開的安全披露帳本,把模型找到的真實漏洞登記在案。到 8 月 15 日為止,帳本有 2,436 個漏洞、橫跨 269 個專案,Critical 級 107 個、High 級 990 個,合計 1,097 個中高風險;已通報並公開的只有 53 筆,其餘 2,383 筆還在保密期。看得到的條目包括 Linux kernel 的 6lowpan UAF、Apple Safari/WebKit、FreeBSD ptrace、GStreamer、Joomla、Suricata。兩個數字最有畫面:最老的漏洞 1981 年就引入,平均潛伏 26.6 年。

GLM-5.3 發現漏洞後,經驗證、保密通報、修補與公開披露的安全工作流
找到漏洞只是起點;保密通報、修補完成與公開披露才構成完整流程。

保密期(embargo)的機制順便說明:漏洞通報後、修補完成前先不公開,避免細節在修好之前流出去變成武器。這像社區警衛發現某戶門鎖有問題,先找鎖匠換鎖,換好才在公布欄貼公告,公告貼早了等於教小偷哪幾戶還沒換鎖。兩者有個差異:門鎖換好風險就結束,軟體漏洞要等使用者把版本升級完成,風險才真正收斂,所以保密期可能拉很長。

帳本還有第三方回執。Apple 的一份 iOS 安全公告在 WebKit 修補段落致謝 GLM 與 z.ai 一次,同一份公告裡 Anthropic 被致謝兩次。廠商公告的致謝欄是可查證的公開紀錄,這種回執的含金量比自跑榜高。

社群流傳的說法要分開看。Hacker News 的討論串裡,一位使用者留言宣稱拿 GLM 找到 WordPress plugin 的 0-day、RCE 與 6.8 kernel 的利用;那是個人實測留言,不是 Z.ai 的官方說法,而且 8 月 15 日抓取的帳本可見條目裡,沒有任何 WordPress plugin。宣稱可以聽,對帳的基礎是帳本。

政策脈絡是資安圈覺得它實用的真正原因:美國前沿模型對滲透測試、漏洞分析這類 security 工作,普遍直接拒答或要求申請;GLM-5.3 沒有這道限制。對防禦方是生產力,對攻擊方同樣是生產力,一個找漏洞能力強的開放權重模型,雙面性擺不掉。Z.ai 用保密期帳本管理披露節奏,方向是對的,但 2,383 筆未公開本身就是一個風險面,這筆帳怎麼透明化,值得持續盯。

獨立側的證據也有,但測的是 5.2。Semgrep 的私有 cyber 基準測 GLM-5.2,偵測 IDOR(存取控制缺失類漏洞)的 F1 是 39%,贏 Claude Code 的 32%,每找到一個漏洞成本約 $0.17。私有集不易污染,這個背書有分量。Z.ai 自己承認 5.2 比 5.1 更容易出現鑽規則漏洞交差的行為(hacking behavior),Semgrep 的結果等於在資安這一格替 5.2 平反,5.3 則還沒有對應的獨立測試。

對一般開發者,這條支線的啟示很實際:把安全審查放進 agent 工作線,讓它在 code review 裡抓存取控制類的問題,這件事的成本已經低到可以常態化,Semgrep 量出來的每個漏洞約 $0.17,與請一次滲透測試是兩個價位的世界。前提講清楚,那是 5.2 的實測,5.3 要等自己的獨立驗證。

能力邊界也要講清楚。ExploitBench 也就是完整利用那一格,5.3 只有 54.4,輸 Fable 5 的 78.0 與 Sol 的 76.5;公告另一段順位裡的閉源模型 Mythos 5(未收進對照表)也排在它前面。找漏洞與打通漏洞是兩件事:前者是找到問題,後者是把問題變成實際可用的入侵路徑。分數顯示 5.3 贏在前者,愈靠近後者,與閉源前沿的差距愈大,而這個規律是 Z.ai 自己列出來的。

Z.ai 官方比較 GLM-5.3 在 CyberGym、ExploitBench 與 ExploitGym 的資安表現
官方資安評估顯示 GLM-5.3 在漏洞發現較強,愈接近完整利用,與部分閉源模型差距愈大。 查看官方來源

per-token 未開賣:Coding Plan 點數制怎麼運作

最實際的先講:GLM-5.3 的 per-token API 還買不到,官方只說 coming soon,Z.ai 定價頁沒有 5.3 的欄位。現在能用的價格基準是舊版:

GLM Coding Plan 的輸入、快取輸入與輸出點數乘數,以及 5 小時與每週雙層額度
輸出與思考的點數乘數最高,成本形狀由輸出占比與快取命中率主導。
路徑輸入快取輸入輸出備註
GLM-5.2 API 官方牌價$1.4$0.26$4.4每百萬 tokens
GLM-5 API$1$0.2$3.2每百萬 tokens
GLM-5-Turbo API$1.2$0.24$4每百萬 tokens
OpenRouter GLM-5.2$0.49未提供$1.54聚合價,約 35 折(省 65%),架上尚無 5.3

要用 5.3 本體,付費入口只有 GLM Coding Plan:

方案定價5 小時額度週額度
Lite$18/月2,000 點10,000 點
Pro約 $80/月12,000 點60,000 點
Max約 $168/月28,000 點140,000 點

Lite 的 $18 是 Coding Plan 官方文件白紙黑字列的數字;Pro 與 Max 是 z.ai 訂閱頁列的定價,頁面另顯示約七折的優惠價($12.6、$56、$117.6),折扣條件與即時價以結帳頁為準。

點數制有幾個規則。額度分兩層:5 小時滾動一輪,每週再一輪總量,吃太凶會先後被卡。GLM-5.3 的點數乘數是輸入 ×6.9、快取輸入 ×1.7、輸出 ×24;快取指同一段開頭內容重複使用時的折扣價。離峰時段再打五折,尖峰定義是新加坡時間週一到週五下午 2 點到 6 點(UTC+8,與台灣同時區),其他時段含週末全是離峰,下班才寫程式的人反而受惠。方案之間的差別看額度形狀:Lite 到 Pro 週額度差 6 倍,價格差約 4.4 倍,愈高檔單位點數愈便宜;真正的分界是 5 小時滾動限額,它決定尖峰時段撐得住多少並行任務。選法建議保守起步:先訂 Lite 實測一週,看自己的點數消耗曲線,再決定升不升級,這比看任何比較文都準。乘數之間的相對關係也值得記:輸出乘數是輸入的三倍多,而模型的思考全算輸出,這就是輸出占比主導整條工作線成本的原因。

點數乘數像影印店的價目表:黑白影印一張一元,大圖輸出一張二十四元;輸入是黑白影印,輸出與思考全算大圖輸出。差別在於:印多少你自己決定,思考的長度是模型決定的,你只能靠 effort 檔位去約束。

官方也給了每週 token 估計,前提是 90.9% 的快取命中率:Lite 43 到 87M,Pro 263 到 526M,Max 613 到 1,226M。九成命中率不是人人有:反覆用同一段開頭的 agent 工作線(專案說明、慣例文件固定)吃得到,一次性長文件分析每次 prompt 都是新的,命中率低很多,同樣點數能跑的量跟著縮水。先判斷自己屬於哪一種,再看官方估計。

一個地雷埋在訂閱裡:在 Coding Plan 指定請求 GLM-5.2 或 5.1,後端會自動路由到 5.3,不另行通知。日常使用方便,做對照實驗是災難;想拿 5.2 當省點數模式或對照組,訂閱內做不到。

免費入口有兩個,但都不完整。chat.z.ai 的免費網頁版,首頁至今標著 powered by GLM-5.2,5.3 還沒上網頁版,PTT 鄉民也注意到同一件事;ZCode 是 Z.ai 新推的免費桌面編碼代理,用的是 5.3,8 月 31 日前有限時 1.5 倍有效額度加成。想零成本摸 5.3 的 agent 手感,ZCode 是目前的門。兩個入口的分工也簡單:chat 適合問答與快速驗證想法,ZCode 才是 agent 工作線的形狀。

同一條工作線的三種月帳單(示意試算)

成本問題現在有個麻煩:5.3 還沒開 per-token,只能用 5.2 牌價類比,等開價後重算。算式全程透明,你可以代自己的數字進去。

比較官方 API、OpenRouter 與 Coding Plan 訂閱三種 GLM 使用成本路徑
按量與訂閱的差別不只在單價,也在暴衝時是帳單上升,還是額度先被卡住。

重度情境(示意):一條每天開著的 agent coding 工作線,每月 300M tokens,輸入佔七成(210M)、輸出佔三成(90M),輸入 90.9% 命中快取。牌價 API 的帳是:快取輸入 190.9M × $0.26 約 $49.6,未命中輸入 19.1M × $1.4 約 $26.7,輸出 90M × $4.4 是 $396,月帳單約 $472,輸出那一筆佔八成以上。OpenRouter 的帳:210M × $0.49 約 $102.9,加 90M × $1.54 約 $138.6,月帳單約 $242;這條報價沒有快取價可採計,估計偏保守,而且架上跑的是 5.2。Coding Plan Pro 每月 $80:官方估 Pro 每週可跑 263 到 526M,一個月按 4.3 週算是 1,130 到 2,260M,300M 綽綽有餘;Lite 換算約 185 到 374M,300M 落在區間上緣,輕量月份勉強,遇到輸出暴衝會被 5 小時限額卡住。

輕度情境(示意):每月 30M tokens 的使用者,同樣構成假設下,牌價 API 約 $47、OpenRouter 約 $24、Coding Plan Lite 固定 $18。說穿了,重度用戶把月費攤到大量 token 上,單位成本被壓低;輕度用戶攤不開,三條路的差距縮小,Lite 的價值在於敢放 max 檔思考,不必心疼每個 token。

情境牌價 API(5.2 價類比)OpenRouter 5.2Coding Plan
重度 300M/月約 $472約 $242Pro $80 綽綽有餘
輕度 30M/月約 $47約 $24Lite $18

這張表的用法:先估自己每月的輸出 token 量,再對號入座;估不準,就先記一週的帳,把實測數字代進算式。敏感度也交代:輸出占比愈高,按 token 的兩條漲愈快,訂閱相對優勢愈大;工作線若輸入為大宗、輸出很短,差距會縮小。快取的經濟學,GPT-5.6 的定價拆解算過同一件事,同一個 prefix 被重複用了幾次才是關鍵;低價 API 這個命題,Grok 4.5 的評測也走過,結論都是看工作線的形狀,不是看牌價絕對值。訂閱壓倒性便宜的另一面也要看:Z.ai 把 per-token 壓著不開、用訂閱先把重度用戶鎖進來,商業意圖不難讀;而按用量遇到 token 暴衝是帳單痛,訂閱遇到暴衝是直接被限額卡到停工,兩種痛不一樣,押訂閱前先想清楚自己的工作線會不會暴衝。

5.2 的前科要記得。Hacker News 有使用者兩天燒完週額度,cline 的 GitHub issue 有人回報 token 計數高得離譜,5.1 升 5.2 時推理 token 從 16.7K 翻倍到 36.7K。官方宣稱 5.3 有改善(私有榜每題消耗從約 96K 降到約 75K),獨立側還沒有系統性驗證,社群裡仍有人看到 500 token 的 prompt 跑出 5,000 token 的思考。老實說,自己記帳,別信任何人的「感覺比較省」。

接進 Claude Code:一個端點與三個地雷

接法不難,難在地雷。官方文件明列支援的工具是 Claude Code、Cline、OpenCode,The New Stack 的報導另提到 Codex。共通原則是走 Anthropic 相容端點(路徑 /api/anthropic),這些工具都吃這種端點,所以接法一致:工具不用換,在它眼裡就是一個 Anthropic API,把端點與金鑰換成 Z.ai 的即可;欄位名稱照官方文件抄最穩。Claude Code 的環境變數設定做法站上有完整教學,改法沿用,只換那兩個值。相容端點的設計對使用者的意義是零遷移成本:不換工具、不換工作流、不重學指令,換的只是帳單寄到誰家。

GLM-5.3 接入 Claude Code 時需確認 Anthropic 相容端點、1M tag、thinking 設定與自動路由
設定看似只換端點與金鑰,真正容易出錯的是 tag、thinking 與自動路由。

地雷一,tag 要寫對。要吃到 1M context,在 Claude Code 用 glm-5.3[1m] 這個 tag,The New Stack 特別點出這個細節。

地雷二,thinking 關不掉。沿用 thinking.type 的 disabled 寫法會讓請求直接失敗,要改成 enabled 加 reasoning_effort low 才能過;升級舊 script 的人幾乎必踩。

地雷三,自動路由壞對照。訂閱內點 5.2 或 5.1 會被靜默導向 5.3,要做 A/B 對照得走不同入口,例如一邊 OpenRouter 的 5.2、一邊訂閱的 5.3。工具之間怎麼分工,Codex 與 Claude Code 的分工解析談過同樣的原則:不同任務接不同模型,比硬拗一個工具全包更省。習慣 OpenAI 那套的人,OpenAI Codex 的操作教學是另一條對照線。

第一次接,驗收抓兩件事。確認設定真的生效:端點、金鑰、tag 三個值逐字對官方文件,自動路由讓設錯不一定有錯誤訊息。建立基準線:挑一個熟到不能再熟的小任務,記下第一天的 token 消耗,之後每天對照,暴衝當天回頭查是哪個請求吃掉的。這兩步走完,「5.3 適不適合我」的答案會比任何評測都可靠,因為證據是你自己的帳本。

五種人、三條路:誰該現在進場

答案先放進表裡,理由列在後面。

依重度 Agent、一般開發者、學生、團隊採購與本機部署需求選擇 GLM-5.3 使用路徑
先辨認自己的用量與風險,再選免費試用、按量使用或訂閱方案。
你是誰免費入口API 按 tokenCoding Plan 訂閱什麼情況轉向
重度 agent 用戶只夠試水溫帳單難預測主力,Pro 起跳任務要吃圖片就別當主力
一般開發者chat 夠用5.2 低價即可多半用不滿5.3 開 per-token 再評估
學生與預算緊ZCode 加 chatOpenRouter 5.2先免費跑一個月點數燒完回免費入口
團隊採購評估用等正式計價等獨立榜提交要公信數字當採購依據就先等
本機部署玩家等權重釋出不適用不適用8 月 28 日後看授權與檔案規模

重度 agent 用戶直接看訂閱,Pro 起跳:免費入口只夠試水溫,按 token 對每天開著的線帳單難預測,先決條件是任務不依賴圖片輸入。一般開發者每週用幾次,免費 chat 加 5.2 低價 API 夠用,訂閱容易變閒置支出。學生與預算緊的,ZCode 在 8 月 31 日前有 1.5 倍加成,先當免費的 coding 終端機用,養成工作流再談付費;終端機 coding agent 的節奏,Muse Code 的解析有另一套可參考。團隊採購等兩份文件再動:正式定價頁與獨立榜提交紀錄,把還沒開價、還沒送測的模型排進生產管線,流程上說不過去。本機部署玩家等 8 月 28 日前後:5.2 權重拆成 282 個分片檔(shards,模型檔案切成的下載單元)、合計約 1.4 到 1.5TB(BF16),5.3 同基座、規模同一量級,消費級硬體出局,網路上「幾張卡就能跑」的說法目前都沒有官方依據。

矩陣的使用方式很簡單:先找自己的那一列,再看轉向欄;若兩邊條件都符合,代表正處在分流點,先用免費入口把不確定性消耗掉再花錢。

可用性、社群溫度與 8 月 28 日的開源節點

可用性本身沒有障礙。官方沒有公告任何台灣專屬限制;入口分兩個,z.ai 國際版美元計價訂閱,bigmodel.cn 是中國版,人民幣計價並綁中國手機號,不在中國大陸的使用者走 z.ai 就好。付款過不過、有沒有收據,以結帳頁當下顯示為準。

GLM-5.3 從目前訂閱入口,到權重、授權、檔案規模與部署框架確認的檢查點
權重上線只是開始,授權、檔案規模、獨立實測與部署支援都要逐項確認。

社群溫度可以參考。PTT AI_Art 板在發布當天有討論串,反應三種都有:驚嘆後訓練的跳躍、拿 Kimi K3 的訂閱價來比、抱怨沒有視覺輸入而且網頁版還停在 5.2。Threads 有台灣使用者貼 5.2 與 5.3 搭 OpenSpec 工作流的實測,評價是好用、速度不算快、沒有圖片輸入,部分評分超過 Opus 4.8 但沒到 Fable 5 或 Sol 的水準。Hacker News 的訊號偏正面:比特幣核心開發者 Gregory Maxwell(帳號 nullc)說 5.2 是唯一沒讓他定期被說謊弄到疲勞的模型;另一位使用者 varshar 回報,5.3 首次能對 55K 行的 Clojure 專案寫出 2K 行 PR 等級的實質規劃。

台灣科技媒體截至 8 月 15 日零報導,繁中第一手整理目前是真空,中文圈現有的 5.3 內容多半是簡中官方文件的轉述。搜尋「GLM-5.3 vs Claude」排前面的比較文,甚至是發布前一個月就寫好的猜測文,內文自己聲明 5.3 當時尚未發布。看到沒標日期、沒交代成績單是誰跑的比較,先打折扣再看。

開源是下一個節點。官方承諾發布後兩週內、安全評估完成後釋出權重,以 8 月 14 日換算是 8 月 28 日前後;HuggingFace 上 zai-org/GLM-5.3 目前回 401,還拿不到。GLM-5.2 的先例是 MIT 授權、282 個 shards、BF16 下載量約 1.4 到 1.5TB;5.3 的授權依 5.2 慣例推測是 MIT,但在儲存庫上線前,那只是推測,不是承諾。8 月 28 日前後會有第二波搜尋與實測潮,屆時回頭看榜單與授權,資訊會比現在完整得多。

開源後看四件事:授權條款是否沿用 MIT、有沒有附加使用限制;檔案規模與拆分方式,直接影響下載與部署成本;社群第一週的量化實測,特別是對照 5.2 的 token 消耗;部署框架的支援進度。四項到位,本機部署的討論才有基礎。等待期的功課不浪費:用 ZCode 或 Lite 訂閱把自己的基準線跑出來,權重釋出、獨立實測出爐時,你手上已經有自己的數字可以對照,判斷會比從零開始的人快一截。

六種情況,先不要選 GLM-5.3

限制直接列。任務需要視覺輸入的,出局:UI 截圖對照、設計稿、圖片除錯,純文字是它的邊界。要求互動速度的,觀望:社群實測的一致意見是不快,長思考又關不掉,輕量小改動用它是繞路。要做嚴謹模型對照的,換場地:訂閱內的自動路由會把 5.2 與 5.1 的請求靜默導向 5.3。採購需要公信數字的,再等:SWE-bench Verified 沒有 GLM 5.x 的提交,Terminal-Bench 官方榜也沒有 5.3,獨立數字只有 GDPval 一條,Semgrep 測的還是 5.2。token 預算緊的,小心:輸出乘數 ×24,5.2 有推理 token 翻倍的前科,5.3 的改善目前只有官方自述。要本機部署的,8 月底前別動:權重還沒釋出,一切顯卡需求與部署教學都是猜的。

GLM-5.3 適合純文字長任務與大型重構,但不適合視覺輸入、低延遲與嚴謹跨模型比較
模型的價值取決於短處是否踩中工作線;先畫清邊界,比只看跑分更實用。

把限制反過來,就是它的最佳使用區:純文字的大型重構、長時間 agent 任務、以省錢為前提的 code review 與安全審查、需要 1M context 的巨型專案。這四種工作,它目前的性價比很難有對手;離開這個範圍,缺點會開始蓋過優點。挑模型跟挑工具一樣,重點不是它多強,而是它的短處會不會正好踩在你的工作線上。

下一步怎麼走:15 分鐘、1 小時與兩個等待節點

15 分鐘版本:裝 ZCode,丟一個手上的真實小任務進去,不用 hello world 等級的例子;8 月 31 日前有 1.5 倍有效額度加成,零成本換第一手手感。

GLM-5.3 的 15 分鐘試用、1 小時基準測試與權重及定價等待節點
先用小任務建立自己的基準線,再等權重與正式定價補齊不確定性。

1 小時版本:已經在用 Claude Code 的人,照官方文件把端點換成 /api/anthropic,tag 用 glm-5.3[1m],同一條工作線跑一週,自己記 token 帳,對照三條路的試算表。記帳時輸入、快取、輸出分開記,三者的乘數不同,混成一桶會對不上消耗,你會以為被坑,多半其實是輸出那欄在燒。

等待版本:兩個節點後再下重本。8 月 28 日前後權重釋出,看社群實測與授權條款;per-token 定價公布後,把三條路的試算重跑一遍。主線兩個月一代的節奏,等第二手情報再進場,成本通常更低。

常見問題

GLM-5.3 打得贏 Claude Opus 或 GPT-5.6 嗎?

看引用誰的數字。Z.ai 自跑的表上,5.3 對 Opus 4.8 八個共同基準贏七格,只輸 SWE-Marathon,但那張表連競品分數都是 Z.ai 跑的,跨廠不能直接比。獨立可查的數字裡,GDPval-AA v2 的 Elo 1769 高於 Opus 4.8 的 1588;Terminal-Bench 與 SWE-bench 兩個官方榜,Opus 系列有提交、GLM 5.3 沒有,同一套跑法的公平對照目前不存在。白話講:通用任務有獨立數字支撐它領先,寫程式對決只有官方自跑版本。

GLM-5.3 什麼時候開放權重下載?一般電腦跑得動嗎?

官方承諾發布後兩週內、安全評估完成後釋出,換算是 2026 年 8 月 28 日前後。截至 8 月 15 日,HuggingFace 上 zai-org/GLM-5.3 回 401,還下載不到。GLM-5.2 的先例是 MIT 授權、282 個 shards、約 1.4 到 1.5TB(BF16),5.3 同基座、規模同一量級,一般消費級硬體不用想;網路上「幾張卡就能跑」的說法沒有官方依據。授權以儲存庫上線當下的標示為準,目前說 MIT 只是依 5.2 慣例的推測。

有免費管道用得到 GLM-5.3 嗎?

有,但只有半套。chat.z.ai 的免費網頁版目前還是 GLM-5.2,首頁就標著 powered by GLM-5.2,拿它試不出 5.3 的味道;ZCode 是 Z.ai 新的免費桌面編碼代理,用的是 5.3,8 月 31 日前有 1.5 倍有效額度加成。要零成本摸 5.3 的 agent 手感,ZCode 是唯一的門。

GLM Coding Plan 的 Lite 每月 $18 夠用嗎?

看用量形狀。官方估 Lite 每週 43 到 87M tokens(90.9% 快取命中假設),每週用幾次的輕量線夠用;每天開著跑的 agent 線,輸出乘數 ×24 會讓點數燒很快,Pro 起跳比較安全。兩個隱藏成本要算:台灣時間平日下午 2 點到 6 點是全額乘數,其他時段含週末是離峰半價;訂閱內的自動路由讓你沒有退回 5.2 省點數的選項。

訂了 Coding Plan,還能指定用 GLM-5.2 省點數嗎?

不能。在 Coding Plan 裡請求 GLM-5.2 或 5.1,後端會自動路由到 5.3,不另行通知,官方把它寫成特性而不是地雷。日常使用很方便,做 A/B 對照會被壞掉;想拿 5.2 當對照組,得走不同入口,例如 OpenRouter 的 5.2。

台灣怎麼訂 GLM Coding Plan?怎麼付款?

z.ai 國際版就是入口,美元計價訂閱,官方沒有公告任何台灣專屬限制;bigmodel.cn 是中國版,人民幣計價並綁中國手機號,不在中國大陸的使用者走 z.ai 就好。付款方式與收據,以結帳頁當下顯示為準。訂之前先用免費的 ZCode 確認 5.3 的手感,chat 網頁版目前還是 5.2,拿它試不出 5.3 的味道。

GLM-5.3 的繁體中文表現如何?

官方規格卡列的是 context、輸出上限與思考檔位,沒有語言清單,成績單上也沒有繁中專屬數字。實際使用訊號是正面的:PTT 有討論串,Threads 有台灣使用者的實測心得,中文圈已把它放進日常工作流。要繁中品質的證據,目前只能靠社群實測累積;快速自測的方法,是拿一段你寫過的繁中技術文件丟給它改寫,跟自己的版本對照。

統計學的 GLM 跟這個 GLM 是同一個東西嗎?

無關。統計學的 GLM 是廣義線性模型(Generalized Linear Model),迴歸分析的一族;這裡的 GLM 是智譜的模型系列名稱。搜資料時加上 Z.ai 或智譜當關鍵字,不然會撈到一堆統計教材。

留下你的問題或補充

你的電子郵件不會被公開。