Grok Build 是 xAI 在 2026 年 5 月推出的終端機編碼代理,一個裝在命令列裡、讀得懂整個 codebase 的 AI 助手:它會改檔案、執行 shell 指令、搜網路、看顧長時間任務,可以互動操作,也能進腳本與 CI。8 月 12 日起改由 Grok 4.6 驅動,版號已到 v1.0.5,官方說法仍然是 beta。
重點先看
Grok Build 是 xAI 的終端機編碼代理,2026 年 5 月 14 日以早期 beta 登場,8 月 12 日起由 Grok 4.6 驅動,最新版 v1.0.5。版號到 1.0 不等於正式版,官方字眼從頭到尾都是 beta。
它跟 grok.com 聊天室的 Grok、8 月 19 日上線的對話版 Grok Build、API 上的 grok-build-0.1 模型是四個不同的東西,查資料前先分清楚。
免費層已開放試用;SuperGrok 月費 $30、SuperGrok Plus $100。SuperGrok Heavy 的價格官方頁沒列,5 月媒體報導約 US$299 到 $300。
7 月它被抓到把整個專案連 git 歷史打包上雲,7 月 12 日起伺服器端預設關閉,兩天後開源。敏感專案仍然要自己隔離。
現在就能做:花 5 分鐘用官方 curl 腳本安裝,在免費層丟一個小任務試手感;再花 10 分鐘檢查隱私設定與專案隔離,把不該出門的東西留在門內。
名字先拆開:Grok Build 到底指哪一個
2026 年的「Grok」是個很擠的牌子。xAI 在 2026 年 2 月 2 日宣布併入 SpaceX,對外品牌改稱 SpaceXAI,官方文件有時署 SpaceXAI、有時署 X.AI LLC,講的都是同一家公司。用 xAI 稱呼就好,品牌細節不影響使用。
真正會絆倒人的是產品名,而 GitHub 上的 grok-build repo 給的定義很清楚:Grok Build 是 xAI 的終端機 AI 編碼代理,以全螢幕 TUI(在終端機裡畫出來的圖形介面)執行,理解你的 codebase、編輯檔案、執行 shell 指令、搜尋網路、管理長時間任務;可以互動使用、可以 headless 模式跑腳本與 CI,也可以透過 Agent Client Protocol(ACP)嵌進編輯器。在 官方文件的總覽頁 裡,同一件事用更短的話講:一個強大而且可以擴充的編碼代理。你在終端機輸入指令、它在你專案目錄裡動工的,就是這一個。

這個品類在 2026 年已經很擁擠。Claude Code 與 OpenAI 的 Codex 都比它早一年多上線,媒體從發布第一天就把它放在挑戰者的位置上報導,而不是下一個殺手。這個定位解釋了它的相容設計與定價節奏;7 月的隱私事件,同樣要從挑戰者的處境才看得懂。終端機編碼代理解決的問題也不難講:以前你把程式碼貼進聊天視窗、把回答貼回編輯器,來來回回;代理直接活在專案裡,讀檔、改檔、跑指令、回報結果,中間的人工搬運整個消失。
手上有 Claude Code 或 Codex 的人,真正要判斷的不是「哪個最強」,而是多一個便宜、平行、設定共通的工具值不值得放進工作流。
網頁端的兩個近親:聊天 Grok 與對話版 Grok Build
grok.com 上的聊天 Grok 是一般助理,活在瀏覽器裡,碰不到你的檔案系統。麻煩的是 8 月 19 日之後,聊天介面裡多了一個也叫 Grok Build 的東西。依當天的官方公告,這條產品線讓你在對話裡描述一個 App、遊戲或網站,它當場生成並發布到 grok.me,全方案可用;它在 7 月以 Early Beta 之名起步時,只限 SuperGrok Heavy。
官方在公告裡用「Grok Build for the terminal」稱終端機版,等於自己承認名字撞了。判斷方法很簡單:要下載安裝、跑在你專案目錄裡的是終端機版;在聊天框打字就生出網頁的是對話版。Grok 家族成員的相對位置,可以對照 Grok 系列總覽,生態裡還有 Grok Bot 這類代理產品,名字同樣容易攪在一起。
API 上的 grok-build-0.1 是模型,不是這套 CLI
另一個撞名的東西叫 grok-build-0.1。它是 5 月 29 日前後上線 API 的編碼模型,256k context,名字裡有 Build,但它不是你安裝的那個命令列工具,而是模型本身。把它跟終端機版混為一談,查價格會查錯表、查功能會查錯產品。模型跟產品的關係像引擎跟整台車:API 定價表上的 grok-build-0.1 是引擎,終端機裡的 Grok Build 是那台車。
時間軸:從封閉 beta 到 v1.0.5
判斷一個快速變動的產品,看它的節奏比看它的宣傳頁有用。Grok Build 從 5 月到 8 月走了四個大節點:封閉 beta 登場、隱私風暴與開源、v1.0.0、Grok 4.6 進場。6 月則是功能密集期,Plugin Marketplace、Agent Dashboard、/goal 長跑自主任務在 6 月到 7 月之間接連就位。

功能推得快,兩個月內從插件市集一路長到長跑任務;修補也發生得快,但修補發生在你看不到的伺服器端,changelog 不一定會告訴你。這件事在 7 月的伺服器端修復會看到實例。
5 月登場:SuperGrok Heavy 限定的早期 beta
2026 年 5 月 14 日,Grok Build 以早期 beta 上線,同日出現在 xAI 官網與 Hacker News。發布日是 5 月 14 日;公告頁日期欄的 5 月 25 日,是後來改版留下的 metadata。
起步門檻很高,AI Business 在 5 月 18 日的報導寫它「aims to rival Anthropic’s Claude Code and OpenAI’s Codex」,並註明初期 beta 限 SuperGrok Heavy 訂閱者、月費 $300 起,同週另有三家英文媒體跟進。
7 月:上傳風暴、修復、開源
7 月是這個產品故事的主戰場。7 月 8 日 v0.2.93 發布;7 月 12 日,研究者 cereblab 的整包上傳分析在 Hacker News 引爆(539 分、229 則留言),xAI 隨後在伺服器端停用預設上傳;7 月 13 日 v0.2.100 讓 session 選單可以續跑 Claude Code、Codex、Cursor 的近期 sessions。
7 月 14 日 The Register 報導事件、Musk 承諾刪除已上傳資料、GitHub repo 建立;7 月 15 日以 Apache-2.0 開源(HN 另一串 590 分、644 則留言);7 月 22 日 Workflows 功能預設開啟。三天之內,這個產品從被抓包走到交出原始碼。危機處理的速度本身是訊息:它先在伺服器端把預設上傳關掉,緊接著開源讓你自己看,修的順序透露了它把哪種風險擺在前面。
8 月:v1.0.0、Grok 4.6,以及仍然是 beta
8 月 7 日,版號走到 v1.0.0。8 月 12 日 Grok 4.6 發布,官方公告寫「Grok 4.6 is available today in Cursor and Grok Build」,並附帶上線首週 2x 內含量的促銷。8 月 15 日 v1.0.5,截至 8 月 25 日仍是最新版,repo 最近一次 push 在 8 月 24 日。
版號 1.0 容易被讀成「正式版」,但官方 changelog 的措辭仍是「Grok Build is now available in beta」。從頭到尾,xAI 沒有用過 GA 或正式版這個字眼。如果你在 8 月中看到「Grok Build 正式版」的說法,那是把版號 1.0 誤讀成 GA。把它當成 1.0 版的 beta 產品看待,期待值才會準。
它實際能做什麼
形態上它不是網頁聊天,而是佔滿終端機的應用程式。官方文件形容它是全螢幕、滑鼠可點的互動體驗,有面板與選單。這個形態決定了它的目標族群是每天活在終端機裡的人,它省下的不是打字時間,是你一天裡來回切視窗的次數。實際的工作節奏是:在 TUI 裡打一段任務描述,看它提出修改、檢視 diff、逐項核准;長任務丟背景跑,回來收結果。

週邊功能不少:/code-review 內建程式碼審查、沙盒化執行、背景任務(/loop 最多 50 個排程、7 天過期)、跨 session 的 Memory(預設關閉)、語音聽寫,以及 session 的 fork、rewind 與續跑。記憶預設關閉,跨 session 累積脈絡很方便,但也代表更多內容被留在服務端,這個決定權官方留給使用者。另一個常被問到的項目是沙盒化執行:官方把它列為功能,但範圍與強度沒有獨立文件,拿它當唯一防線之前,先自己驗過。
子代理與 Workflows:平行工作的兩種規模
子代理(subagents)是它的分工單位。官方文件寫內建 general-purpose、explore、plan 三種子代理,每個都是擁有自己 context 的獨立子 session,結束時回傳摘要給母代理,可以放進獨立的 git worktree 平行跑。獨立 context 的意義可以講白一點:搜尋與試錯的過程發生在子代理自己的記憶裡,母代理只收最終的摘要,context 不被中間過程灌爆;worktree 隔離則讓多個代理平行改碼時不互踩檔案。這兩個設計加起來,才撐得起更大規模的派工。
說到規模,第三方報導普遍加碼寫「最多八個並行」,但官方頁面只說子代理平行運作,從沒給過數字,引用這類說法時留點警覺。
Workflows 是更大尺度的版本,7 月 22 日起預設開啟。官方新聞的一句話描述是:把任務拆給數百個平行代理、驗證結果、在一次背景執行裡回報的編排腳本。「驗證後回報」是關鍵字:腳本會檢查結果再彙報,不是把任務丟出去就不管。子代理是派幾個人出去辦事,Workflows 是開一整個專案編制,適合大批量、可各自驗收的工作,例如對一批檔案做同樣的重構或補測試。
Plan Mode 的官方但書
/plan 或 Shift+Tab 進入計畫模式。實際用法是先讓它讀專案、出計畫,你逐項評論或整段退回重寫,核准之後它才動手,之後每次修改都是乾淨的 diff,方便逐條審。但官方文件自己交代了限制:plan mode 擋的是編輯工具,不是 shell,bash 仍能用重定向寫檔,而且子代理不受母代理的 plan mode 管束。把它當「先看計畫再動手」的流程設計,不要當安全圍欄。
headless、ACP 與模型選擇
離開互動模式,grok -p "提示" 可以跑腳本與 CI,輸出 plain、json 或 streaming-json,--json-schema 能約束 JSON 結構。這讓它不只是一款互動工具:CI 裡跑程式碼審查、腳本裡批次產生結果,用固定的 JSON 結構拿輸出,下游才好解析。要走 IDE 整合,grok agent stdio 以 JSON-RPC 把它接進其他 app。

模型也不鎖死:/model、-m 或 grok models 可切換,官方文件寫「Grok 支援任何自訂模型」,透過 ~/.grok/config.toml 能接 OpenAI 相容端點或自架推理;6 月起連 Composer 2.5 都能從選單選用。對想省成本或想換模型的人,這是比訂閱方案更自由的口子。
怎麼安裝?Windows 能用嗎
macOS、Linux 與 Windows 的一行安裝
官方安裝管道是一行腳本。macOS、Linux 與 Git Bash 用 curl -fsSL https://x.ai/cli/install.sh | bash;Windows PowerShell 用 irm https://x.ai/cli/install.ps1 | iex。預建 binary 覆蓋 macOS、Linux 與 Windows,不需要先裝 Node.js 或其他執行環境,因為它是 Rust 寫成的單一執行檔,有 HN 使用者以 scc 統計出約 135 萬行 Rust 的量體。
第一次啟動建議在一個乾淨的測試資料夾裡做:grok 一敲,瀏覽器跳出 auth.x.ai 的 OAuth 登入頁,登完回到終端機,TUI 就起來了。grok models 可以列出可選的模型清單,先確認你要的模型在不在。
Windows 的但書在原始碼自建那條路:README 官方自認「Windows builds are best-effort and not currently tested from this tree」。走 PowerShell 預建版的一般使用者不受影響,想從原始碼編 Windows 版的人要有心理準備。多數人其實碰不到這條路,會走到自建通常是為了資安審查或客製化需求,那已經是進階情境。
npm 套件、brew 陷阱與登入
npm 上有 xAI 官方套件 @xai-official/grok,latest 版號 1.0.5 與 CLI 同步,企業部署文件也把它列為安裝法,想在 CI 或艦隊上統一版本的公司走這條路比腳本好管理。Homebrew 那邊要小心:brew 沒有官方 formula,搜得到的 grok 是 jordansissel 寫的 regex 工具,同名不同物,裝錯不會報錯,只會多一個用不上的指令。

登入走瀏覽器 OAuth,首次啟動會自動開瀏覽器。無瀏覽器的環境有兩條路:export XAI_API_KEY="xai-..." 之後直接跑 grok,或 grok login --device-auth 走 device-code 流程;企業環境可以接 OIDC SSO。

要多少錢?免費層、訂閱與 API 價格
訂閱方案與免費層
費用的現況比 5 月友善很多,官方定價頁列出 Free $0、SuperGrok $30/月(Grok 4.6 模型、更高限額)、SuperGrok Plus $100/月(官方描述是在 Chat、Imagine、Voice 與 Build 上明顯更高的用量)。xAI 也在產品頁寫上「Available to try for Free」,免費試用層已經開放;發布公告裡的資格句是「Available now to all SuperGrok and X Premium Plus subscribers」,X Premium Plus 訂閱者也算在內。從 5 月的 Heavy 獨占到 8 月的免費試用,幾個月內門檻一路往下修,這是後進者搶使用者的常見節奏。

用量制度是一個池子。官方 FAQ 的講法是一個共享的每週用量池,跨 Grok 產品自由分配,Build 用多了 Chat 就少。官方沒有公布任何數字配額,網路上流傳的具體 request 或 token 上限,來源都靠不住。重度 Build 工作會擠壓同一池的 Chat 與 Imagine 用量,團隊導入前先把分配規則談好,比事後才發現互搶額度省事。
方案的歷史變化與細節,SuperGrok 的方案解析另有整理。對照現況看比逐頁翻快:
| 方案 | 月費 | 適合誰 | 主要限制 |
|---|---|---|---|
| Free | $0 | 試手感、跑小任務 | 與所有 Grok 產品共用每週用量池,官方未公布配額 |
| SuperGrok | $30 | 要用 Grok 4.6 與更高用量 | 同一個池,重度使用會互相排擠 |
| SuperGrok Plus | $100 | Chat、Imagine、Voice、Build 一起重度用 | 官方未給出明確倍率 |
| SuperGrok Heavy | 官方頁未列價 | 5 月 beta 期的唯一入口 | 頁面上就是找不到價格,計價要另向官方確認 |
SuperGrok Heavy 的價格是個小謎。定價頁的比較表有 Lite 與 Heavy 欄位,Heavy 的價格卻沒出現在頁面文字裡。5 月的報導裡 AI Business 與 CIO Dive 寫 $300;6 月起 Developers Digest 與 vanja.io 寫 $299(含首期 $99 促銷六個月)。媒體報導約 US$299 到 $300,數字就停在這個區間。對採購的人來說,價格不透明代表方案層級還在變動,預算先以官方頁列出的級距為準。
API 價格:另一種付費思路
不想綁訂閱、或想把 Grok 模型放進自己服務的人,走 API 按用量計費。依官方開發者定價(USD、每百萬 tokens):grok-4.6 在 prompt 低於 200k tokens 時輸入 $2.00、快取輸入 $0.50、輸出 $6.00;達到 200k 以上切到 $4.00、$1.00、$12.00。想看模型世代的差異,前代 Grok 4.5 的介紹與計價另有拆解。帳目直接看表:
| 模型 | 輸入 | 快取輸入 | 輸出 | 備註 |
|---|---|---|---|---|
| grok-4.6(prompt 低於 200k) | $2.00 | $0.50 | $6.00 | 每百萬 tokens,USD |
| grok-4.6(200k 以上) | $4.00 | $1.00 | $12.00 | 長 context 加價 |
| grok-4.5 | $2.00 | $0.30 | $6.00 | 前代模型 |
| grok-build-0.1 | $1.00 | $0.20 | $2.00 | 256k context 編碼模型,限 API |
訂閱與 API 的選擇,帳是這樣算的:訂閱是固定月費換一個共享池,適合把 Grok Build 當日常工具的人;API 按 token 計費,適合想把 Grok 模型塞進自己服務、或用量極端不規則的人。個人試用從免費層開始最省事,重度使用再逐級往上。Grok 4.6 上線首週在 Grok Build 與 Cursor 內有 2x 內含量,這是 8 月 12 日公告的促銷,只限首週。
Claude Code 的設定能直接搬過來嗎
官方文件裡少見把話講這麼滿的一句:「Grok is fully compatible with Claude Code with zero configuration needed.」與 Claude Code 完全相容、零設定。對已經有一套 Claude Code 工作流的人,這句話的分量比任何基準分數都重。

零設定相容涵蓋的範圍
檔案層它自動讀 CLAUDE.md、.claude/rules/ 這些 Claude Code 的設定檔;命令列層 Claude Code 的旗標名稱可以直接當別名用,例如 --allowedTools、--dangerously-skip-permissions;工作階段層 grok import 能匯入 Claude Code 的 sessions,v0.2.100 起 session 選單可以續跑 Claude Code、Codex、Cursor 的近期 sessions。換工具不等於換習慣,這是它最狠的設計。
實際搬遷的樣貌是:在一個已經有 CLAUDE.md 的專案裡啟動 grok,規則直接生效;習慣的旗標照打;grok import 把舊 sessions 帶進來,選單裡 Claude Code、Codex、Cursor 的工作都能續跑。試用成本因此非常低。相容是官方宣稱,重大專案要謹慎的話,先在分支上跑一輪再說。
相容也不是憑空變出來的。repo 的第三方宣告檔寫明,部分實作是 openai/codex 與 sst/opencode 的 in-tree 移植。挑戰者把兩個前輩的介面標準吃進來,使用者搬家的摩擦就被壓到最低。
AGENTS.md、MCP 與其他既有資產
生態層的東西都接得上:AGENTS.md、plugins、hooks、skills、MCP servers 開箱即用,/skillify 還能把一個 session 現場存成可重用的 skill。已經為 Claude Desktop 設過 MCP 的話,那套設定搬到 Grok Build 的成本很低。累積過技能與工具清單的團隊,換或並用的額外工程幾乎是零。
7 月隱私事件:整包 repo 上雲的完整還原
判斷要不要裝一個會碰你整個專案的工具,7 月這段是必讀的。它同時解釋了這個產品的風險性格、修復的方式,以及開源為什麼來得那麼快。

金絲雀測試量到了什麼
研究者 cereblab(自稱 Independent AI Safety Checker)在 7 月 12 日發布針對 v0.2.93 的 wire 層分析,核心發現是:它上傳整個 repository,每個追蹤中檔案的內容加上 git 歷史,跟代理實際讀了什麼無關。
數字很有畫面。金絲雀測試的做法是在專案裡放誘餌,看什麼會被送出門;這次用了一個 12 GB 的專案,5.10 GiB 經 storage endpoint 上傳、零失敗,而真正送進對話給模型的內容只有約 192 KB。換句話說,模型需要的跟被送走的天差地遠,多出來的那 5 個多 GB 是「組裝 context」用的庫存。目的地是 Google Cloud Storage 上名為 grok-code-session-traces 的 bucket。.env 裡的 secrets 逐字未遮蔽,「Improve the model」的開關開或關都照樣上傳,The Register 的報導補了一個更刺的細節:連下了刪除指令的 git 歷史裡、幾個月前已刪的 secrets 都一起上去。使用者災情由開發者 Willison 轉述,有人回報上傳了「我的 SSH 金鑰、密碼管理工具的資料庫、文件、照片、影片,全部」。
修復真相,跟 /privacy 面板無關
修復的方式,跟多數人以為的不一樣。開發者把 disable_codebase_upload 設為 true 之後,上傳才停,這是一個沉默的全域旗標;介面裡的 /privacy 面板控制的是資料保留(retention),不是傳輸(transmission)。修復最終在伺服器端完成,CLI 的 changelog 完全沒有記錄這件事。
這個組合告訴你兩件事。隱私設定面板給人的安全感,跟實際的傳輸行為可以完全脫鉤;修復可以不著痕跡地發生在你安裝的版本之外。依賴介面選項或版本紀錄來判斷「它現在傳了什麼」,從結構上就不可靠,可靠的是對流量的實測。
xAI 事後的說明是:早期 beta 對非 ZDR(零資料保留)使用者預設開啟資料保留,7 月 12 日起全員預設關閉。ZDR 是企業合約裡「服務端不保留你的內容」的承諾,換句話說,5 月到 7 月中之間,沒有簽這類條款的一般使用者都落在會被保留的那一側。Willison 在開源後檢視程式碼,upload/gcs.rs 這個檔案還在,但 upload_session_state() 現在直接回傳 session_state_upload_unavailable。Musk 的承諾,The Register 在 7 月 14 日的報導裡引述:「作為預防措施,目前為止上傳到 SpaceXAI 的所有使用者資料都會被完全徹底地刪除,任何東西都不會留下。」The Register 同時註明,他們無法獨立驗證資料真的刪了。
同類對照、緩和觀點與現在的狀態
cereblab 的分析裡有對照組:Claude Code、Gemini CLI、Codex 這些同類工具只開啟個別檔案,不是把整包 repo 打成 Git bundle 上傳。這是這次事件裡,Grok Build 真正與眾不同之處。
緩和的觀點也存在,講公平一點。HN 的討論指出,任何雲端代理理論上都能在伺服器端重組你的 codebase,Grok 被抓到的是更積極的 context 組裝;修復之後有使用者重測,已無法重現上傳。也有單一使用者觀察到副作用,HN 的 dimgl 寫停用之後「代理不再即時回應了」。同一個 5 月,DevOps.com 在 5 月 15 日的報導裡寫它「local-first,原始碼不會傳到 xAI 的伺服器」,兩個月後這句話就被研究者的流量實測推翻。
如果你已經在用,自查可以怎麼做
事件過後的基本功,照做一遍比讀十篇評論有用。把敏感專案放進獨立資料夾,工作目錄裡不放金鑰與 .env 這類機密;記得 git 歷史會跟著專案走,幾個月前刪掉的 secret 不等於不存在,輪替金鑰才是根治。要看它實際送出什麼,學 cereblab 放誘餌檔做金絲雀測試,比相信面板選項可靠。分清楚 /privacy 管保留、disable_codebase_upload 管傳輸,兩個開開關關不互相取代。持續追 changelog 與 repo 的變化,因為修復可能發生在伺服器端,版本紀錄不會告訴你。
開源開了什麼,沒開什麼
7 月 15 日,xAI 以 Apache-2.0 授權把 Grok Build 放上 GitHub,開源公告的時間點緊跟在隱私事件之後,HN 上普遍把它讀成止血動作。截至 8 月 25 日,repo 有 26,013 顆星、4,887 個 forks,最近一次 push 在 8 月 24 日。

唯讀開源:看得到,改不了
這不是一般意義的社群開源。README 寫「External contributions are not accepted.」,CONTRIBUTING.md 進一步說明不接受外部 pull request 或主動修補,SpaceXAI 內部開發,公開樹是為了原始碼透明與本地建置;Issues 與 Discussions 都是關閉的。程式碼從內部 monorepo 定期同步,每次同步是整批壓縮的 commit,repo 目前累積 37 個 commit,逐次的開發史看不到。Willison 在 7 月 15 日寫的「單一初始 commit」是當時的快照,現在已經過時。
唯讀不代表沒價值。透明讓任何人都能審它的程式碼,Willison 對修復的驗證就是這樣來的;批次壓縮的 commit 讓你看不到開發史,但程式碼本身攤在陽光下。
開源的動機,官方公告寫「Publishing the code is the most direct way to build toward a robust and reliable harness.」,講的就是用公開換可靠。HN 也有人把開源解讀為戰術,其中「xAI 市占不到 1%」的說法出自單一留言,屬於個人意見,別當市場數字引用。
自建路線與授權對照
公告裡另一句更有操作性:「Grok Build can now run fully local-first: compile it yourself, point it at your own local inference, and drive everything from your config.toml.」這是給「程式碼完全不能出門」的組織準備的路,代價是模型服務自備、更新自己追、沒有社群修補可撿。順帶糾正一個流傳的說法:簡中工具站寫的「完全離線、程式碼絕不上雲」是錯的,模型跑在 xAI 雲端,只有自建推理路線才談得上把資料留在自己手裡。
授權對照很簡單:Codex CLI 是 Apache-2.0 開源,Claude Code 不開源,Grok Build 站到了前者那邊。對在意工具黑箱與否的人是加分,但勝負不落在這裡。真正決勝的還是 7 月那一題:它怎麼對待你的程式碼。開源讓這一題可以被檢驗,但不會自動給出好答案。
寫程式有多強?基準數字連但書一起看
官方從沒做過 Grok Build 對 Claude Code 的產品級比較,「對標 Claude Code 與 Codex」是媒體框架。模型級的基準只在 Grok 4.6 的公告裡,比較的對手是 GPT-5.6 Sol 與 Fable 5。8 月 12 日的官方公告貼了四個榜,數字整理成表,Grok 4.6 的完整解析另有模型層的討論:
| 基準 | Grok 4.6 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 |
| CursorBench v3.2 | 69.9% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 73% | 未列 |
| Terminal-Bench v3.0 | 26% | 34.6% | 34.1% |
兩個但書必須連表一起讀。第一,官方頁明言競品分數取「the best of self-reported or publicly available results」,是各家自報或公開結果裡較好的那個。第二,官方沒有發布 SWE-bench Verified 數字,也沒有 Claude 或 Gemini 的基線,想比 Anthropic 的人要自己找第三方。數字本身互有勝負:AA 追平 Sol、輸 Fable 5 一分;CursorBench 贏 Sol 輸 Fable;DeepSWE 輸 Sol 將近 7 分;Terminal-Bench v3.0 的 26% 落後兩個對手 8 分以上。老實說,官方自己貼的表就有輸的格子,這反而像真話。
還有一個跟用途直接相關的細節:Terminal-Bench 量的正是終端機裡完成任務的能力,對一款終端機代理來說,這格 26% 比 AA 指數更值得盯。反過來說,分數會隨榜的版本與任務分布浮動。
版本陷阱與動手評測者的分法
基準引用有個常見坑:Terminal-Bench 已經出到 v3.0,網路上還流傳著舊版分數,版本對不上就沒有可比性,同一個榜換個版本,贏家會翻。看到任何一組數字,先確認榜的版本與日期再轉貼。
動手比較過的評測者,結論收斂得意外整齊。Composio 在 7 月 16 日的 9 項評比裡以 6 比 3 判 Claude Code 勝,作者自述碰正式環境的程式碼仍用 Claude Code,Grok Build 留給便宜可丟的工作,例如大量測試碼;同篇列出的單位成本對比是 Claude Code 每任務 $11.80、Grok Build $2.49。要留意,單一評測者的成本數字取決於任務組合與模型選擇,當參考就好,別當報價。Analytics Vidhya 在 7 月 24 日的結論類似:production 關鍵路徑用 Claude Code,greenfield 與平行任務用 Grok Build。更早的 DevOps.com 在 5 月 15 日就寫下「如果你今天就需要一個 production 就緒的編碼代理,Claude Code 與 Codex CLI 是被驗證過的選擇」。
架構差的金句來自 Developers Digest 的整理:「Claude divides and conquers. Grok races for the best single answer.」HN 使用者的手感則兩極:署名 hsn915 的使用者稱它「至今用過最好的編碼 AI 代理」、dimgl 說「比 omp 和 Claude Code 快」;另一頭 bakies 覺得「用起來像 sonnet 3」、swat535 直言「對我來說毫無用處」。同場還有 Meta 的終端機代理 Muse 與 OpenAI 的 Codex。
跟 Claude Code 差在哪,該不該換
分野可以壓成一句話。Claude Code 是被多數動手評測者留在 production 的成熟選項,Grok Build 是晚一年進場、開源、把平行派工做便宜的挑戰者,CIO Dive 在 5 月 15 日的形容最直白:它落後的兩個對手,都比它早一年多上線。

差異落在四件事。相容:CLAUDE.md、MCP、旗標、sessions 全接得上,搬家成本趨近零。成本:Composio 的實測把單任務成本壓到對方的五分之一左右。信任:7 月的事件與之後的開源,讓它的隱私帳本公開但難看;Claude Code 沒出過同級事件,但也不開源讓你查。成熟度:基準與評測都還落後,媒體共識是挑戰者,不是殺手。
對照情境比聽結論有用。已經在 Claude Code 付費的重度使用者,沒有換的理由,只有加的理由:設定共通、sessions 互通,把一批可丟的平行工作分流過去試一週,成本與品質自己會說話。預算敏感的個人與小團隊,從免費層開始,需要穩定供給再看 SuperGrok $30,單任務 $2.49 對 $11.80 的實測差就是這條路的依據。合規優先的組織順序要反過來:先問資料能不能出門,再問工具好不好用;自建推理路線存在,但模型服務、更新、維護都要自己扛。
講白了,與其問「該不該換」,不如問「哪種工作交給它」。可丟、可平行、失敗不心疼的工作(測試碼、樣板、清理、探索性 spike)很適合丟給免費層或低價訂閱的 Grok Build;碰正式環境、要穩定度背書的,留在 Claude Code。兩者並用不是牆頭草,是分工。想看兩強互比的細節,Codex 與 Claude Code 的比較有完整版。搬遷的實務順序也簡單:先在次要專案跑一週,把 AGENTS.md 與 CLAUDE.md 的規則對齊,確認行為差異,再決定要不要把平行工作常態分流過去。
誰先不要碰:程式碼完全不能出門、又沒有自建推理能量的組織;需要官方中文支援管道的團隊;要白紙黑字配額保證的正式環境部署。
台灣的使用條件,與現在能做的兩個動作
地區與付款
沒有證據顯示台灣被擋。Grok 在香港免 VPN 可用,台灣一般正常使用。付款的現實條件是:SuperGrok 訂閱以美元計價,台灣發卡的多數 Visa 與 Mastercard 可以刷,帳單換算回來的金額依匯率浮動,跨海消費收不收手續費由各發卡行決定,刷卡前先確認自己卡片的條款。簡中圈主流的 VPN 加代充、共享帳號那套,共享帳號有違反服務條款的風險,不建議走,帳務與救援都過不了自己那一關。
中文條件
官方沒有中文介面與文件,介面與文件都是英文。中文提示與中文回應行不行?Grok 模型的多語能力應付中文讀寫合理可行,AGENTS.md 用中文寫也讀得動,但這是模型能力的推斷,不是官方規格,正式專案先小規模驗一輪再上。繁中內容的現況是:搜「Grok Build」主要命中簡中內容與官方英文頁,台灣媒體只有 5 月發布窗的三篇新聞,7 月的隱私事件與開源在繁中圈幾乎沒有深度覆蓋,中文資訊缺口還很大。
下一步
兩個動作,跟開頭的時間估計對齊。花 5 分鐘:在乾淨的測試資料夾用官方 curl 腳本裝起來,免費層丟一個小任務,感受 TUI 與 Plan Mode 的節奏。花 10 分鐘:檢查隱私設定與專案隔離,確認 /privacy 裡的保留選項、敏感目錄不在工作範圍,必要時放一個金絲雀檔自查上傳行為。一週後再評估:讓它跑你真實的工作負載,對照手上工具的單位成本與來回次數,讓數字替你決定留不留。
常見問題
Grok Build 跟 Claude Code 差在哪?該換嗎?
差異可以壓成一句:Claude Code 是多數評測者留給 production 的成熟工具,Grok Build 是相容 Claude Code 設定、開源、單任務成本約五分之一的挑戰者,基準與成熟度仍落後。因為 CLAUDE.md、MCP、旗標、sessions 都能沿用,並用的摩擦非常低。可丟的平行工作給 Grok Build,碰正式環境的留 Claude Code,比起二選一,分工是更實際的答案。
免費層能用嗎?有配額嗎?
能。產品頁寫「Available to try for Free」,Free 方案 $0,跟其他 Grok 產品共用一個每週用量池。官方沒有公布任何配額數字,網路上流傳的具體 request 或 token 上限都不可信。想穩定大量用,再往上考慮 SuperGrok $30 或 Plus $100。試用時先放在獨立的測試資料夾,習慣它的節奏再考慮放進正式專案。
一定要 SuperGrok Heavy 嗎?
現在不用。5 月 beta 起步時確實綁 SuperGrok Heavy,當時媒體報導月費約 US$299 到 $300;現行公告寫的是所有 SuperGrok 與 X Premium Plus 訂閱者可用,免費層也開放試用。Heavy 現在是給極重度使用者的選項,不是入口門票。
現在安裝還會把整包專案上傳嗎?
預設不會。7 月中 xAI 在伺服器端把預設上傳關閉,開源後的程式碼裡上傳函式直接回傳 unavailable,也有使用者重測無法重現。但 7 月的教訓是信任要可驗證:敏感專案放獨立資料夾、用金絲雀檔自查、追著 changelog 看,比相信任何承諾可靠。
介面有中文嗎?能用中文對話嗎?
介面與官方文件都是英文,沒有中文版。中文提示與中文回應方面,Grok 模型的多語能力應付得來,AGENTS.md 也可以用中文寫,但這是模型能力的合理推斷,不是官方保證的規格。
Windows 能裝嗎?
能。PowerShell 一行 irm https://x.ai/cli/install.ps1 | iex,預建 binary 支援 Windows,不需要 Node.js。要從原始碼自建 Windows 版的話,README 官方自認是 best-effort、未經測試,一般使用者走預建版就好;需要統一部署的環境,npm 的官方套件 @xai-official/grok 同步到 1.0.5,比腳本好管理。
開源了,可以自己編一個不上雲的版本嗎?
技術上可以,條件要讀清楚。Apache-2.0 授權允許自編自用,官方路線是自己編譯、指向自架推理、用 config.toml 驅動。但模型端點要自己準備,repo 是唯讀的、沒有社群修補,更新要自己追。只想要「免費」的人不符合這條路的成本結構,它換到的是控制權,不是省錢。
grok.me 上的 Grok Build 跟終端機版是同一個嗎?
不是。8 月 19 日登上 grok.com 與 iOS、Android 的是對話版:在聊天裡描述 App、遊戲或網站,當場生成並發布到 grok.me,全方案可用。終端機版是你安裝在本機、碰你檔案系統的開發工具,官方以「Grok Build for the terminal」稱之。查資料時認清楚,價格與功能才不會張冠李戴。
