GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

Claude Sonnet 5 是什麼?梯隊定位、規格、價格與選用指南

Anthropic 2026-06-30 發表的中階模型,1M context、128k 輸出、adaptive thinking 預設開,推廣價 $2/$10 至 8 月底、9 月起 $3/$15。拆解梯隊定位、規格、評測、新 tokenizer 的成本真相與台灣四條取得路徑。

Claude Sonnet 5 的模型梯隊、1M context、價格、效能與選用決策精選圖片

Claude Sonnet 5 是 Anthropic 在 2026 年 6 月 30 日發表的中階模型,主打 agentic 工作流程,API model ID 是 claude-sonnet-5。它在 Claude 梯隊裡低於旗艦 Opus 4.8、高於輕量 Haiku 4.5,API 推廣期每百萬 tokens 輸入 2 美元、輸出 10 美元,2026 年 9 月 1 日起回到標準價 3 美元與 15 美元。

重點先看

中階定位:低於 Opus 4.8、高於 Haiku 4.5,前身是 Claude Sonnet 4.6。

規格:1M context window、128k 最大輸出、adaptive thinking 預設開啟。

價格:推廣期 $2/$10 至 2026-08-31,9 月起 $3/$15,長期成本用標準價估算。

新 tokenizer 使相同文字多約 30% tokens,所以推廣價對相同內容大約與 4.6 成本持平,不是真的打 67 折。

取得:claude.ai 與 Claude Code 預設模型,API、Amazon Bedrock、Vertex AI、Microsoft Foundry 皆 GA。

評測:每一個公布項目都勝過 Sonnet 4.6;最難的 coding 仍落後 Opus 4.8;知識工作(GDPval)略高於 Opus 4.8,但只差 3 分 Elo,可能在 noise 內。

多數文章講到 Sonnet 5 只覆述規格表,說它「更聰明、更便宜、更 agentic」。規格表是對的,但這三個形容詞擺在一起會誤導。最該先搞清楚的是它對你成本的真實影響:規格表寫的「更便宜」,其實被新 tokenizer 吃掉一大半。

Sonnet 5 的定位與發表

Claude Sonnet 5 是目前 Sonnet 系列裡最強的一顆,把「能自己跑完一段工作」這件事推到新高,價格還停在中階。

官方給它兩個稱號:「至今最 agentic 的 Sonnet」「speed 與 intelligence 的最佳組合」。第一個基本屬實,第二個是行銷詞,實際多強看下面的評測。

2026 年 6 月 30 日發表,當天 API、claude.ai、Claude Code、三家雲端同步開放。前身是 Claude Sonnet 4.6(2026 年 2 月 17 日),兩代 API 標準價相同。內部代號據 Tech Insider 報導是 Fennec。

它的知識只到 2026 年 1 月。要它處理六月才發生的事,得讓它用工具去查,不然它會很自信地編出訓練截止後的細節,這是所有 LLM 的通病,Sonnet 5 不例外。

在 Claude 梯隊裡的位置:Sonnet 5、Opus 4.8、Haiku 4.5、Fable 5

Claude 目前一般可用的梯隊,由上到下是 Fable 5、Opus 4.8、Sonnet 5、Haiku 4.5。四顆對應四種工作類型,不是一道強弱階梯。

模型定位API ID輸入/輸出(每百萬 tokens,USD)Context適合什麼工作
Fable 5Mythos-class 頂級claude-fable-5$10 / $501M最高判斷、企業旗艦、複雜資安研究
Opus 4.8旗艦 workhorseclaude-opus-4-8$5 / $251M最難 coding、關鍵判斷、企業 agentic
Sonnet 5平衡預設值claude-sonnet-5$3 / $15(推廣 $2/$10)1M多數開發、寫作、agentic workflow
Haiku 4.5最快最便宜claude-haiku-4-5-20251001$1 / $5200k量大、分類、摘要、結構化抽取

梯隊的關鍵判斷不是誰最強,而是你出的價錢買到什麼。想把整個 Claude 家族放進地圖一起看的話,可以回頭爬一篇 Claude 模型與工具的整體教學,這裡只看 Sonnet 5 這一格。

Claude 模型梯隊圖,Sonnet 5 位於 Opus 4.8 與 Haiku 4.5 之間,Fable 5 位於最上層
Claude 梯隊不是單純強弱排名:Sonnet 5 是兼顧能力、速度與成本的平衡預設值。

Fable 5 是 Anthropic 首個公開的 Mythos-class 模型,在 Opus 之上,2026 年 6 月 9 日發表,中間因為美國出口管制命令暫停過,7 月 1 日起全球重新開放。它跟另一顆只給邀請制 Project Glasswing 使用的 Mythos 5 同規格同定價,一般大眾只會碰到 Fable 5。Sonnet 5 資安能力等級較低,未受出口管制影響。

Opus 4.8 是旗艦 workhorse,定價 $5/$25,1M context,留給最難的 coding、企業大型 agentic 部署、需要最強判斷的工作。Haiku 4.5 在另一端,$1/$5、200k context、64k 輸出,留給量大、對延遲敏感、不需要複雜推理的任務。

Sonnet 5 卡在中間,標準價 $3/$15 與 Sonnet 4.6 完全相同。所以「升級 Sonnet 5 會不會變貴」這個問題,紙面答案是「不會」,實際答案是「要看新 tokenizer 怎麼影響你的工作量」。

梯隊上下關係不等於「永遠選最上面那顆」。Fable 5 與 Opus 4.8 對簡單任務是浪費,Haiku 4.5 對難任務會回不出來。多數人日常工作的甜蜜點,正好落在 Sonnet 5 這一格,這也是 Anthropic 把它設成 claude.ai 與 Claude Code 預設模型的原因。

規格亮點:1M context、128k 輸出、adaptive thinking 與 effort 參數

Context 與輸出上限

Context window 是 1M tokens,而且 1M 同時是預設值與最大值,沒有較小的 context 變體。意思是無論你用什麼介面叫它,context 上限都是 1M。最大輸出 128k tokens,這個數字對長篇寫作、大型程式碼生成、多步驟報表都夠用。據 codersera 報導,進階使用者可透過 batch API 的 beta header 把輸出推到 300k,這是進階玩法,一般使用先用 128k 評估就好。

Vision 與 tool use

輸入支援文字、圖片與檔案,具備 vision 與 tool use 能力。這代表你可以餵它截圖、PDF、CSV、程式碼檔案,它能在同一個對話裡讀、分析、來回操作。對做文件審閱、資料整理、圖表理解的工作,這個能力比純文字模型實用很多。

Vision 能力對辦公場景特別有感。把一份中文 PDF 合約丟給它,請它標出風險條款並比對你的範本,或把產品設計稿、競品登陸頁截圖一起餵進去,讓它比對文案與視覺、整理差異點。這類工作以前要靠 OCR 工具加文字模型串接,現在 Sonnet 5 一個模型就能處理。Tool use 則讓它能在對話中呼叫外部 API、查資料庫、操作瀏覽器,這是 agentic 工作流程的基礎建設。

Adaptive thinking 與 effort

Adaptive thinking(彈性思考)預設開啟。模型會自己判斷這個任務要想多久,不用你手動下指令。effort 參數可以手動調:lowmediumhighxhighmax,預設 high,API 與 Claude Code 都是。

預設 high 這件事很重要。它代表 Anthropic 把「多想一點再回答」當成出廠值,多數任務你拿到的回答,是模型已經想過一輪的版本。要省錢就往下調,要把最難的題目榨乾就往 xhighmax 推。effort 直接影響 token 消耗與延遲,這也是成本規劃的關鍵變數。

Anthropic 官方比較 Sonnet 5、Sonnet 4.6 與 Opus 4.8 在不同 effort 下的成本效能曲線
官方曲線說明 effort 如何改變成本與能力;中等 effort 是 Sonnet 5 最突出的成本效能區間。來源:Anthropic。

effort 對不同任務的影響差距很大。分類、摘要、翻譯這類機械化任務,lowhigh 的輸出差距通常不明顯,但成本可能差數倍;數學、複雜推理、agentic 多步驟任務,effort 高低直接決定能不能解出來。實務上的折衷是:量大、規則明確的任務用 lowmedium,關鍵、高風險、需要正確性的任務才用 high 以上。把這個當成成本工具,不是品質開關。

Claude Sonnet 5 的 1M context、128k 輸出、Vision、Tool use 與 Adaptive thinking 規格圖
1M context 與 128k 輸出提供長任務空間;Adaptive thinking 與 effort 則決定模型投入多少推理成本。

從 Sonnet 4.6 遷過來的人,要注意幾個行為變更:adaptive thinking 預設開(4.6 不開);舊的手動 extended thinking 寫法(thinking:{type:"enabled",budget_tokens:N})已被移除、送過去回 400(4.6 時代只是 deprecate);temperaturetop_ptop_k 設非預設值也回 400,要調行為得改用 system prompt 引導。

這些不是 bug,是刻意的 API 收斂。Anthropic 的設計哲學是:模型自己決定怎麼想,你用自然語言描述目標與限制,不要用抽樣參數微調。程式碼裡還套著舊假設的人,升級前先把請求欄位掃一遍。

從 Sonnet 4.6 遷移到 Sonnet 5 時,檢查 tokenizer、thinking、sampling、prefill 與 Priority Tier 的清單圖
升級前不只換 model ID:還要重算 token、移除舊 thinking 與 sampling 欄位,並確認 prefill、rate limit 與 Priority Tier 差異。

還有兩個相容性要點:Assistant message prefilling 不支援(送了回 400),要改用 structured outputs、system prompt 或 output_config.format;Priority Tier 在 Sonnet 5 不提供,4.6 有,這對本來靠 Priority 拿保證輸送量的 API 用戶是實質 downgrade,搬之前要先確認 Sonnet 5 的 rate limit 對你夠不夠。

推廣價、新 tokenizer 與成本真相

API 定價分兩段。推廣期到 2026 年 8 月 31 日,輸入每百萬 tokens 2 美元、輸出 10 美元,cache read 命中 0.20 美元。2026 年 9 月 1 日起回到標準價,輸入 3 美元、輸出 15 美元,cache read 0.30 美元。看起來像推廣期打了 67 折。

但 Sonnet 5 換了新 tokenizer。同樣的文字,新 tokenizer 會產生大約 30% 更多的 tokens,與 Sonnet 4.6 相比。對 API 形狀沒有破壞性變更,request 與 response 的長相不變,但是 token 計數、context 實際容量、max_tokens 預算、每一次請求的成本,全部受影響。

把這兩件事擺在一起就會看出真相:推廣價 $2/$10 對相同內容而言,大約與 Sonnet 4.6 的 $3/$15 持平(cost-neutral),不是真的打 67 折。標準價 $3/$15 則在帳面上與 4.6 完全相同。

講白了,這個推廣價是「新模型剛上線」與「token 計數膨脹」兩件事的折價組合,不是長期折扣。長期、重複、要寫進預算的 workload,用標準價估算才安全。

用一個工作情境算給你看(示意)。假設你有一段 8,000 tokens 的 system prompt(4.6 口徑),每天重複叫 1,000 次,每次輸出約 2,000 tokens。在 4.6 上,每天輸入成本是 8,000 × 1,000 ÷ 1,000,000 × $3 = $24,輸出成本是 2,000 × 1,000 ÷ 1,000,000 × $15 = $30,合計 $54。換到 Sonnet 5 推廣價,新 tokenizer 讓輸入變約 10,400 tokens、輸出變約 2,600 tokens,輸入成本變 10,400 × 1,000 ÷ 1,000,000 × $2 = $20.8,輸出成本變 2,600 × 1,000 ÷ 1,000,000 × $10 = $26,合計約 $46.8。9 月以後用標準價,變 10,400 × 1,000 ÷ 1,000,000 × $3 = $31.2,加 2,600 × 1,000 ÷ 1,000,000 × $15 = $39,合計約 $70.2。

老實說,從 $54 變 $70.2,這才是長期成本的真實走向。不是打 67 折,是大約上漲三成。所以選擇 Sonnet 5 的真正理由不應該是「比較便宜」,而是「能力升級」與「agentic 能力」。要省錢,往下退到 Haiku 4.5 反而比較實在。

相同內容在 Sonnet 5 新 tokenizer 下 token 增加,推廣價與標準價帶來不同長期成本的比較圖
推廣價會抵銷部分 token 膨脹,但長期預算仍應以標準價與實際 token 數估算。

再換一個團隊場景。假設一個五人開發團隊,每人每天跑 Claude Code 約 200 次請求,每次平均 12,000 tokens 輸入與 3,000 tokens 輸出(Sonnet 5 口徑)。一天總請求 1,000 次,輸入 1,200 萬 tokens、輸出 300 萬 tokens。推廣期一天成本是 12 × $2 + 3 × $10 = $54,一個月(22 個工作天)約 $1,188。9 月起標準價變 12 × $3 + 3 × $15 = $81,一個月約 $1,782。把 Prompt caching 設好(重複的 system prompt 與專案 context 命中率高),這個數字可以再壓三到五成。

Prompt caching 與 Batch API:兩個壓成本的機制

應付 Sonnet 5 的 token 膨脹,主要靠兩個結構性工具:Prompt caching 與 Batch API。

Prompt caching 讓你把重複出現的 prompt 段(system prompt、長文件、固定 context)快取起來,下一次命中時 cache read 的價格只有 base input 的十分之一,官方數字是最高省 90%。Sonnet 5 推廣期 cache read 每百萬 tokens 0.20 美元,9 月起 0.30 美元,等於 base input 的十分之一。

但 cache 不是免費的,write 要付費。5 分鐘 cache write 是 base input 的 1.25 倍,1 小時 cache write 是 2 倍。所以同一個 prefix 在快取有效期內被打了幾次,決定 cache 要不要開。

給一個判斷門檻(示意)。假設你有一段 10,000 tokens 的固定 system prompt(Sonnet 5 口徑)。用 5 分鐘 cache,write 成本是 10,000 ÷ 1,000,000 × $2 × 1.25 = $0.025。後續每次命中讀取成本是 10,000 ÷ 1,000,000 × $0.20 = $0.002,對比不快取的 $0.02,每次省 $0.018。只要同一個 5 分鐘區間內重複 2 次以上($0.025 ÷ $0.018 ≈ 1.4,分數次命中不存在,所以 2 次是實際門檻),cache 就開始賺。1 小時 cache 的 write 是 2 倍成本,門檻上升到約 2 到 3 次重複。

實務上,客服 bot、IDE 補全、企業內部助手這類高重複 workload,cache 命中率常在八成以上,整體成本可壓到原來的兩到三成。低重複、一次性的研究或寫作任務,cache 用處不大,反而徒增 write 成本。

Batch API 是另一個獨立機制,把一批沒有即時性需求的請求打包送,官方數字是省 50%,代價是回傳時間拉長到最多 24 小時。Batch 適合的場景很明確:大批資料標註、文件分類、回email草稿生成、歷史資料處理、A/B 測試評估。這類任務你不在乎一兩個小時內拿到結果,省一半成本很可觀。即時對話、客服回覆、IDE 補全這種需要馬上回的場景,Batch 不能用。

把 cache 與 batch 疊起來,是企業級部署的標準動作。前端正規即時請求走 cache,後端離線處理走 batch,兩條路徑各自最佳化,整體 TCO 可以比全走即時無 cache 壓低六到七成,要看 cache 命中率與離線量比例。Sonnet 5 因為 token 膨脹 30%,這兩個機制的重要性比 4.6 時代更高,不設起來等於把錢放著不撿。

即時重複請求走 Prompt caching,離線大量工作走 Batch API 的成本最佳化流程圖
高重複的即時請求適合快取;可延後的大量工作適合 Batch,兩條路徑解決的是不同成本問題。

US-only inference(資料留在美國境內)是另一個成本變數,加價 1.1 倍。這個選項主要給有資料主權合規需求的企業,例如金融、醫療、政府合約。一般使用者與多數企業不需要,預設不開啟就好。

效能評測:哪些地方追上 Opus 4.8、哪些還差一級

下面這些數字都是 Anthropic 自己測的,看看趨勢就好,要查證去翻 System Card 與 Transparency Hub。

Anthropic 官方比較 Claude Sonnet 5、Sonnet 4.6 與 Opus 4.8 的多項效能評測表
Anthropic 官方評測顯示 Sonnet 5 全面高於 Sonnet 4.6;與 Opus 4.8 的差距則依任務而異。來源:Anthropic。

Sonnet 5 對前一代 Sonnet 4.6 的成績是全面勝出,沒有任何一項回退。最大的跳升在 FrontierCode v1(無法靠訓練記憶的新穎演算法題)從 15.1 跳到 38.8,差 23.7 分;Terminal-Bench 2.1(終端機 agentic coding)從 67.0 衝到 80.4,差 13.4 分。SWE-bench Verified 從 79.6 到 85.2,USAMO 2026 數學奧林匹亞從 55.0 到 79.5,HealthBench Professional(26 科臨床準確度)從 44.2 到 57.8。Sonnet 4.6 用了四個多月就被拉開這麼多,這代升級幅度是真的。

但跟 Opus 4.8 比,畫面就不一樣了。最難的 agentic coding SWE-bench Pro,Sonnet 5 是 63.2%,Opus 4.8 是 69.2%,差 6 分。Terminal-Bench 2.1 Sonnet 5 是 80.4%,Opus 4.8 約 82.7%。Humanity’s Last Exam(無工具)Sonnet 5 是 43.2%,Opus 4.8 是 49.8%。最難的 coding 與判斷,旗艦還是領先。

有一格特別值得記。GDPval-AA v2(知識工作 Elo)Sonnet 5 拿到 1618,Opus 4.8 是 1615。Sonnet 5 在這一格以 1618 略高於 Opus 4.8 的 1615(只差 3 分 Elo,可能在評測 noise 內),但這仍是 Sonnet-class 首度在單一評測分數高過同期 Opus 旗艦。OSWorld-Verified(桌面 GUI 操作)Sonnet 5 是 81.2%,Opus 4.8 約 82%。BrowseComp(agentic search,單 agent)Sonnet 5 是 84.7%,多 agent 設定上升到 86.6%。Humanity’s Last Exam 有工具版本 Sonnet 5 是 57.4%,幾乎追平 Opus 4.8 的 57.9%。第三方測的 CursorBench(Cursor 在 IDE 層級測)Sonnet 5 是 61.2%,4.6 是 49.0%。

數字讀起來分兩層:對 Sonnet 4.6 是全面勝出、沒有回退,對 Opus 4.8 則是難的項目仍落後、知識工作反而略為領先。兩個方向同時存在,不互相打架。

說穿了,知識工作領先那一格要打個折扣。GDPval 是一次測得的結果,榜單一換、題目一換,排名就可能整個翻。拿它說「Sonnet 5 已經等於 Opus 4.8」是過度陳述;比較準的講法是,在知識工作這一塊,Sonnet 5 把差距縮到幾乎平手,個別項目甚至超前。最難的 coding、數學、cyber 那幾格,旗艦還是佔上風。

資安能力是另一個等級較低的面向。Sonnet 5 與 4.6 在 Firefox exploit 開發測試都接近 0%,在危險 cyber 評測遠低於 Opus 模型。這個能力落差常被聯想到美國出口管制,Anthropic 官方未直接說明動機,僅表示 Sonnet 5 並非為 cyber 任務最佳化,但意味著某些資安研究、滲透測試型任務它做不來,要拿 Opus 4.8 或 Fable 5 才行。

agentic 對一般使用者到底意味什麼

agentic 這個詞被各家廠商用得很浮濫,講到最後常常只剩「會自己做事」這種沒資訊量的口號。對一般使用者,agentic 的具體意思是:模型能接工具、能連續做好幾步、會在中間自己判斷要不要再查一次。

換到工作場景,這幾件事的實際效果是交辦的顆粒度變大。以前你要把一件工作拆成「查 A、查 B、把 A 跟 B 比較、寫結論」幾個 prompt 分別餵,現在你給它一個目標,讓它自己排流程。它發現缺了訓練截止後的資訊,會自己用瀏覽器或 API 去查,而不是硬猜。它也能在多檔、多步驟的環境裡維持狀態,Claude Code 跑一個 repo 的重構、claude.ai 跑一個研究任務,背後都是這個能力。

Claude Sonnet 5 接收目標後自行規劃、使用工具、檢查結果並完成多步驟任務的流程圖
Agentic 的價值不是口號,而是把查資料、操作工具、驗證與交付串成一段可持續執行的工作。

Anthropic 發表時引了兩家合作夥伴的話。Zapier 資深工程師 Daniel Shepard 說,兩段式工作(更新 Salesforce 帳號層級、再寄發表通知給企業聯絡人)Sonnet 5 能端到端做完,以前會卡在一半。Lovable 說它在相同產出品質下步驟更少,也能一致地拒絕不安全的請求。發表會上的夥伴見證本來就是挑過的,聽個方向就好。

agentic 對你的實質影響是 workflow 設計,不是單次輸出。你要想的不再是「這題它答得好不好」,而是「這整條工作流程,我能不能交給它跑完、跑完之後我怎麼驗收」。後面那個問題,就是 Claude Code 或 Cursor 這類工具的工作,Claude Code 的命令列與 IDE 整合是把它變成開發者日常的主要入口。

這講起來還是抽象,落到三種工作會比較具體。

做內容研究的人,拿一家 SaaS 公司每月出四篇產業報告來看:,得整理十家競品的定位、定價、近期新聞。以前是自己一篇一篇查、塞進試算表、再回頭寫分析。換成 agentic 流程,把十家清單與分析框架交代給 Sonnet 5,它自己排查詢順序、分批爬資料、整理成結構化輸出,再交一份草稿加來源清單。你的工作從「執行」挪到「設定目標、驗收、補框架」,驗收標準可以訂成:每條結論都要能對回某條可點擊來源。

寫程式的人不必憑空想像,Claude Code 裡直接看得到。丟一個五人團隊維護兩年、約五十個檔案的舊模組給它重構,把目標與限制設好,它讀完整個模組、規劃改動、分批修、跑測試、自我修正,開一個分支跟 PR 等你審。你審的是 PR,不是逐行改碼,驗收門檻就是那個 PR 得過你既有的測試套件。

行銷的量大任務也合用。電商檔期要為二十檔 SKU 各發一篇社群貼文、每篇對應不同受眾與平台,把產品資訊、受眾清單、平台規範一次給齊,它自己生成、自己按平台特性調整、產出帶配圖建議的成品,驗收時按受眾清單逐篇核對即可。這類任務以前耗的是產能,agentic 把它收斂成一次交辦。

三種工作表面不同,底層是同一個位移:你交辦的單位從「一句話」放大成「一個任務」,重心從「產出」挪到「設計任務與驗收」。這才是 agentic 對一般使用者的實質意義,不是「更聰明」這種空話。

agentic 也有它做不到的事。它不會替你判斷「這個任務該不該做」,不會替你做倫理與合規決定,不會處理需要人際信任與判斷的溝通。策略、判斷、關係這幾件事它接不了,留給人類自己;能交給它的,是重複、可驗收、有明確定義的執行。

Sonnet 5 也是 Claude Code 訂閱席次的預設模型。要比較各種 coding agent 的工作節奏,可以參考另一篇 Codex 與 Claude Code 的節奏差異,Sonnet 5 在 Claude Code 那一側的表現就是那篇討論的基準之一。

什麼情況選 Sonnet 5、什麼情況升 Opus 4.8、什麼情況退 Haiku 4.5

問題不是哪顆最強,是你要它做哪一種活。Sonnet 5 是多數人的合理預設,但不是所有人的最佳解。把任務類型、模型、effort 擺在同一張表看,判斷會快很多。

任務類型推薦模型effort 建議理由
客服分類、標籤、摘要Haiku 4.5不適用量大、規則明確,貴模型做浪費
翻譯、改寫、潤稿Haiku 4.5 或 Sonnet 5 lowlow機械化任務,effort 高低差距小
日常寫作、email、報告Sonnet 5mediumhigh平衡品質與成本
中型程式開發、debugSonnet 5highagentic coding 主力場景
長文件分析、研究、問答Sonnet 5high1M context 才放得下
多步驟 agentic workflowSonnet 5highxhigh需要連續推理
大型 repo 重構、複雜除錯Opus 4.8highmaxSWE-bench Pro 仍領先 6 分
高風險決策支援、數學證明Opus 4.8xhighmax判斷正確性優先
資安研究、滲透測試Opus 4.8 或 Fable 5high 以上Sonnet 5 cyber 能力等級較低

選 Sonnet 5:日常寫作、中大型程式開發、需要工具與瀏覽器的研究、長文件處理(1M context 才放得下)、多步驟 agentic workflow、API 中量到大量呼叫。如果你本來用 Sonnet 4.6 覺得夠用,Sonnet 5 是直接升級,紙面成本不變。

升 Opus 4.8:最難的 agentic coding(大型 repo 重構、複雜除錯)、需要最高判斷正確性的企業決策支援、數學奧林匹亞等級的推理、資安研究、任何「差一格會出事」的高風險任務。Opus 4.8 的 $5/$25 不是 Sonnet 5 標準價的兩倍,是 1.67 倍,關鍵工作多花這 1.67 倍通常划算。判斷其實很實際:任務出錯會掉錢(退單、合規罰款、客戶流失)、會觸法、或會對外發出,就直接升 Opus,不必去算那 1.67 倍。

退 Haiku 4.5:極大量、對延遲敏感、不需要複雜推理的任務。分類、摘要、標籤生成、客服第一層、結構化資料抽取。Haiku 4.5 的 $1/$5 是 Sonnet 5 標準價的三分之一,200k context 與 64k 輸出對這類任務綽綽有餘。把 Haiku 4.5 放在 pipeline 前端、Sonnet 5 放在判斷層,是常見的兩層配置。例如客服系統,第一層用 Haiku 4.5 做意圖分類與常見問題回覆,分不出來或高風險的再交給 Sonnet 5 處理,成本與品質都最佳化。

梯隊之間不是越強越好。最強的模型做簡單事就是浪費錢和延遲。把任務分類、對應到對的模型,比一路用最強要省很多。這個判斷在企業部署裡尤其重要,因為量大,幾個百分點的模型選擇錯誤就放大成實質的成本差。

依任務複雜度、延遲敏感度與成本,在 Sonnet 5、Opus 4.8、Haiku 4.5 之間選擇的決策圖
先以 Sonnet 5 當預設值;最難、最關鍵的任務升 Opus,量大且規則明確的任務退 Haiku。

台灣怎麼用 Sonnet 5:四條取得路徑

取得 Sonnet 5 有四條主要路徑,難易度與成本結構各不相同。

台灣使用者可透過 claude.ai、Claude Code、Anthropic API 與雲端平台取得 Sonnet 5 的四條路徑圖
一般使用者從 claude.ai 上手、開發者走 Claude Code 或 API;既有雲端企業則沿用熟悉的平台與治理流程。

claude.ai:多數人最快上手的入口

claude.ai 是網頁、iOS、Android App,桌面端也有 Claude Desktop,Sonnet 5 是 Free 與 Pro 方案的預設模型,Max、Team、Enterprise 也能選用。據 Penchan 在 2026 年 7 月的報導,台灣可直接使用 claude.ai,免 VPN;使用前建議再確認一次 Anthropic 官方支援區域,區域政策會調整。可以確定的是,Sonnet 5 未受美國出口管制影響,與 Fable 5 不同。Free 方案有使用量限制,重度使用者建議升 Pro;Pro 是固定月費、不逐 token 計價,適合多數內容工作者、研究員、學生。

Claude Code:開發者的主力入口

Claude Code 是命令列與 IDE 內整合,Pro、Team Standard、Enterprise 訂閱席次預設就是 Sonnet 5,訂閱本身獨立計價、不逐 token 收錢。它跟 claude.ai 是兩種不同的訂閱:claude.ai 是通用對話,Claude Code 是寫程式專用,能直接操作檔案系統、跑終端機、改 repo,開發者通常兩個都訂。

Anthropic API:唯一能把成本算到小數點的路徑

直接用 model ID claude-sonnet-5 呼叫,是唯一讓你完全控制 effort、context、caching 的路徑。量大、要做快取、要批次、要 US-only inference 的場景,只能在這裡。門檻是技術能力,要會寫程式或用 Postman 之類的工具,但靈活度與成本控制遠高於訂閱制。

雲端夥伴:已在 AWS/GCP/Azure 的企業最省事

Amazon Bedrock 用 anthropic.claude-sonnet-5,Google Cloud Vertex AI 用 claude-sonnet-5,Microsoft Foundry 用 claude-sonnet-5,三個都已 GA。企業已在這些雲端上跑工作流程的,透過自家雲端叫 Sonnet 5 不必另開 Anthropic 帳號,帳單、合規、IAM 全走雲端既有架構,發票、SOC 報告、資料處理條款都過過法務。

第三方工具支援:GitHub Copilot、OpenRouter(anthropic/claude-sonnet-5-20260630)、Cursor、VS Code 都已上線。已經用 Cursor 或 Copilot 的人,不必換 IDE,直接在設定裡把模型切到 Sonnet 5。OpenRouter 適合想用一個介面管理多個模型 API key 的人,帳單統一、模型切換彈性高。

四條路徑怎麼選?個人使用者與內容工作者走 claude.ai 最簡單,開發者加訂 Claude Code,企業 API 用量大或需要嚴格成本控制走 Anthropic API 直連,已在雲端生態裡的企業走自家雲端夥伴。已經投資 Cursor 或 Copilot 生態的開發者,直接在既有工具裡切模型就好,不必跳船。

走 claude.ai 這條路的人,起步動作很輕。先用瀏覽器開 claude.ai,用 email 或 Google 帳號註冊,免費方案就用到 Sonnet 5;接著丟一個你熟悉的工作給它(整理會議紀錄、改一段程式碼、發想貼文都行),看它跟之前用的工具差在哪;等使用量撞到 Free 方案上限,再考慮升 Pro。先免費試再付費,比一開始就訂閱穩,因為你會先知道它對你的工作類型到底有沒有實質幫助,而不是被規格表牽著走。一個小提醒:截至 2026 年 7 月,claude.ai 介面以英文為主,繁中在地化仍在推進,但模型本身的中文能力對繁體使用者足夠流暢,輸入繁中它就用繁中回。

走 Claude Code 的開發者,起步稍微技術性。先確認版本是 v2.1.197 以上(舊版不支援 Sonnet 5),再用 /model claude-sonnet-5 明確切換(預設本來就是它,明確切換避免歧義),然後丟到 side project 試跑一週,看它在「理解專案 context、修正錯誤、跑測試」上跟舊模型的差距,再搬到主專案。

從 Sonnet 4.6 搬過來會踩哪些雷

Sonnet 4.6 沒有被強迫退役,API 退役日不早於 2027 年 2 月 17 日,無強制遷移。所以「要不要升級」是你自己評估,不是 dead line。

但遷移要小心三個層面。

API 參數收斂是最直接的 breaking change。舊的手動 extended thinking 寫法、非預設 temperature/top_p/top_k、assistant message prefilling 全部會回 400。請求 schema 要先掃一遍,把這些欄位要嘛刪掉、要嘛改寫。Priority Tier 在 Sonnet 5 不提供,本來靠 Priority 拿保證輸送量的 API 用戶,要先確認 Sonnet 5 的 rate limit 對你夠不夠。

看個 before/after。4.6 時代這樣寫還能跑:

{
  "model": "claude-sonnet-4-6",
  "max_tokens": 4096,
  "temperature": 0.7,
  "thinking": {"type": "enabled", "budget_tokens": 2048},
  "messages": [{"role": "user", "content": "..."}]
}

搬到 Sonnet 5,要把 temperaturethinking 拿掉,否則回 400:

{
  "model": "claude-sonnet-5",
  "max_tokens": 4096,
  "messages": [{"role": "user", "content": "..."}]
}

想要更深入的思考,改用 effort 參數(例如 "effort": "xhigh"),想要不同的輸出風格,改用 system prompt 描述,不要動抽樣參數。

成本模型換了是第二個層面。新 tokenizer 讓相同 token 計數膨脹約 30%,加上 effort 預設 high 會比 4.6 多想一輪,兩者疊起來的長期成本,要用標準價重新估算,不要用 4.6 的歷史帳單直接換算。Prompt caching 與 Batch API 一定要設起來,這兩個是吸收成本的主要機制。對重度 API 用戶,搬完之後跑兩週的 A/B 比較(4.6 與 Sonnet 5 同流量並跑),看實際成本與品質變化,再決定是否全面切換。

行為差異需要重新校準 prompt 是第三個層面。adaptive thinking 預設開、模型會多想一輪,本來寫給 4.6 的 prompt 可能會讓 Sonnet 5 想太多或走偏。新的 system prompt 寫法是用目標與限制描述,少寫「先做 A 再做 B」這種過度具體的步驟指令,讓 adaptive thinking 自己排。例如 4.6 時代寫「先列出三個方案,再比較優缺點,接著給推薦」,Sonnet 5 換成「給我採購建議,考慮成本、維運、擴充性,限制是預算一百萬以內」這種目標導向寫法,產出通常更接近你要的。

測試建議是:先在非生產環境跑兩週,把輸出與 4.6 並排比較,看品質是否真的提升或持平、成本是否在預期內。確認沒問題再切換 production,建議分階段搬,先搬低風險 workload,再搬關鍵流程。

常見迷思

最常見的,是把 Sonnet 5 當成 Opus 4.8 的等價品。最難的 coding、判斷、cyber 仍是 Opus 4.8 領先,Sonnet 5 是「逼近、在某些項目追平或略為領先」,不是等於。把推薦文寫成「Sonnet 5 已超越 Opus」是過度陳述,任何這樣講的評測或評論都該打折。

另一個誤解,是把推廣價 $2/$10 當長期折扣。9 月 1 日起回到 $3/$15,而且新 tokenizer 讓相同內容多約 30% tokens,推廣價對相同內容其實與 4.6 成本持平。長期預算用標準價。

effort 越高越好,同樣不是鐵律。high 是預設,多數任務合理;但量大或對延遲敏感的任務就該往下調:同一個 prompt 每天跑破千次,或延遲預算壓在兩秒內,往下調到 medium 甚至 low,多數情況輸出品質只掉一點點,成本卻可能差好幾倍。effort 調的是花多少,不是做多好。

「Sonnet 5 很安全,所以能做資安工作」這句只對一半。它整體不當行為率低於 4.6,是首個內建即時資安防護的 Sonnet 模型,更能拒絕惡意請求與抵抗 prompt injection 劫持。但資安能力等級較低,Firefox exploit 開發測試接近 0%,危險 cyber 評測遠低於 Opus。做防禦方工作它很好,做需要進攻能力的資安研究,要拿 Opus 4.8。

1M context 則是另一個常被高估的數字。技術上可以把整個知識庫塞進去,實務上 context 越長、recall 越差,這是所有 LLM 共通的現象。1M context 的正確用法是放完整長文件、整個 repo、整場會議逐字稿這類結構清楚的內容,不是把雜亂無章的資料全塞進去期待它找得到。

使用限制與審核邊界

幻覺與諂媚(sycophancy)率官方稱低於 4.6,但沒有公布具體數字。你要的是「比前一代低」這個方向,不是某個精確百分比。任何引用具體數字的講法,都不是官方說法。

自動化行為稽核(automated behavioral audit)上,Sonnet 5 的不當行為率略高於 Opus 4.8 與 Mythos Preview,意思是整體較 Opus 4.8 略不安全。這是 Anthropic 自己公布的,不是負評。風險敏感的企業部署,這點要納入評估,尤其在高風險決策、自動化執行、對外發送的場景,要加人類審核環節。

Sonnet 5 的同期競爭對手還有 OpenAI 的 GPT-5.6 與 xAI 的 Grok 4.5,各自在 coding、agentic、知識工作有不同的強項與定價結構,橫向比較留給那兩篇。選哪一個,看你的主要任務類型、生態綁定(IDE、雲端、API SDK)、合規需求,沒有絕對贏家,建議實際拿你的真實任務跑 A/B,比看評測分數準。

實際使用上要設計人類審核環節的幾個情境。對外發送的內容(email、公關稿、社群貼文、客服回覆)一定要人看過再送,因為 LLM 偶爾會自信地寫出錯誤事實或語氣不合的句子,這不是 Sonnet 5 獨有,但它的 agentic 能力讓它「自己跑完」的範圍變大,等於把這個風險面也放大了。涉及金額、日期、合約條款、法規解讀的輸出,必須雙重核對原始資料,不要相信它「記得」。需要原地修改外部系統的 agentic 動作(寫資料庫、改檔案、發 API 請求),最好先在沙盒或 staging 環境跑,確認行為符合預期再開放正式環境。

哪種任務絕對不要完全交給它?涉及人際判斷的(例如錄用決定、績效評估、客戶關係處理)、需要創始人直覺的(例如產品方向、品牌定位)、需要承擔法律責任的(例如醫療診斷、法律建議、投資建議)。這些領域它可以做草稿、做資料整理、做假設情境分析,但最終判斷與責任在人類身上。把這條界線畫清楚,才不會把 Sonnet 5 的 agentic 能力誤用成「代替你做決定」。

下一步:三種讀者怎麼動手

如果你是 claude.ai 訂閱用戶(Free 或 Pro),什麼都不用做,Sonnet 5 已經是預設模型。要做的是認識 adaptive thinking 與 effort,給任務時調整 prompt 習慣,少寫死步驟,多描述目標與限制。第一次試可以用一段你常做的工作,分別用 lowhigh 各跑一次,看輸出差異與成本差異,建立自己的 effort 直覺。

如果你是開發者,本來用 Sonnet 4.6 寫 API 或跑 Claude Code,先在非生產環境試跑,把舊 API 參數(手動 thinking、非預設 temperature 等)清掉,用標準價重算長期成本,把 prompt caching 與 Batch API 設起來。確認沒問題再切換 production。Sonnet 4.6 沒有強制退役,你不急的話可以分階段搬,先搬低風險 workflow,觀察兩週再擴大。

如果你是企業在評估大規模部署,走雲端夥伴(Bedrock、Vertex AI、Foundry)比較省事,帳單合規都走既有架構。要做的事是重新校準 TCO,把新 tokenizer 的 30% 膨脹、effort high 的多算一輪、Priority Tier 缺失、US-only inference 1.1 倍加價全算進去,再跟 Opus 4.8、Haiku 4.5 的混合配置比一遍(粗估:月呼叫 5,000 萬 tokens、cache 命中七成,用上面的單價套一遍,就是企業要編進預算的那個數字)。光看單價會選錯。同時要設計人類審核環節,尤其在高風險自動化場景,因為 Sonnet 5 的自動化行為稽核成績較 Opus 4.8 略差。

不管走哪條路,都別只看規格表就下判斷,拿你的真實任務實跑一週,讓數字自己說話。規格表告訴你上限,實跑告訴你均值,兩者差距就是你決策的空間。切換以後第一個月也要加強監控實際成本,新 tokenizer 的 30% 膨脹會在你意料之外的地方偷跑出來,最常見的浪費點是高 effort 跑了大量其實只需要 low effort 的任務,這個落差只有實際看用量資料才看得出來,靠感覺抓不準。

常見問題

Claude Sonnet 5 跟 Claude Sonnet 4.6 差在哪?

規格同步升級,API 標準價不變。Context 1M、最大輸出 128k 與 4.6 相同,但 adaptive thinking 預設開啟、effort 參數可調、agentic 評測大幅領先(Terminal-Bench 2.1 從 67.0 到 80.4,FrontierCode v1 從 15.1 到 38.8)。代價是新 tokenizer 讓相同文字多約 30% tokens,推廣價對相同內容大約與 4.6 成本持平,標準價則完全相同。遷移要注意手動 extended thinking、非預設 temperature 等參數會回 400。

Claude Sonnet 5 台灣能用嗎?

第三方媒體報導指出台灣可直接使用 claude.ai,免 VPN,Sonnet 5 也未受美國出口管制影響。使用前建議再確認一次 Anthropic 官方支援區域,因為區域政策會調整。要完全控制 API,可直接用 model ID claude-sonnet-5 呼叫 Anthropic API,或透過 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry。在企業雲端上跑工作流程的,走自家雲端叫 Sonnet 5 不必另開 Anthropic 帳號。

Claude Sonnet 5 真的比 Opus 4.8 強嗎?

多數面向仍是 Opus 4.8 領先。最難的 agentic coding(SWE-bench Pro)Sonnet 5 是 63.2%、Opus 4.8 是 69.2%;最難的數學與判斷也是 Opus 4.8 領先。唯一反轉的是知識工作 GDPval-AA v2,Sonnet 5 拿 1618、Opus 4.8 拿 1615,這是 Sonnet-class 首度在單一評測超越同期 Opus 旗艦。講「Sonnet 5 已等於或超越 Opus」是過度陳述,正確說法是「逼近、部分項目追平、知識工作略為領先」。

Claude Sonnet 5 一個月要花多少錢?

訂閱制與計量制結構不同。claude.ai Free 方案零成本,Pro 方案是固定月費,不逐 token 收錢。API 計量制推廣期 $2/$10(每百萬 tokens),9 月起 $3/$15,實際花費取決於你的 token 用量,而新 tokenizer 讓相同內容多約 30% tokens。例如每天 1,000 次呼叫、每次約 10,400 tokens 輸入與 2,600 tokens 輸出,推廣期一天約 $46.8,9 月起標準價一天約 $70.2。把 prompt caching 與 Batch API 設起來可以把這數字再壓一大塊。

Claude Sonnet 5 適合寫程式嗎?

適合,而且是它的主力場景之一。SWE-bench Verified 85.2%、Terminal-Bench 2.1 80.4%、CursorBench(Cursor 獨立測)61.2%,都是 Sonnet-class 的高點。Claude Code 直接把它當 Pro 與 Team Standard 的預設模型。但最難的大型 repo 重構與複雜除錯,SWE-bench Pro 仍落後 Opus 4.8 約 6 分,企業關鍵開發建議混用 Opus 4.8 處理最難的任務。

Claude Sonnet 5 何時會被取代?

官方沒有公布下一代發表時程。Sonnet 4.6 已發表四個多月就被 Sonnet 5 接替,但這不是固定週期。Sonnet 4.6 API 退役日不早於 2027 年 2 月 17 日,所以即使下一代發表,4.6 仍會維持一年以上的可用期。Sonnet 5 是否沿用類似的支援週期,官方還沒說;4.6 那個至少到 2027 年 2 月 17 日的期間,是目前唯一公開的參考。要追最新時程,以 Anthropic 官方公告與 Models overview 為準。

留下你的問題或補充

你的電子郵件不會被公開。