本篇內容
Claude Sonnet 5.5 是 Anthropic 在美國時間 2026 年 9 月 28 日發布的中階模型,Claude 5.5 家族第二款,台灣時間 9 月 29 日上午起陸續在全球平台上線。依Anthropic 發布公告,比前代 Sonnet 5 明確升級、輸出速度快 30% 以上、多數工作每個任務的成本最多省 30%,API 牌價維持每百萬輸入 token 2 美元、輸出 10 美元。
型號命名容易讓人以為是小改版,但這次的變化橫跨三個層面:跑分在 agentic coding 出現跳升,Terminal-Bench 4.0 從前代的 10.3% 拉到 70.6%;帳單結構變了,模型用更少 token 做完同一件事;安全機制變了,它是第一個掛上 cyber safeguards 與蒸餾防護分類器的 Sonnet,thinking 也第一次跟帳號綁定。這三件事對「直接用 API 的開發者」與「只用 claude.ai 訂閱的人」影響不同,中間還夾著一個必須先處理的破壞性變更:關閉思考的模式從 disabled 換成 between_tools,沒先改程式碼就搬不過去。
在 API 上跑 Sonnet 5 的開發者,遷移清單那節可以直接當 checklist 用;只在 Claude Code 或 Claude 網頁版上使用的人,看 effort 設定與安全兩節就夠。
TL;DR
Claude Sonnet 5.5 是 Claude 5.5 家族第二款模型,美國時間 2026 年 9 月 28 日發布,定位是 Opus 5.5 更快、更便宜的互補者:規格清楚、量大、要快的日常任務交給它。
評測出現跳升:Terminal-Bench 4.0 從前代的 10.3% 拉到 70.6%,兩項知識工作評測貼近 Opus 5.5,差距只剩 2 分上下。
API 牌價不變:每百萬輸入 2 美元、輸出 10 美元;省錢來自 token 用量下降,官方宣稱每個任務成本最多省 30%,這不是降價。
API 遷移有五個破壞性變更,最常見的地雷:關閉思考的模式必須從 disabled 改成 between_tools,沒先改程式碼就搬不過去。
Claude Sonnet 5.5 的定位:Claude 5.5 家族第二位成員
Anthropic 的模型線在 2026 年下半年重排過一次:旗艦判斷力由 Fable 與 Mythos 系列守住,Opus 負責複雜且需要長時間謹慎判斷的工作,Sonnet 是多數日常任務的主力,Haiku 走量大與成本敏感的路線。Claude 5.5 家族按這個架構依序補位,Opus 5.5 在 9 月 22 日打頭陣,Sonnet 5.5 相隔六天上場,官方同時預告 Haiku 5.5 會在數週內加入。
官方對 Sonnet 5.5 的角色設定寫得具體:它是 Opus 5.5 更快、更便宜的互補者。Opus 5.5 為需要謹慎判斷的複雜工作而生,Sonnet 5.5 則在範圍清楚的日常任務上最強,修 bug、產出整理過的文件、投影片與試算表,官方還特別提了它對設計細節的掌握。用一句話分工:難判斷的開放性問題交給 Opus,定義完整、要快要多要做好的工作交給 Sonnet。
跟前代的關係可以濃縮成「規格繼承、價格不變、行為改版」。上下文視窗同樣是 1M tokens,輸出上限同樣 128K,分詞器與 Sonnet 5 相同,同一段文字算出來的 token 數一致;真正的差異在模型行為:每個任務消耗的 token 變少、輸出變快、思考的深度改由重新校準過的 effort 控制。前代產品的完整脈絡,包含它發布時的推廣價爭議與規格細節,站內的 Sonnet 5 發布時的規格與定價背景有完整整理;同家族前款 Opus 5.5 的深度解析則把這一代家族共同的改版邏輯講得更細。
發布當天 Anthropic 在 X 上用一支影片交代重點,30% 的速度提升與最多 30% 的成本下降是整支影片的兩個主軸。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family.
— Claude (@claudeai) September 28, 2026
It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work. pic.twitter.com/UvXD8mDTF1
規格面整理成一張表。逐欄檢視時值得留意三個地方:知識截止仍是 2026 年 6 月,跟 Opus 5.5 相同;預設 effort 在 API 是 high,但 Claude Code 與官方 app 是 medium,同一個模型在不同入口的行為不一樣;退役承諾寫明不早於 2027 年 9 月 28 日,企業規劃時程有明確的下限。
| 項目 | 內容 |
|---|---|
| 發布日期 | 美國時間 2026 年 9 月 28 日(台灣時間 9 月 29 日上午) |
| 定位 | Claude 5.5 家族第二款;範圍清楚的日常任務、修 bug、文件與簡報產出 |
| API model ID | claude-sonnet-5-5(Amazon Bedrock 為 anthropic.claude-sonnet-5-5) |
| 上下文視窗 | 1M tokens |
| 最大輸出 | 128K tokens;Batch API 加 beta header 可到 300K |
| 輸入/輸出型態 | 文字與圖片輸入,純文字輸出 |
| 知識截止 | 2026 年 6 月(訓練資料同月) |
| 思考模式 | adaptive thinking 預設開啟;最低檔為 between_tools |
| 預設 effort | Claude API 為 high;Claude Code 與官方 app 為 medium |
| 延遲等級 | 快;輸出比 Sonnet 5 快 30% 以上 |
| API 牌價 | 每百萬輸入 2 美元、輸出 10 美元 |
| 退役承諾 | 不早於 2027 年 9 月 28 日 |
1M 指的是 token 容量,不能直接換算成固定的中文字數。中文、英文、程式碼與圖片占用量不同,系統提示、工具定義與對話歷史也會占用上下文;匯入大量資料前,應用官方 token counting 端點估算,並預留輸出空間。128K 輸出上限則是同步 API 的單次回應上限,要一次生成超長文件,走 Batch API 並掛延長輸出的 beta header 可以放到 300K,批次本身另有半價折扣。上下文視窗、知識截止這些規格欄位到底怎麼影響使用判斷,LLM 規格欄位的讀法有更基礎的拆解。 比較規格時也可看 Gemini 4 Argon 的百萬 token 輸出上限,注意它談的是輸出容量,不能直接與這裡的上下文視窗對比。

發布節奏放在更大的市場脈絡裡看更清楚。同一週 OpenAI 才更新了中階的 Sol 與低價的 Luna,Meta 也發表了新模型,各家媒體把這波描述為中階模型的新一輪纏鬥。TechCrunch 的第一時間報導給 Sonnet 5.5 的註解是「明顯更便宜、更快的工作夥伴」,並點出它在 agentic coding 的部分評測贏過 Opus 5.5 的現象。中階主力之爭的比較基準正在從「誰最聰明」移向「同樣的錢買到多少做完的任務」,這也是 Sonnet 5.5 整份規格書的主敘事。
評測跳升怎麼讀:三個大幅領先、兩個接近 Opus 5.5、三個保留
先把結論放在前面:三個 agentic 評測對前代大幅跳升、兩個知識工作評測貼近 Opus 5.5,還有三個解讀時要保留的地方。官方評測表把 Sonnet 5.5 跟 Sonnet 5、Opus 5.5、GPT-6 Sol 放在同一張表裡,先看數字,再談怎麼讀。

| 評測 | 測什麼 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 終端機多步驟 agentic coding | 70.6% | 10.3% | 66.4% | 未公開 |
| FrontierCode 1.1(Main) | 程式碼變更能否直接合併 | 52.1%(Xhigh) | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 真實 Cursor 工作階段的多檔任務 | 55.5% | 34.1% | 57.8% | 未公開 |
| GDPval-AA v2.1 | 44 種職業、九大產業知識工作 | 1,844 分 | 1,449 分 | 1,846 分 | 1,487 分 |
| AA-Briefcase v1.1 | 長鏈知識工作 | 1,811 分 | 1,359 分 | 1,822 分 | 1,483 分 |
| Humanity’s Last Exam | 跨領域推理(允許工具) | 64.5% | 54.9% | 67.7% | 未公開 |
| OSWorld 2.1(部分評估) | 電腦操作 | 80.1% | 57.0% | 81.8% | 未公開 |
| Chartography(不用工具) | 圖表視覺辨識 | 61.6% | 15.6% | 64.4% | 53.6% |
三個大幅領先的項目都是前代明顯弱的地方。Terminal-Bench 4.0 測的是模型在命令列環境裡獨立完成多步驟專業任務的能力,Sonnet 5 只有 10.3%,Sonnet 5.5 直接拉到 70.6%,這一代差 60 個百分點,而且高過 Opus 5.5 的 66.4%。CursorBench 取材自真實 Cursor 編輯器的工作階段,測模糊規格下的多檔修改,從 34.1% 到 55.5%,距離 Opus 5.5 的 57.8% 只剩 2.3 個百分點。Chartography 測不使用工具輔助的圖表辨識,從 15.6% 跳到 61.6%,這反映該圖表辨識評測的改善,與設計能力仍是不同面向。
兩個「接近 Opus 5.5」的項目更有決策意義。GDPval-AA 跨 44 種職業與九大產業出題,Sonnet 5.5 拿 1,844 分,只比 Opus 5.5 的 1,846 分低 2 分,比前代多將近 400 分;AA-Briefcase 測長鏈條的知識工作,1,811 對 1,822,同樣貼著旗艦級的兄弟跑。翻譯成採購語言:在這兩項知識工作評測上,Sonnet 5.5 以一半的輸入/輸出單價(輸入 2 對 4 美元、輸出 10 對 20 美元)取得接近的分數;是否能在實際工作提供同等產出,仍需依驗收標準比較。
讀這張表還要會看「未公開」這三個字。這份官方表格未列出 GPT-6 Sol 在 Terminal-Bench、CursorBench、Humanity’s Last Exam、OSWorld 的對照成績,Terminal-Bench 與 CursorBench 的成本曲線改放 GPT-5.6 Sol 當參照,因此不能把不同模型版本的曲線當成 GPT-6 Sol 的成績;Opus 5.5 的 Terminal-Bench 66.4% 是它 Xhigh 檔位的最高分,不是隨便一個設定值。還有兩項自成一類:Humanity’s Last Exam 測跨領域推理,允許用工具的版本 5.5 拿 64.5%,輸給 Opus 5.5 的 67.7% 但贏前代近 10 個百分點;OSWorld 測實際操作電腦的完成率,80.1% 對 81.8%,差距 1.7 個百分點。Chartography 則是 64.4% 對 61.6%,差 2.8 個百分點。這些分差是否影響選型,取決於任務、錯誤代價與實測結果,不能只看單一評測下結論。
Terminal-Bench 那個 60 個百分點的跳升值得單獨消化,因為它改變的不是分數而是可用性邊界。終端機環境的多步驟任務,正是 Claude Code 與各種 coding agent 的日常:讀專案、跑指令、看輸出、改檔案、再驗證。前代 Sonnet 5 在這條線上只有一成的完成率,顯示它在該評測設定下較常失敗;70.6% 代表該測試集的完成率大幅提高,不能直接視為任意專案的自動完成機率,這也是為什麼 GitHub 官方的早期測試把重點放在「更少步驟、更少工具呼叫」而不是單純的聰明程度。當然,評測環境終究是評測環境,自己的 codebase 才是最終的考卷。
但這張表有三個必須保留的地方,直接照單全收會誤判。第一,評測方法有註記:GDPval-AA 與 AA-Briefcase 是在預發布部署上跑的,該版本有個會影響結構化輸出的 bug,官方說影響輕微且方向是低估,但「低估多少」沒有數字;GPT-6 Sol 的圖表辨識分數則是在 OpenAI 修復一個影像理解 bug 之前量的,可能沒反映最新版本。第二,這是 Anthropic 彙整的官方對照表,其中部分成績由 Artificial Analysis 等外部評測者執行,不能把整張表都當成自家測試,也不能視為同一條件下的獨立全面複驗,國外專門追模型的媒體在報導裡也明講「省 30%、快 30% 這類宣稱仍待獨立測試確認」。第三,官方自己在公告裡寫了但多數轉載會漏掉的一句:在需要持續判斷的複雜開放性工作上,Opus 5.5 仍然明顯更強。
還有一個反直覺的細節值得單獨看:FrontierCode 在 Max effort 的分數(46.2%)反而比 Xhigh(52.1%)低。官方的解釋是,Max effort 下模型更常主動叫出自己的 code review 流程,把審查拆給多個子代理,其中兩個被檢視的案例因此超時或做了超出範圍的修改,而 FrontierCode 的計分方式會懲罰超出範圍的變更。這不是模型變笨,是「更賣力」與「更符合驗收標準」在某些評測裡會反向,對實際使用的啟示很直接:effort 不是開到最大就最好,任務有明確驗收線時,中高檔常常是更好的選擇。
官方還給了一組「分數對上每個任務成本」的曲線,結論比單一分數實用:在 Low 或 Medium effort,Sonnet 5.5 就能用大約十分之一的每任務成本超過 Sonnet 5 的最佳分數;在 AA-Briefcase 上,Medium effort 的成績約只要前代最佳成績的九分之一成本;FrontierCode 的 High effort 則以大約五分之一的每任務成本追平 GPT-6 Sol 的最佳分數。換句話說,升級的紅利不只是「變強」,而是「在低檔位就夠強」,這對大量批次處理的場景影響最大。順帶一提,它也是第一個只靠截圖就破關 Pokémon Red 的 Sonnet,官方把這個當長鏈視覺任務能力的註腳。
快 30%、省 30% 的機制:省在 token 用量,不是單價
「成本最多省 30%」容易被讀成降價,其實牌價一毛沒動,兩個數字講的是不同層。輸入每百萬 2 美元、輸出 10 美元、快取讀取 0.2 美元,全部與 Sonnet 5 相同;省的錢來自第二層:同樣的任務,Sonnet 5.5 消耗的 token 變少,帳單是單價乘上用量,用量降,總價就降。速度那 30% 也是獨立的第三件事:模型生成輸出的速度加快 30% 以上,官方稱它是最快的 Sonnet。

token 用量為什麼會變少?官方與 early tester 的觀察指向同一個行為改變:Sonnet 5.5 更會把工具呼叫批次化,一次回合同時發出多個相關呼叫,步驟變少、中介的推理文字也變少。幾個有具體數字的案例可以對照著看。資產管理公司 Balyasny 在 2,441 道私有的金融任務上量測,Sonnet 5.5 每個答案平均用約 12.1 萬 token,Sonnet 5 用 49.7 萬,是 5.5 的四倍有餘;Slack 的離線評測顯示幾乎所有項目變好,輸出 token 少約 14%;Lovable 的程式碼評測少了三分之一的工具呼叫與大約一半的 shell 執行次數;Base44 拿 118 個真實 app 開發案對照,Sonnet 5.5 的產出水準與 Opus 5 相當,但平均每案 3.6 次反覆修改就完成,Opus 5 要 7.7 次,失敗的工具呼叫也是所有受測模型中最少。
這些數字全部來自 Anthropic 或其合作廠商,立場要記在心裡,但方向彼此一致,而且跟官方成本曲線互相印證。對使用者的實際意義是:模型行為改善可能降低 token 用量,但單靠換 model ID 不保證帳單下降;仍要比較相同任務的完成率、重試次數、effort 與總用量。
客服與企業服務場景的量測把「快」翻譯成了營運指標。Zendesk 餵了數百個真實支援案例,判斷錯誤變少、票單處理速度快 20%;Box 在金融與醫療客戶的文件工作裡量到精確度提升、速度快 2.4 倍、總 token 少 12%,而且它會回頭核對來源文件裡的數字,抓到前代漏掉的錯;Atlassian 預期客戶的 Rovo 代理跑起來比 Sonnet 5 快最多 30%;Unity 的多步驟編輯器評測裡,5.5 完成九成任務,勝過同級模型。Epic Games 的觀察則補上一個工程團隊會懂的細節:它管理數萬行遊戲系統架構程式碼、撐得住多小時任務、回應保持明快,而且需要更少的指示性 prompt。這些都是單一廠商的回報,但涵蓋的產業型態夠雜,交叉參考的價值比任何單一數字高。
effort 是這一代 Claude 控制思考深度、延遲與成本的共同旋鈕,從 low 到 max 五段。Sonnet 5.5 的 effort 刻度重新校準過,同一個檔位不會再有跟 Sonnet 5 一樣的思考量,官方明確建議不要把舊設定直接搬過來,要重新掃一輪。官方給的起點:一般任務從 high 開始;agentic coding 與多步驟工具呼叫,定義清楚的任務從 medium 起跳,難的再拉到 high;聊天與延遲敏感的應用從 medium 或 low 開始。實際在 Claude Code 裡怎麼搭配工作流,官方effort level 教學有完整展開,Claude Code 本身的安裝與操作脈絡,站內的 Claude Code 完整教學另有一篇。
預設值的差異容易踩坑:同一個模型,Claude API 與 Claude Platform 的預設 effort 是 high,Claude Code 與官方 app 卻是 medium。從 API 搬到 Claude Code 或反向搬的時候,同一句 prompt 的 token 消耗與回應深度會不同,比較成本時要先確認兩邊的檔位一致再下結論。

價格:$2/$10 的真相,與那次沒有發生的漲價
完整費率先攤開。Sonnet 5.5 每百萬輸入 2 美元、輸出 10 美元;快取寫入(有效期 5 分鐘)2.5 美元、(有效期 1 小時)4 美元;快取讀取 0.2 美元;Batch API 輸入輸出都半價,等於 1 美元與 5 美元。全部欄位與 Sonnet 5 相同。
| 模型 | 輸入/輸出(每百萬 token) | 快取讀取 | 定位 |
|---|---|---|---|
| Claude Fable 5.1 | 10/50 美元 | 0.25 美元 | 頂級判斷 |
| Claude Opus 5.5 | 4/20 美元 | 0.20 美元 | 複雜開放性工作 |
| Claude Sonnet 5.5 | 2/10 美元 | 0.20 美元 | 日常主力 |
| Claude Sonnet 5 | 2/10 美元 | 0.20 美元 | 前代(legacy) |
| Claude Haiku 4.5 | 1/5 美元 | 0.10 美元 | 量大、成本敏感 |
「與 Sonnet 5 同價」這句話需要一段 backstory 才算講清楚。Sonnet 5 在 2026 年 6 月 30 日上市時,$2/$10 被官方定調為推廣價,只到 8 月 31 日,之後排定回到標準價 $3/$15,站內當時的 Sonnet 5 分析也是按這個排程提醒長期成本要用 $3/$15 估算。事後的發展是:那波調漲取消了。現在查官方完整價目表,Sonnet 5 的欄位寫 $2/$10,附註明確交代「2026 年 8 月 31 日到期的推廣價改為常規價,原定 9 月 1 日調漲至 $3/$15 不會發生」。所以 Sonnet 5.5 的「同價」是跟一個已回到常規價 $2/$10 的前代對齊,不是延長推廣價;用 $3/$15 做的舊成本模型都需要重算,而且這次是往下降。
橫向看競品,這個價位帶的競爭強度不難理解。OpenAI 的 GPT-6 Sol 同樣是 $2/$10,與 Sonnet 5.5 正面對齊,低一階的 GPT-6 Luna 則壓到 $0.10/$0.50 搶量大的市場;SpaceXAI 的 Grok 4.7 是 $2/$6,輸出單價更低。國外 追蹤 AI 模型的媒體把這波對位整理成:Opus 略高於 Sol、Sonnet 高於 Luna、Fable 高於 Astra,各對的效能差距小到成本可能成為決勝點。GPT-6 Sol 的價格與跑分細節,站內GPT-6 Sol 拆解有完整交代;Grok 4.7 的費率結構與比較陷阱,Grok 4.7 評測另有一篇。
實際帳單試算一輪,把單價與用量兩層合起來看。假設一個任務固定消耗 30 萬輸入與 2 萬輸出 token,Sonnet 5.5 的牌價成本是 0.6 美元加 0.2 美元、共 0.8 美元;若純粹作情境試算,假設輸入與輸出都各減少 30%,同樣費率下會是 0.56 美元;這是算式示例,不能當作實測或承諾。有大量重複前置內容的場景再加快取:系統提示與工具定義寫入快取後,每次讀取只要輸入價的十分之一,1M 上下文的長對話應用靠這個才有辦法把成本壓住。快取寫入本身要錢,5 分鐘版每百萬 2.5 美元、1 小時版 4 美元,以同一段內容未快取時的輸入費用為基準,5 分鐘快取在寫入後再命中一次即較省,1 小時快取則需再命中兩次;若前綴變更或快取到期,必須重新計算。可快取的最小提示長度是 512 token,比 Sonnet 5 的 1,024 低一半,小型整合也用得上。要壓更低,非即時的批次處理直接半價。官方 模型總覽文件的規格頁把這些欄位列在同一張表裡。
成本估算還有一個容易漏的帳:思考的 token 計費。Sonnet 5.5 的 adaptive thinking 預設開啟,思考消耗的 token 按輸出價計費,max_tokens 上限同時涵蓋思考與正文。從前代或更早模型搬過來的整合,如果 max_tokens 沿用舊值,可能出現「還沒寫完正文就撞上限」的新狀況;官方遷移指南把重新檢視 max_tokens 列為標準步驟。反過來說,effort 調低之後思考變短,同一個上限又會變得寬裕,這也是為什麼 effort 要重掃:它同時改三個變數,思考長度、回應速度與每任務成本。

安全與防護:第一個掛 cyber safeguards 的 Sonnet
這次發布裡最實質的行為變化不在跑分,在防護。Sonnet 5.5 的資安能力大幅超過前代,官方系統卡的評估寫得直白:它不如 Opus 5.5 與 Mythos 5.1,但開發精密攻擊手法的能力遠高於 Sonnet 5。能力升級觸發了防護升級,Sonnet 5.5 是第一個出廠就掛上 cyber safeguards 與 fallback 機制的 Sonnet,規格與 Opus 5.5 使用的三段式防護相同。
實際行為是這樣:一般軟體開發不受影響,在自己的程式碼裡找漏洞、修弱點都照常;但被分類為高風險的資安任務,模型會「看得到地」退回 Sonnet 5 執行,回應會標記這件事。API 層的拒絕原因分成五類:cyber(可能造成資安危害)、bio(可能造成生物危害)、frontier_llm(協助開發競爭模型)、reasoning_extraction(要求模型在輸出文字裡重現內部推理)、general_harms(其他違反使用政策的領域)。在 Claude API 明確啟用 beta server-side fallback 後,官方預設路由才會把 cyber 與 frontier_llm 類別重試到 Sonnet 5,其餘類別不會依此路由重試;不能假設每個 API 請求都自動切換。Amazon Bedrock、Google Cloud 與 Microsoft Foundry 需依官方 fallback 文件設定客戶端處理。做資安研究或滲透測試相關工具的團隊,遷移前要先把這條行為納入測試計畫:同一個 prompt 在 Sonnet 5.5 上可能換到一個 fallback 回應,程式碼要能處理 stop_reason 為 refusal 的回應型態。需要更高階資安能力的防禦方,可以申請即將擴大受理的 Cyber Verification Program,分級取得 Sonnet 5.5、Opus 5.5 與 Mythos 系列的進階能力。
生物安全防護沿用 Sonnet 5 那一組,沒有升級也沒有放寬。一般研究、教育與臨床工作不受影響,但官方明言某些微生物學與病毒學的請求可能被誤判攔下,誤判的解方是 Life Sciences Verification Program。生技領域導入時先把這條界線跟法務或合規對過一次,比上線後再個案處理省事。
工程面要處理的細節:拒絕不是 HTTP 錯誤,而是 HTTP 200 搭配 stop_reason 為 refusal 的回應,附帶的 stop_details 會標明政策領域,程式碼要把它當成一種正常的完成型態來分支處理。計費與限速也有但書:在任何輸出產生前就抵達的拒絕,是否計費依拒絕類別而定,但無論如何都會計入速率限制,高流量服務要把這個算進容量規劃。除了官方 server-side fallback,也可以用 SDK 中介層或自建重試,把特定類別的拒絕導向別的模型,這對混合排程的架構是比較乾淨的做法。
蒸餾攻擊的防護是另一個第一次。蒸餾攻擊指攻擊者用大量假帳號以工業化規模抽取模型能力,官方因為 Sonnet 5.5 能力遠高於前代,首次在 Sonnet 級模型加上阻止推理抽取的安全分類器,對應到 API 層就是 reasoning_extraction 這個拒絕類別。模型輸出的來源辨識是同一條信任鏈的另一半,Claude 輸出文字裡的浮水印統計標記先前拆解過,與這次防護處理的問題不同:推理抽取防護限制能力提取,浮水印則提供來源辨識訊號,不能保證所有改寫或擷取後的內容都可辨認。
代理式安全有獨立的好消息。系統卡裡的間接提示注入評測(Gray Swan 與英美 AI 安全機構合作的 IPI 基準)顯示,攻擊者在 15 次嘗試內的成功率是 3.4%,前代 Sonnet 5 是 6.7%;分環境看,coding 場景 0.7% 對 0.9%、工具呼叫 1.0% 對 6.0%、圖形介面操作 12.5% 對 17.2%。它比所有受測的非 Claude 模型都穩,其中表現最好的 Gemini 3.8 Flash 在 15 次內也有 5.5% 的成功率,Anthropic 稱它是迄今對提示注入最穩健的 Sonnet 級模型,特別是在 coding 環境與瀏覽器操作。對照它的容器逃逸評測也是全系模型中嘗試率最低的。整體對齊評估方面,約 1,850 個情境的自動行為稽核顯示它在多數指標持平或優於 Sonnet 5,完整方法與限制見Claude Sonnet 5.5 系統卡。
誠實條款也要記錄:系統卡同時寫到,它在部分多輪測試(追蹤與監控類)有些微退步,對政治類 prompt 的拒絕與平衡性則變好;它的思考文字比多數前代模型更難讀。沒有任何一套評測能抓到全部問題,官方自己也這麼寫,這是為什麼行為防護要跟能力一起部署。
preserved thinking 與帳號綁定:在 Claude Code 切換帳號的團隊要看
先把名詞說清楚。Claude 的思考過程會以加密的 thinking block 隨回應傳回,把這些 block 原封不動送回下一輪,模型就能延續先前的推理,不必重想,這就是 preserved thinking。多數人不需要理解它,因為 claude.ai、Claude Code、Managed Agents 與 Agent SDK 都自動處理。Sonnet 5.5 把這套機制往前推了一步,也是這次發布裡最容易被忽略、但會改變某些工作流程的一條:Sonnet 5.5 產生的 thinking block 綁定產生它的帳號,只在原帳號或與之連結的帳號裡有效。

實際行為是:另一個帳號送來 Sonnet 5.5 的 thinking block 時,API 會在模型看到之前靜默丟棄該 block,請求本身照常成功,模型只是少了那段推理;若是配合 beta header,回應裡會以 organization_binding_mismatch 標註每個被丟棄的 block。這對一般使用者幾乎無感,但有一個具體場景會踩到:在 Claude Code 裡做到一半切換帳號。官方公告直接點名這個情境,把對應說明放在 preserved thinking 文件。跨帳號接手工作階段的團隊,遷移後要先測這條路徑:工作階段換手後模型等於失去前半段的推理,行為會退化成「看得到歷史訊息但看不到思考」。
第二個相關變更是對話綁定檢查。thinking block 有效性取決於它之前的整段前綴(系統提示、工具定義、之前的訊息)沒有被改過;改了 system prompt、換了工具清單或編輯了歷史訊息再重送 block,會得到 400 錯誤或 block 被丟棄,取決於帳號與設定。2026 年 8 月 31 日之後建立的帳號預設強制這個檢查,更早的帳號要主動開。官方給的工程準則很簡單:把對話當成只能附加的紀錄,要改指示就用對話中的系統訊息,不要回頭編輯。被丟棄的 block 不計費,但模型可能要重新思考,token 用量反而上升。
模型之間的搬移規則也變了,跟遷移決策直接相關。Sonnet 5.5 讀得懂 Sonnet 5、Opus 4.8、Haiku 4.5 與更早模型的 thinking block,所以從 Sonnet 5 搬到 5.5,推理延續不中斷;反向不成立,沒有任何模型讀得懂 Sonnet 5.5 的 block,從 5.5 搬去別的模型,換手後的輪次會在沒有先前推理的狀態下執行,包含安全 fallback 把請求轉去 Sonnet 5 的時候。API 一律先丟棄再送進模型,不報錯也不計費,但如果你自己的程式把歷史裡的 block 清掉,那些推理就真的消失了。
遷移清單:五個破壞性變更與 between_tools
官方新版文件列了五項破壞性變更,可能導致請求報錯或既有推理無法延續,加一個不改程式碼也會發生的行為差異。逐條展開前先給結論:絕大多數只做聊天、寫作、簡單工具呼叫的整合,改 model ID 就能動;會踩雷的是關閉思考、強制工具呼叫、電腦操作與 advisor 工具這四種整合。

- 思考關閉改用 between_tools。Sonnet 5 上送 thinking type disabled 的請求,在 5.5 會收到 400 錯誤,錯誤訊息會指向新設定。between_tools 關閉前置思考,保留工具呼叫間的簡短進度更新,這些更新仍以帶摘要的 thinking blocks 回傳;沒有使用工具時,回應只包含文字;只吃 low、medium、high 三個 effort 檔位,掛 xhigh 或 max 會報錯,也不能跟 display、budget_tokens、block_binding 任何一個欄位共存,而且對話中途不能換 effort。要中途換檔位就用 adaptive(不送 thinking 欄位即是)。
- 強制工具呼叫被移除。tool_choice 設成 any 或指定工具名稱會直接 400。Claude API 可改用 auto 加上 strict tool use 的 schema,或改用結構化輸出;strict 只約束工具輸入格式,不保證一定呼叫工具。Amazon Bedrock 上這款模型不支援 strict tool use,應使用 auto,於 prompt 說明呼叫時機,並在程式內驗證輸入。token 計數端點同樣檢查這條。
- thinking block 綁定模型與對話。上一節完整講過。Sonnet 5、Opus 4.8、Haiku 4.5 與更早模型的 thinking blocks 可延續;Opus 5、Opus 5.5、Fable 與 Mythos 的 blocks 則會被丟棄,不能概括為只支援 Sonnet 5。
- 電腦操作工具換代。Claude API 與 Google Cloud 上,舊的 computer_20251124 工具宣告會被 400 拒絕,要改用 computer_toolset_20260801 工具集;Amazon Bedrock 上舊工具仍可用。已經用工具集或瀏覽器操作工具的整合不必動。
- advisor 工具配對限縮。5.5 的執行者不再接受 Opus 4.8、Opus 4.7、Sonnet 5 當顧問,要用 Mythos 5.1、Fable 5.1、Mythos 5、Fable 5、Opus 5.5、Opus 5 或 5.5 自己。顧問回傳的建議一律加密,客戶端讀不到內文。
不改程式碼也會遇到的是回應形狀的變化:工具呼叫之間,超過一兩句的過程說明會改放進 thinking block 裡回傳,預設的 display 設定下這些 block 文字是空的。如果你的介面本來會把工具之間的進度文字串流給使用者看,升級後會出現「安靜期」,畫面卡在工具執行中卻沒有文字。解法二選一:adaptive 模式下設定 display 讓文字回傳,或改用 between_tools,並從 thinking blocks 讀取工具間的摘要文字。還有三個小變更順手記下:非預設的 temperature、top_p、top_k 一律 400;可快取提示的最小長度從 1,024 token 降到 512;per-message effort、對話中系統訊息、對話中工具變更這三個 Sonnet 5 沒有的功能在 5.5 開了。
兩個工程細節容易在壓測時才爆出來。其一,舊版 SDK 還沒定義 between_tools 這個值,Python 與 TypeScript 的型別檢查會直接失敗,要嘛升級 SDK,要嘛照 C#、Go、Java 的範例把值當原始 JSON 傳。其二,between_tools 與安全 fallback 有互動:一個 between_tools 的請求若被 fallback 到 Sonnet 5,會在 Sonnet 5 上以 disabled 模式執行,行為接得上,但你的程式要能同時消化兩種回應形狀。官方 whats-new 文件把這些互動寫得很完整,遷移前的對照清單以它為準。
官方在遷移指南裡給了一份按起點模型分組的完整清單,Claude Code 裡也內建了自動化工具,跑 /claude-api migrate this project to claude-sonnet-5-5 會自動換 model ID、處理不相容參數與 prefill、重新校準 effort,結尾產出需要人工確認的清單,連 Bedrock 與 AWS 版平台的 client 都認得。官方遷移指南是逐步教學的權威版本,照著走比憑記憶改穩。
取得路徑:從 API 到 GitHub Copilot 都已開放
與 Opus 5.5、Sonnet 5 相同,Sonnet 5.5 從第一天就全平台供應,而且提供零資料保留選項,對資料出境與法規敏感的企業這是硬條件。模型 ID 依平台有兩種寫法:Claude API、Google Cloud、Microsoft Foundry 與 Claude Platform on AWS 都是 claude-sonnet-5-5,Amazon Bedrock 是 anthropic.claude-sonnet-5-5。Anthropic 的官方帳號也在發布當天同步公告了供給消息。
Claude Sonnet 5.5 is now available: https://t.co/DuxGkiPLRY
— Anthropic (@AnthropicAI) September 28, 2026
不用 API 的開發者,最快的入口是 GitHub Copilot。上線當天 Copilot 就把 Sonnet 5.5 開給 Pro、Pro+、Max、Business 與 Enterprise 方案,模型選單出現在 VS Code、Visual Studio、Copilot CLI、GitHub Copilot coding agent、Copilot app、github.com、行動版 GitHub(iOS 與 Android)、JetBrains 全家、Xcode 與 Eclipse,採漸進推出,選單裡沒看到就再等幾天。計費走供應商牌價的用量計費;Business 與 Enterprise 的管理員可以在 model policy 裡控制開關,預設政策下新模型自動啟用,除非管理員先前關掉全域預設或明確停用。GitHub 官方在changelog 公告裡給的早期測試結論,與 Anthropic 的敘事一致:coding 任務與 Sonnet 5 同水準,步驟、token 與工具呼叫都明顯更少,完成速度更快。
訂閱制使用者的路徑更簡單;Claude Code 訂閱與 API 費用分開計算,不宜把每 token 降本等同月費調降。claude.ai 與 Claude 手機 app 的模型選單直接選,Claude Code 同日跟進,預設 effort 是 medium。要驗證自己是不是真的用在 5.5 上,應查看模型選單、工具設定或 API 回應的 model 欄位;速度與回答風格無法可靠辨認模型版本,別靠單一問答的「自我介紹」判斷,模型的自我認知向來不可靠。
怎麼選:跟 Opus 5.5、GPT-6 Sol 與開放權重模型的對位
先處理最常被問的:Sonnet 5.5 會不會取代 Opus 5.5?依官方公布的評測數字,不會。跑分上 5.5 在多個項目貼近甚至超過 Opus 5.5(Terminal-Bench 直接超過,OSWorld 只差 1.7 個百分點),但官方公告自己寫明:在需要持續判斷的複雜開放性工作上,Opus 5.5 在官方內部與外部測試都仍然明顯更強。選擇的判準不是「誰平均分高」,是任務形態:規格清楚、量大、要快,選 Sonnet 5.5,用一半單價拿到貼近的產出;架構決策、開放性問題、要長時間謹慎判斷的工作,Opus 5.5 的位置沒被動搖。兩者也可以分工,有 early tester 的實際做法是讓 Opus 定架構與框架、Sonnet 5.5 做實作,這在遊戲開發的測試回報裡被具名肯定。

跨陣營對上 OpenAI,價格完全對齊的 GPT-6 Sol 是最直接的對照組。官方評測數字裡 Sonnet 5.5 在 FrontierCode 的 Xhigh 成績(52.1% 對 49.3%)與知識工作兩個評測(領先約 330 到 360 分)都高於 Sol,且官方宣稱在 FrontierCode 用約五分之一的每任務成本追平 Sol 的最佳分數;但這些是 Anthropic 的量法,Sol 在 OpenAI 生態裡的整合優勢與既有工作流慣性不會反映在跑分上。已經重度使用 OpenAI 工具鏈的團隊,換模型的理由要建立在每任務成本差異夠大,反之亦然。
第三條路是開放權重。需要離線部署、資料完全不出門、或想自己控制推論成本的團隊,開放權重的寫程式模型 GLM-5.3 這類選項的能力水位正在爬升,換取的是自己扛基礎設施與沒有官方工具鏈的代價。封閉 API 的優勢在這次發布裡反而更清楚:effort 校準、快取、批次、安全 fallback、遷移工具,整條鏈是現成的。
非工程職能的應用判斷也實用。Sonnet 5.5 在知識工作評測貼近 Opus 5.5、又對版面與設計有敏感度,文件、簡報、試算表這類辦公室產出是官方點名的強項;內部測試裡它拿一家上市公司的財報與法說會逐字稿加簡報範本,產出十頁經營檢討的初稿,兩位專家判定可直接送出。把這種能力接進內容工作流的具體做法,例如用 Claude 做 SEO 分析與內容產線的八步流程,換到 5.5 後的預期變化是速度與 token 帳單,不是流程重設計。
三種讀者的下一步
API 開發者:先跑遷移清單的前兩條(thinking 與 tool_choice),這是最常見的兩個 400 來源;有資安相關工作負載的,先在測試環境驗證 fallback 行為;遷移完成後重掃一次 effort,舊檔位的成本與品質對應已經失效。Claude Code 使用者:確認版本與模型設定,預設 medium 對多數任務已是好的起點,難任務再往上,順手驗證跨帳號接手工作階段的行為。訂閱使用者:模型選單選 5.5 即可,享受速度與品質,不必處理任何遷移。三種身分共用一個提醒:所有效率數字都來自官方與其合作夥伴,上線後用自己的工作負載量一輪,那才是可信的帳單預測。
常見問題
Claude Sonnet 5.5 什麼時候發布?
Anthropic 在美國時間 2026 年 9 月 28 日發布,官方公告頁的日期就是這一天;對應台灣時間是 9 月 29 日上午,各平台當天起陸續可用。它是 Claude 5.5 家族第二款模型,距離第一款 Opus 5.5(9 月 22 日)相隔六天,Haiku 5.5 官方預告數週內跟上。
Claude Sonnet 5.5 的價格是多少?
API 牌價每百萬輸入 token 2 美元、輸出 10 美元,快取讀取 0.2 美元,5 分鐘與 1 小時快取寫入分別是 2.5 與 4 美元,Batch API 輸入輸出半價。全部欄位與 Sonnet 5 現行牌價相同。實際帳單通常更低,因為官方宣稱同樣任務的 token 消耗下降,每個任務成本最多省 30%。
Sonnet 5 原定 9 月漲到 $3/$15,現在還漲嗎?
不漲了。$2/$10 原本是 Sonnet 5 的推廣價,排定 2026 年 9 月 1 日調回 $3/$15,但官方價目表已註明該調漲取消,$2/$10 改為常規牌價。因此 Sonnet 5.5 的「與前代同價」是對齊常規價,不是延長推廣;先前用 $3/$15 估算的長期成本模型都應該重算,方向是下修。
Sonnet 5.5 會取代 Opus 5.5 嗎?該選哪個?
不會。多個評測上 Sonnet 5.5 貼近或局部超過 Opus 5.5(Terminal-Bench 70.6% 對 66.4%;GDPval-AA 只差 2 分),但官方明言在需要持續判斷的複雜開放性工作上,Opus 5.5 仍明顯更強。實務判準:規格清楚、量大、求快的任務用 Sonnet 5.5,單價只有一半;架構決策與開放性難題留給 Opus 5.5。兩者分工(Opus 定框架、Sonnet 做實作)是 early tester 已驗證過的用法。
我的程式把 thinking 關掉,搬過去會壞嗎?
會,這是五個破壞性變更裡最常見的一個。Sonnet 5 上送 thinking type disabled,在 5.5 會直接收到 400 錯誤,必須先改成 between_tools。新設定只吃 low、medium、high 三個 effort 檔位,不能跟 display、budget_tokens、block_binding 共用,對話中途不能換 effort。只做聊天、不使用工具的整合,回應形狀跟以前一樣只有文字。
什麼情況會被 cyber safeguards 擋下或退回 Sonnet 5?
被分類為高風險的資安任務會「看得到地」fallback 到 Sonnet 5 執行,回應會標記這件事;一般軟體開發裡的找漏洞、修弱點不受影響。API 的拒絕類別有五種:cyber、bio、frontier_llm、reasoning_extraction、general_harms,Claude API 啟用 beta server-side fallback 後,預設路由只會把 cyber 與 frontier_llm 重試到 Sonnet 5;其他平台需設定客戶端處理。做資安工具的團隊要先把 stop_reason 為 refusal 的回應納入錯誤處理;防禦方可申請 Cyber Verification Program 取得分級的進階能力。
在 Claude Code 裡切換帳號會發生什麼事?
Sonnet 5.5 的 thinking block 綁定產生它的帳號,只在原帳號或連結帳號裡有效。中途切換帳號後,API 會靜默丟棄另一個帳號產生的 thinking block,請求照常成功,但模型失去前半段的推理,等於只看得到歷史訊息、看不到思考過程。跨帳號接手工作階段的團隊,遷移後應先測這條路徑,官方在 preserved thinking 文件有完整說明。
effort 要設多少?沿用 Sonnet 5 的設定可以嗎?
不建議沿用,Sonnet 5.5 的 effort 刻度重新校準過,同一檔位的思考量與 Sonnet 5 不同,官方明確建議重掃一輪。起點參考:一般任務從 high 開始;agentic coding 與多步驟工具呼叫,定義清楚的任務用 medium,難的拉到 high;聊天與延遲敏感應用用 medium 或 low。注意預設值不一致:Claude API 與 Platform 預設 high,Claude Code 與官方 app 預設 medium。
Sonnet 5.5 在 GitHub Copilot 上能用嗎?
可以,發布當天就開放。Copilot Pro、Pro+、Max、Business、Enterprise 方案都能在模型選單選到,涵蓋 VS Code、Visual Studio、Copilot CLI、coding agent、JetBrains、Xcode、Eclipse 與行動版 GitHub,採漸進推出。計費走供應商牌價的用量計費,Business 與 Enterprise 管理員可透過 model policy 控制開放範圍,預設政策下新模型自動啟用。
Sonnet 5 會被淘汰嗎?
短期不會。Sonnet 5 的狀態是 Active(legacy),官方退役承諾寫明不早於 2027 年 6 月 30 日,Sonnet 5.5 則承諾至少供應到 2027 年 9 月 28 日。既有 Sonnet 5 整合可以照常運作,官方建議遷移是為了效能與成本,不是因為前代即將下線。
快 30%、省 30% 是官方數字,能信嗎?
訊號偏向正面但要看來源。這些數字出自 Anthropic 自家測試與 early tester(Slack、Zendesk、Balyasny、Box 等具名回報),方向彼此一致,例如 Balyasny 量到每個答案的 token 從 49.7 萬降到 12.1 萬。不過這些案例的任務與設定不同,不能直接外推到自己的工作;評測表也有已知註記(預發布版本的結構化輸出 bug、GPT-6 Sol 影像 bug 修復前的分數)。建議做法:遷移後用自己的工作負載量測,那才是可信的依據。





討論與提問