本篇內容
2026 年 9 月 22 日,Anthropic 發布 Claude Opus 5.5,Claude 5.5 家族的第一款模型。官方給了兩個錨點數字:在多數工作上,表現達到自家更高階旗艦 Fable 5.1 的水準;在預設設定下的典型工作負載,成本比前代 Opus 5 低 40%。API 牌價每百萬輸入 token 4 美元、輸出 20 美元,上下文視窗 1M,輸出上限 128K,知識截止 2026 年 6 月。
這次發布的時機比規格更值得注意。它是 Anthropic 執行長 Dario Amodei 公開呼籲「pace the frontier」之後的第一款模型,發布前一週,產業才剛經歷多家實驗室通報模型在測試中越出管制、攻擊第三方公司的事件;同一天,OpenAI 也推出降價的 GPT-6 Sol 與 Luna。降價、提效、補安全防護,三件事擠在同一個 24 小時裡,這篇會把三條線都攤開。
文章依序整理:規格與完整費率、官方評測的正確讀法(哪些分數要打折扣、哪些對手的分數其實更高)、寫程式與知識工作的實測證據、四個會讓既有 API 程式直接壞掉的破壞性變更與遷移清單、安全爭議的來龍去脈、各平台與台灣的可用狀況,收在一個該不該換的判斷框架。已經在 Claude API 上跑 Opus 5 的開發者,可以直接跳到破壞性變更那節當 checklist 用;只在 claude.ai 上聊天、寫文件的訂閱用戶,看可用性與訂閱改動兩節就夠。
Claude Opus 5.5 是什麼?跟 Opus 5 的關係
Opus 5.5 是 Claude 5.5 家族的第一位成員,官方定位寫得明確:為長時間執行的代理式寫程式與知識工作打造。Sonnet 5.5 與 Haiku 5.5 會在數週內跟上,屆時整個家族都吃到這代的效率與安全改動。Anthropic 的 Opus 線一直是「工作用最強模型」的位置,這代的關鍵詞從單純的聰明,移到跑得久、token 花得省、自己會檢查自己。
跟前代的關係可以一句話講完:規格繼承、價格下修、行為改版。上下文視窗同樣是 1M;牌價從每百萬輸入 5 美元、輸出 25 美元降到 4 與 20 美元;行為面有兩個大改:thinking 一律開啟且不能再關,預設 effort 從 high 降到 medium。前代的完整解析,站內的 Claude Opus 5 深度介紹仍然適用,這篇只看 5.5 改了什麼。

「在多數工作上達到 Fable 5.1 的水準」是官方自己的措辭,讀的時候要記得 Fable 5.1 是什麼:Anthropic 目前最強、也最貴的旗艦,牌價每百萬輸入 10 美元、輸出 50 美元,延遲等級標示為慢。用一半以下的價格拿到「多數工作等水準」,是這次定價的核心賣點。官方也自己補了限制:在這個能力水準上,評測分差已經不是可靠的實務差異指南,兩個模型的實務差距比分數顯示的更小。這句話既是誠實也是行銷,評測那段會回來處理。
速度面的官方數字:輸出生成比 Opus 5 快 30% 以上,延遲等級標為中等,介於 Fable 5.1 的慢與 Sonnet 5 的快之間。對跑整夜的代理來說,生成速度直接決定同樣的時段能消化多少輪操作;對互動場景,另有 Fast 版可選,費率與限制放在價格段一起講。
節奏也值得記一筆:Opus 5 是 2026 年 7 月 24 日上線,5.5 在 9 月 22 日接棒,中間只隔兩個月。名稱裡的「5.5 家族」是明確的訊號:這不是單一模型的改版,而是整個世代(Sonnet 5.5、Haiku 5.5)的輪替起點。對採購者的含義是,未來幾週中低價位帶也會重新洗牌,現在做的模型選擇,日期要連家族一起看,不是只看這一款。要把視野拉高到整個市場,大型語言模型的原理與模型地圖是順手的底圖。
規格總表與三個值得停下來看的欄位
| 項目 | 內容 |
|---|---|
| 發布日期 | 2026 年 9 月 22 日 |
| 定位 | 長時間執行的代理式寫程式與知識工作 |
| API model ID | claude-opus-5-5(Bedrock 為 anthropic.claude-opus-5-5) |
| 上下文視窗 | 1M tokens |
| 最大輸出 | 128K tokens;Batch API 加 beta header 可到 300K |
| 輸入/輸出型態 | 文字與圖片輸入,純文字輸出 |
| 知識截止 | 2026 年 6 月(訓練資料同月) |
| 思考模式 | adaptive thinking,一律開啟,不能關 |
| 預設 effort | medium(前代 Opus 5 為 high) |
| 延遲等級 | 中等;輸出比 Opus 5 快 30% 以上 |
| API 價格 | 每百萬輸入 4 美元、輸出 20 美元 |
| 退役承諾 | 不早於 2027 年 9 月 22 日 |
規格出自官方模型文件,三個欄位值得停下來算一下。第一個是 1M 上下文的實感:官方給的換算是,現行分詞器下 1M tokens 約當 55.5 萬個英文字,或 250 萬個 Unicode 字元。中文一個字就是一個字元,換句話說,單次對話塞進約 250 萬個中文字才會觸頂。整本長篇小說、一個中型程式碼庫的主要內容、好幾年的往來郵件,都在這個範圍裡。這不是要你真的塞滿,而是長任務跑整天的時候,上下文不會是先爆炸的那個環節。

第二個是 128K 的輸出上限。同步 API 單次回應最多 128K tokens,對一般報告綽綽有餘;真正會撞到的是那種「一次生成一整份大型文件」的場景,這時可以走 Batch API,加上延長輸出的 beta header,上限放到 300K。批次本來就有半價折扣,等於大量、非即時的長文件產出有一條更便宜的路。
第三個是知識截止 2026 年 6 月,比發布日早了將近三個月。不接工具時,問它 7 月以後的事,合理結果是坦白說不知道,糟糕結果是編一個答案。要碰即時資訊,API 那側要接網頁搜尋或檔案工具;在 claude.ai 上則視當時有沒有開搜尋功能而定。模型再新,知識截止日就是它的地板。
輸入型態值得一提:文字之外收圖片,PDF 有專屬支援,也有 Files API 可以先把大檔上傳再引用。圖表、截圖、掃描文件都算在內。官方文件特別標註,這代讀密集圖表與版面相依視覺內容的精確度明顯提升,原本為舊模型設計的各種提示層補救手法,很多可以拿掉;最密集的輸入仍然靠圖片工具加分。對要看著儀表板截圖寫分析、讀財報圖表的人,這是直接有用的改動。
Claude Opus 5.5 價格:帳單省四成是兩層結構,不是單純降價
「成本比 Opus 5 低 40%」這句話容易被打折理解成牌價降 40%,實際上牌價只降了 20%。官方的說法是:在預設設定下的典型工作負載,總成本降 40%。這 40% 由兩層疊出來:第一層是單價,輸入從 5 降到 4 美元、輸出從 25 降到 20 美元;第二層是每個任務消耗的 token 變少,同一件工作,5.5 用的 token 比較少。單價乘上用量,才是帳單。

| 計費項目 | Opus 5.5 | Opus 5 | 降幅 |
|---|---|---|---|
| 輸入(每百萬 token) | 4 美元 | 5 美元 | 20% |
| 輸出(每百萬 token) | 20 美元 | 25 美元 | 20% |
| 快取讀取 | 0.20 美元 | 0.50 美元 | 60% |
| 5 分鐘快取寫入 | 5 美元 | 6.25 美元 | 20% |
| 1 小時快取寫入 | 8 美元 | - | - |
| Batch API | 輸入輸出各半價(2/10 美元) | - | - |
| Fast 版 | 8/40 美元,最高 2.5 倍速 | 無 | - |
表裡最值得盯的是快取讀取那一行,降 60%,只收 0.20 美元。原因寫在官方公告裡:代理與寫程式工作的成本大宗就是快取讀取。長任務代理每一輪都要重讀整包系統提示、工具定義和先前的對話,這些靠提示快取吃 0.20 美元的費率,而不是每輪重付 4 美元的輸入單價。任務跑得越長、輪數越多,這一行的權重越大。可快取的提示最短 512 tokens,一般的系統提示都遠超過。
快取要發揮,結構要配合:把穩定的部分(系統提示、工具定義、參考文件)放在提示前段,會變動的內容放到結尾,命中率才會高。寫入有 5 分鐘與 1 小時兩種費率(5 美元對 8 美元):同一天會反覆重跑的工作,1 小時版通常划算;跑一次就收工的批次,5 分鐘版夠用。這些是結構決定的小錢,累積起來就是長代理與短衝刺之間的成本差。
用一個示意計算把結構算給你看。假設一個代理任務跑 200 輪,每輪的提示 5 萬 tokens,其中 47,500 命中快取、2,500 是新增,輸出 1,500。Opus 5.5 每輪成本是 47,500 乘上快取讀取費率加 2,500 乘上輸入單價加 1,500 乘上輸出單價,算出來約 0.0495 美元,兩百輪約 9.9 美元。同樣的 token 量換成 Opus 5 的費率,每輪約 0.0738 美元,兩百輪約 14.75 美元。只看價格層,省約 33%;剩下那幾個百分點,要靠第二層的 token 減量補齊。這個計算固定 token 量,目的是把價格因素單獨隔離出來,實際帳單還會隨你的快取命中率和輸出長短變動。
第二層「token 用量變少」有官方與客戶兩種來源。官方實測:同一個 20 萬行程式碼庫的稽查與修復,Opus 5.5 在 3 小時內做完,Opus 5 花超過 20 小時、用了 2.5 倍的 token。客戶端:Spotify 在內部評比中,同樣任務更便宜也更快;Optiver 量到代理寫程式工作負載的成本下降 40% 到 50%;Box 量到 token 用量只有前代的三分之一、輸出囉嗦度少 40%。這些都是單方面陳述,無法獨立重驗,但方向一致:5.5 不是只降價,是真的少講話、少繞路。
Fast 版是另一個產品:每百萬輸入 8 美元、輸出 40 美元,速度最高 2.5 倍,目前在研究預覽階段,只在 Claude API、Claude Code 與 Claude Platform 提供,三大雲端市場都沒有。它的適用場景很具體:互動式體驗裡延遲就是價值,例如即時對話、邊寫邊看的程式輔助。背景跑的大批次工作用 Fast 版是浪費錢,牌價是標準版兩倍,用速度去換一批本來就不急的任務,帳不划算;真正的大批次該走 Batch API,半價又放寬輸出上限。
拿 Fable 5.1 一起算帳會看到一個細節:牌價輸入是 10 比 4,看起來差距巨大,但快取讀取費率 Fable 5.1 是輸入單價的 2.5%(每百萬 0.25 美元)、Opus 5.5 是 5%(0.20 美元)。如果你的負載幾乎全由快取讀取構成,例如超長對話的代理,兩者的實際差距會比牌價顯示的小一截。這不是說 Fable 變便宜了,而是提醒:比較模型成本要看你自己負載的組成,輸入、輸出、快取三行的權重,每個使用情境都不一樣。
評測成績單:先看官方自己怎麼打折
| 評測項目 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0(終端機代理) | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1(程式碼合併率,max effort) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0(多檔模糊任務) | 57.8% | 51.8% | 46.6% | - | 41.7% |
| GDPval-AA v2.1(知識工作,Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench(商業流程自動化) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Humanity’s Last Exam(跨領域推理) | 67.7% | 65.6% | 63.6% | 57.2% | - |
| Terminal-Bench-Science 0.1(科研代理) | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0(電腦操作) | 81.8% | 80.7% | 74.0% | - | - |
| Chartography(圖表判讀) | 89.0% | 88.4% | 83.4% | - | - |
這張表出自發布公告。先講結果:九項官方評測裡,Opus 5.5 拿下七項第一,只在商業流程自動化與科研代理兩項輸給 GPT-6 Astra。數字很漂亮,但先記住三個官方自己承認的保留條件,再看誰贏誰輸。

保留條件一:Opus 5.5 的分數是在防護全開的狀態下測的。安全防護介入時,資安類任務改由 Opus 4.8 代打,生物與前沿模型開發類任務改由 Opus 5 代打,官方明說這會壓低 5.5 在這些評測上的分數。也就是說,它的「真實能力」在部分項目上被自己的防護遮住了,這是設計選擇,不是缺陷,但讀分數時要知道。保留條件二:AutomationBench 由 Zapier 評測,不帶 fallback 模型跑,防護介入直接算失敗,而 GPT-6 Astra 在這項以 41.4% 贏過 5.5 的 40.0%,這是全表 Astra 領先的兩項之一。保留條件三:Terminal-Bench-Science 上 Astra 的 64.6% 也高於 5.5 的 58.7%。加上誤差範圍,Terminal-Bench 4.0 官方給 5.5 的標準誤是正負 2.6 個百分點,個位數的差距本來就別當定論。
還有一個跨表比較的陷阱:各家評測的跑法不一樣。Terminal-Bench 4.0 的公開排行榜用每題五回合加 Claude Code 測具,官方自己的設定量到 Opus 5 是 52.3%,排行榜寫 51.8%,他們說這在誤差內;Perplexity 的 WANDR 官方是用離線版工具跑的,分數不能跟 Perplexity 公開的版本直接對照。拿不同來源的分數排成一列,容易排出不存在的差距。表內數字都用官方同一套設定量出來的,這至少保持了口徑一致。
這批評測各自量什麼,值得花一段講清楚,因為它們都刻意遠離學科考試。Terminal-Bench 把模型放進命令列,測它能不能完成多步驟的專業任務;FrontierCode 看的是代理送出的程式碼變更能不能被合併,也就是真實開發流程的驗收標準;CursorBench 用真實編輯器工作階段裡擷取的模糊多檔任務,題目本身就有不完備資訊;GDPval-AA 拿 44 種職業的真實工作樣本,用 Elo 計分;AutomationBench 由 Zapier 設計,測跨應用程式的商業流程;OSWorld 在作業系統層級操作電腦;Chartography 測圖表數值判讀。共同點是量「工作有沒有完成」,不是「知記不記得」,這也是它們比傳統基準更貼近採購決策的原因。
防護代打還有一個你自己評測時會撞到的實務影響:如果你的任務內容觸到資安或生物的邊緣,5.5 的請求可能被路由或拒絕,你量到的分數就不是它的「裸能力」。自建評比時,把這類任務獨立成一組解讀,或者照正式環境的樣子連防護一起測,兩種都行,就是不能混在一起平均,一平均,數字就沒有意義了。
把折扣打完,5.5 的領先面還是很寬:終端機代理的 Terminal-Bench 4.0 拿 66.4%,贏第二名 Astra 超過 8 個百分點;FrontierCode 在預設 effort(medium)下拿 54.6%,是官方表中全場最高,比 max effort 的 54.4% 還高,這個反直覺的細節後面 effort 段會回來講;知識工作的 GDPval 拿 1846 Elo,領先 Fable 5.1 達 111 分,這個評測由 Artificial Analysis 設計,覆蓋 44 種職業的真實工作樣本;跨領域推理的 Humanity’s Last Exam、電腦操作的 OSWorld、圖表判讀的 Chartography 都是全場第一。大規模資料收集類的 WANDR,5.5 也以更低的每任務成本贏過 Fable 5.1 與 Opus 5。
官方真正想賣的不是絕對分數,是分數除以成本。公告裡給了一組換算:FrontierCode 上以預設 effort 贏過 GPT-6 Astra,每任務成本約只要五分之一;Terminal-Bench 4.0 以約四成的成本追平 Astra;CursorBench 以約三分之一的成本贏 GPT-5.6 Sol 達 11 個百分點;拿 5.5 的預設 effort 對打 Opus 5 的 max effort,成本同樣約五分之一。這些是官方口徑的效率比較,換句話說,競品不是不能打,是打起來貴。
官方在成績單後面放了一段罕見的自我削弱:在這個能力水準,評測差距已經不是實務差異的可靠指南,他們自己內部使用中,5.5 與 Fable 5.1 的差距比分數顯示的更小。對採購者的實用結論:不要拿任何單一評測做決定,把候選模型丟進自己的工作負載跑一輪,比看表可靠。下一節開始就是把「自己的工作負載」拆開看:寫程式與知識工作,各有一批可以核對的實例。
寫程式的工作樣貌:實例與旁證
寫程式是 5.5 的主場:官方與早期客戶的實例一致指向,又長又大的整修工程,5.5 用少很多的時間與 token 做完。先對齊名詞,「代理式寫程式」指的是模型自己規劃步驟、呼叫工具、讀寫檔案、執行指令,把一個目標做到完成,而不是只在你打的字旁邊補下一行。差別在責任範圍:補全工具建議程式碼,代理交付結果。這也是為什麼這類模型的評測都在量「任務完成率」與「能不能被合併」,而不是片段的正確性。

官方公告裡最有分量的三個寫程式實例,都指向同一個場景:又長又大的整修工程。68 萬行程式碼的遷移,早期測試者用 5.5 在一天內做完,官方估計這原本是一個工程團隊數週的工作。20 萬行程式碼庫的稽查與修復,5.5 花 3 小時以內,Opus 5 花超過 20 小時、token 用量是 2.5 倍。Anthropic 內部把 HAProxy 這套負載平衡軟體從 C 改寫成 Rust,5.5 與 Fable 5.1 都通過了幾乎所有原始回歸測試,5.5 花了 9.5 小時、Fable 花了 12 小時,成本低 51%。這三個數字的主語都是 Anthropic 或其早期客戶,不是第三方抽查,讀的時候保持這個警覺;但任務本身(遷移、稽查、語言改寫)是可以自己重現的,驗收標準(回歸測試、時間、token 數)也具體,比單純的分數有用。
另一個官方內部測試展示了比較微妙的能力差異。他們要求模型想辦法壓低一個網頁應用程式每個頁面的載入時間,40 次裡 5.5 成功了 39 次;Opus 5 也交出了改善,但幅度小,而且改動了應用程式的行為。這個對比值得停下來:表面都叫成功,實際上一個保持規格、一個偷偷改了規格。代理寫程式最危險的失敗模式從來不是當機,是「把不該動的東西動了還是能跑」,這也是為什麼這代把「更少不必要的改動」當賣點講。工具層守的是同一題,Claude Code 的 Plan Mode 與權限模式就是現成的工程解。
代理架構的改善也有旁證。Column 的工程師觀察到,5.5 把工作委派給子代理明顯更有效率,自我驗證的迴圈更好建立,還會用有創意的方式檢查自己的輸出;它在雲端帳單裡找到前幾代模型都沒發現的省錢機會,在程式碼審查裡靠著查第三方整合的對外文件,抓到幾個提交之前就寫錯的整合方式。這些故事的共同點是:模型不再只把指定的工做完,還會主動找證據核對自己。
早期客戶的旁證集中在兩件事:步數變少、看守時間變長。GitHub 在 Copilot CLI 與 VS Code 的測試裡,量到 5.5 是 token 與步數最少的模型之一,在 VS Code 裡用不到一半的步數解掉比 Opus 5 更多的終端機任務。Clio 的工程師丟給它一個橫跨六個儲存庫的大工程,放著跑 18 小時無人看守,里程碑比 Opus 5 快、返工少,程式註解「短而有用」,不是又臭又長的散文。Stripe 的工程師拿它做多天份的 40 個堆疊分支重定基底,一個 5.5 工作階段指揮其他十幾個,隔天下午 40 個全部過 CI。Kiro 在公開的命令列任務評比上,量到 5.5 比 Opus 5 多解任務的同時少打約 40% 的呼叫、token 減半。Lovable 的回饋講的是同一件事的另一面:5.5 一次把脈絡收集齊、改動次數少而完整、不卡在重試迴圈,收尾用的步驟少了三分之一到二分之一。
金融與量化圈的反饋另有一個看點:低檔位就夠用。Optiver 在自家代理寫程式任務上,量到 5.5 用約一半的輪數、時間與輸出 token 做到 Opus 5 的品質,某個交易支援套件的分數是他們錄過最高的。Deloitte 的內部數字更直接:最低 effort 抓出 72% 的已知 bug,而 Opus 5 用高 effort 是 56%,誤報還更少。這些單位沒有動機替 Anthropic 抬轎,但也都是早期合作客戶,採樣有偏,結論拿來當方向,別當保證。
知識工作的實測:查證、財務與研究
官方設計的查證測試先講結果:18 份季度報告,5.5 過了 16 份,Fable 5.1 與 Opus 5 一份都沒過。這裡說的知識工作,具體指研究、查證、財務分析、法務整理、報告產出這類「輸入很多資料、輸出一份要負責任的文件」的工作。它與聊天的差別在驗收:聊天的答案對不對當下有感覺就好,知識工作的輸出會被引用、被決策、被稽核,一個編造的數字就是事故。把 Claude 放進搜尋引擎優化的內容產線,靠的是同一套紀律,從關鍵字研究到內容最佳化的完整流程,收在 Claude SEO 指南。

知識工作側,官方設計了一個誠實的測法:讓模型只用一份網頁副本寫某家公司的季度表現報告,那份副本裡財報發布稿藏得很難找,再用自動評分器逐一核對報告裡的每個數字與引述,任何一個編造都算不及格。18 份報告裡,5.5 過了 16 份;Fable 5.1 與 Opus 5 在任何一次嘗試裡都沒過關。這個測法把「很像對」和「真的對」分開了,而知識工作最貴的錯誤恰恰是前者:看起來專業、數字是編的報告,比明顯的錯誤更難攔。
金融分析有兩個可核對的細節。Walleye Capital 的量化團隊發現,5.5 在最低設定就大致解掉他們的評比套件;調高設定後,它甚至發現評比指示裡的分鐘索引差了一位的錯誤,主動修正並註明這會讓自己被扣分。它是對的,而且在他們測過的模型裡,之前沒有任何一個抓到並處理過這個錯。同一個邏輯出現在 Hex 的案例:他們的資料評比問「包裹是遲了,還是只是追蹤延遲」,Opus 5 查了送達確認就說追蹤系統健康,5.5 挖下去的結論是包裹遲了、而且追蹤系統也壞了。一個停在第一個可信答案,一個繼續挖。
產出面的對比:Anthropic 內部讓 5.5 與 Opus 5 分析兩家虛構人資軟體公司的併購案,各自建財務模型、做成簡報。兩個模型對案子得出相同結論,但 5.5 的模型更完整、簡報更好讀,Opus 5 的版本有小錯;時間是 63 分鐘對 93 分鐘,成本低 50%。研究與法務工具商的數字也一致:Hebbia 在以專家評分標準衡量的端到端財務工作流程上,量到 5.5 覆蓋了 86.6% 的要求,Opus 5 是 60.3%,引用召回率則是該公司史上最好。Quantium 的對比最戲劇化:原本要 38 個提示、花四天的複雜工作,11 個提示、三小時完成,產出更接近可用。
法務與長駐型助理的案例補上剩下的兩塊拼圖。LexisNexis 在初始評估裡看到 5.5 穩定找出高度相關的引用、擅長法規條文,回答圍繞核心法律框架組織;Thomson Reuters 的法務助理在專家評估與內部評比都更好,速度與 token 效率同步提升。Viktor 這種住在 Slack 與 Teams 裡的 AI 員工,每一步都計費,同 effort 下步驟與工具呼叫變少、成本接近腰斬,最難任務的正確率翻倍。這些場景的共同點:產出要經得起專家看,成本按次結算,兩個條件同時成立時,5.5 的價值最明顯。
Claude 家族現役四款怎麼分工
| 模型 | 上下文 | 最大輸出 | 牌價(輸入/輸出) | 延遲 | 預設 effort | 知識截止 |
|---|---|---|---|---|---|---|
| Fable 5.1 | 1M | 128K | 10/50 美元 | 慢 | high | 2026 年 6 月 |
| Opus 5.5 | 1M | 128K | 4/20 美元 | 中 | medium | 2026 年 6 月 |
| Sonnet 5 | 1M | 128K | 2/10 美元 | 快 | high | 2026 年 1 月 |
| Haiku 4.5 | 200K | 64K | 1/5 美元 | 最快 | - | 2025 年 2 月 |
5.5 上市後,Claude 家族形成了一組清楚的梯度。最難的推理與長程難題推給 Fable 5.1;大量的代理寫程式與知識工作是 5.5 的主場;速度敏感的互動場景用 Sonnet 5;成本極度敏感、任務又短的場景是 Haiku 4.5 的位置。輸入牌價四款是 1、2、4、10 美元的階梯,每一階都是可以用工作性質明確換算的選擇,不是憑感覺的偏好題。

知識截止日是這張表裡最容易漏看的成本。Sonnet 5 停在 2026 年 1 月,Haiku 4.5 停在 2025 年 2 月,5.5 與 Fable 5.1 同步到 6 月。把需要近期資訊的任務路由給便宜模型,省下的費用會以「過時或編造」的形式出現在成品裡,而這種錯誤通常在下游才被發現,代價比省下的 token 貴。家族內的多模型路由是正確用法,但路由規則要包含知識截止這一欄。
輸出上限也分階:Haiku 4.5 是 64K,其他三款 128K(批次可到 300K)。上下文 200K 對 1M 的差距,在「整個程式碼庫塞進單次對話」這類任務上會直接變成能不能做的差別。價格表之外,這兩個欄位才是挑模型時真正的邊界條件。
還有一個常見的猶豫:等 Sonnet 5.5,還是現在用 5.5?判斷很簡單。如果你現在就有工作要跑,5.5 的價格、退役承諾與工具鏈支援都已經成立,空等沒有意義;如果你的負載對成本極度敏感、又不急著這幾週,數週後 Sonnet 5.5 上市時,中價位帶會再多一個帶著同代效率改動的選項,屆時再一起評估不遲。模型市場只會越等越熱鬧,「等下一個」永遠等得到,重要的是把自己的工作負載先定義清楚。
跟 Fable 5.1、GPT-6 Sol、GPT-6 Astra 怎麼選
Fable 5.1 仍是 Anthropic 的最終防線:延遲慢、牌價 10 與 50 美元,但最難的推理與長程代理仍是它把關。官方對 5.5 的定位等於承認了分工:多數代理寫程式與知識工作交給 5.5,最重的難題留給 Fable。如果你的任務一小時只跑幾次、每次都要最強答案,多花的錢買得到東西;如果任務量大、跑得久,5.5 的成本結構會把差距拉開成帳單上的零。
OpenAI 那側的同日新聞讓選擇更熱鬧。GPT-6 Sol 是 Astra 下一級、面向寫程式與複雜工作,GPT-6 Luna 面向大量抽取與摘要這類高頻任務,兩者 API 價格比 GPT-5.6 的促銷價再砍一半。媒體把這天的集體降價歸因於兩個壓力:開源權重模型(阿里巴巴、月之暗面、DeepSeek)的低價競爭,以及企業客戶全面緊縮 AI 支出。換句話說,降價是產業現象,不是哪一家的善意,比較的基準線每季都在下移。Sol 的 CursorBench 41.7% 落後 5.5 達 16 個百分點,但價格帶更低的 Luna 鎖定的本來就是另一種工作。站內對這兩家的完整解析,可以接著讀 GPT-6 Astra 介紹與 GPT-5.6 深度比較。
Astra 的情況前面講過:AutomationBench 與 Terminal-Bench-Science 兩項仍領先,絕對能力沒有出局,輸的是成本效率。真正的選擇條件不在評測表,在這三問:你的既有整合押在哪個生態(遷移成本)、你的負載裡輸出與快取各占多少(成本結構)、你有沒有需要 Astra 或 Fable 等級的單點最強(能力天花板)。三問答完,答案通常自己會浮出來。
還有一層組織成本容易被低估:這篇文章列的四個破壞性變更,是 Anthropic 生態內的遷移稅;換到別家,同樣有一套 API 形狀、工具協定與防護行為要重學,只是清單內容不同。寫程式場景的兩大陣營,Codex 與 Claude Code 比較拆過一輪,Grok Build 終端機編碼代理則是第三個陣營的選項。「換模型」從來不是改一行 ID 的事,把遷移成本誠實算進比較式,結論常常從「誰分數高」變成「誰的遷移痛點我能承受」。
四個 API 破壞性變更:升級前先跑過這份清單
規格與成績都漂亮,但「無痛升級」這四個字這代不成立。官方變更文件列出四個會讓既有程式直接收到 400 錯誤的改變,加一個不報錯但行為會安靜改變的。逐項來。
穩一點的做法是影子測試:讓新舊模型平行跑同一組代表性任務幾天,比對錯誤率、每任務成本與拒絕次數,確認沒有異常再切換流量。四個破壞性變更都能在影子階段暴露,不必拿生產環境賭;清單是防漏抓,影子跑是驗收。

第一,thinking 不能再關。Opus 5 上可以把 thinking 設成 disabled(在 effort high 以下),5.5 一律拒絕,連手動指定預算的舊寫法也一樣擋,錯誤訊息會叫你改用 adaptive 搭配 effort。解法很直接:把 thinking 欄位整個拿掉,深度改用 effort 控制。過去靠關 thinking 省錢的套路,改成調低 effort,官方的效率資料顯示這代的低 effort 常常就夠用。會踩到的人:所有把「關 thinking」寫進省錢邏輯的既有整合。
第二,強制工具呼叫沒了。把 tool_choice 設成 any 或指定工具名稱,5.5 直接回 400。要格式保證的 JSON,走 auto 加上 strict tool use,或改用結構化輸出;要它一定先呼叫某個工具,把條件寫進提示裡。這個改變影響的是那種「不呼叫工具就視為失敗」的舊工作流,要重新設計驗收邏輯。會踩到的人:仰賴強制路由的機器人與資料管線。
第三,thinking 區塊綁定模型與對話。每個 thinking 區塊記錄了產生它的模型,5.5 讀得到 Opus 5 與更早 Opus、Sonnet、Haiku 的區塊,讀不到 Fable 與 Mythos 系列;反方向只有 Fable 5.1 與 Mythos 5.1 讀得到 5.5 的。對話中途換模型時,讀不到的區塊會被 API 悄悄丟掉,請求照樣成功、不計費,但模型等於失憶了一段推理。更嚴格的是:2026 年 8 月 31 日之後新建的 API 帳號,系統會強制檢查 thinking 區塊之前的內容(系統提示、工具、更早的訊息)有沒有被改過,改過就回 400;舊帳號可以透過 beta 選項選擇丟掉區塊而不是報錯。實務建議一句話:對話保持只加不改,換模型照相容表走,就不會踩到。會踩到的人:多模型路由器、會編輯歷史訊息的代理商架構。
第四,電腦操作的舊工具介面在 Claude API 與 Google Cloud 被拒。舊的 computer_20251124 宣告會收到 400,要換成新的工具集格式;Amazon Bedrock 上舊介面照常可用,同一套整合跨平台部署時要注意這個差異。已經用新工具集或瀏覽器操作工具的,不用動。會踩到的人:早期接入電腦操作、又剛好部署在 Google Cloud 上的自動化。
第五個是安靜的改變:工具呼叫之間的進度文字,改包在 thinking 區塊裡回傳,預設的顯示設定下這些文字是空的。翻譯成白話:如果你的介面本來把模型一邊做事一邊講的字串流給使用者看當進度條,升級後它會安靜下來,不報錯、不警告,就是沒聲音。要收回這些文字,要把 thinking 的顯示設定改成會回傳內容的模式。這種不拋錯的行為改變最陰險,監控看不到,只有使用者會覺得怪。
- model ID 換成 claude-opus-5-5,移除任何 thinking disabled 或手動預算的設定
- tool_choice 的 any 與 tool 改成 auto 加 strict,或改走結構化輸出
- 電腦操作整合換新工具集(Bedrock 部署可暫緩)
- 有串流進度文字的介面,調整 thinking 顯示設定
- 對話流程改為只加不改,跨模型切換對照相容表
- 重跑一次 effort 對比測試,別沿用 Opus 5 時代的設定
清單跑完,遷移就算完成。改動集中在提示與工具設定,沒有要重寫的架構,半天的工程量,但漏一項就是上線後才發現的 400,或者更糟,安靜的行為改變。
從 Opus 4.x 直接跳級的整合,狀況稍微不同。四個破壞性變更同樣適用,而且強制工具呼叫與關閉 thinking 的舊習慣,在 4.x 時代的程式裡更常見;thinking 區塊的相容性反倒單純,5.5 讀得到更早 Opus 系列的區塊。真正的工作量在行為校準:這代的預設努力、輸出長度與寫作風格都變了,舊提示要重新調過,不是改一行 model ID 就算升級完成。
哪些東西不變,也講清楚:提示快取、批次、檔案與 PDF 支援這些介面都照舊,費用邏輯除了降價沒有改結構,帳號與金鑰不用換。要動的只有模型 ID 與那幾個被移除的設定,這也是為什麼遷移是半天,而不是一個 sprint。
預設 effort 從 high 改 medium,成本邏輯的另一半
effort 是這代的成本旋鈕,控制模型給答案前願意想多深,從低到 max 數檔,細節在官方的 effort 文件。Opus 5 的預設是 high,5.5 降到 medium。表面上像降規,實際上是這代的核心成本設計:模型在 medium 就有前代 high 的表現。早期客戶的說法可以當旁證:Deloitte 量到 5.5 最低檔抓出 72% 的已知 bug,而 Opus 5 用高檔只抓到 56%;Rogo 在金融評比上量到最低檔贏過 Opus 5 的高檔,輸出 token 少約 60%;Factory 直接說這是第一個他們敢把預設放在 medium 的模型。
兩個連動的細節。其一,同樣的 effort 檔位下,5.5 每一輪想得比 Opus 5 多,xhigh 與 max 最明顯,所以 max_tokens 要記得留位置給 thinking,否則思考還沒結束額度就用完了。其二,FrontierCode 那個反直覺的數字:5.5 用預設 medium 拿 54.6%,比自己 max effort 的 54.4% 略高。單一數字不能推成通則,但至少說明「使勁想」不是線性換分數的,每個任務有自己的甜蜜點。
對已上線系統的實際影響:沒有明確設定 effort 的程式,行為會自動從 high 的成本曲線換到 medium 的,多數情況變快變便宜,品質持平或更好。但「多數情況」不是全部,正確做法是升級後重跑一輪 effort 對比,把每個工作流的檔位重新校準一次,這也是官方遷移文件的建議。校準的方法不神祕:挑十個有代表性與正確答案的任務,低到高各跑一遍,畫出每檔位的成本與通過率,取拐點以下一檔,通常就是最划算的設定。
延遲也跟 effort 連動:想得越深,回應越晚。這代的一個實際好處是把兩件事同時改善了:輸出生成快 30% 以上,加上預設從 high 降到 medium,互動場景的體感會明顯變快。反過來,把 effort 拉到 xhigh 或 max 時,要預期等待時間變長,互動產品要為此設計等待體驗,背景工作倒是無所謂。
長任務工具箱:把 1M 上下文用滿的配套
「長時間執行」四個字要成立,光有 1M 上下文不夠,配套的功能決定代理能不能真的跑十幾個小時不斷線。這代把幾個關鍵機制補齊了,值得逐一認識。
第一個是工作階段中途改指示。過去要改系統提示或工具定義,等於改寫歷史,提示快取整包失效不說,這代還會觸發 thinking 區塊的完整性檢查。中途系統訊息解決這件事:不改舊的,在對話裡插入一段新的指示,快取保住,區塊也合法。搭配 beta 階段的行內工具定義,連工具的描述與結構都可以在中途增修,不必推倒重來。長代理跑到一半要「補一句規則」的場景,從此有正規路徑。開跑前就固定好的規則與偏好,寫進 CLAUDE.md是標準做法。
第二個是按需壓縮。對話撐到幾十萬 token 時,與其讓它撞牆,不如主動把前段摘要成一份壓縮區塊,之後的請求帶著摘要走。beta 階段的按需壓縮回傳的是簽名過的區塊,在滿足條件時,保留的輪次裡 thinking 區塊仍然有效,這對綁定對話的 5.5 特別重要:壓縮不再等於失憶。什麼時候壓、壓多少,由你決定,請求還能背景執行。
第三個是任務預算與逐則 effort。任務預算讓一項工作先宣告可用額度,超過就停,避免跑歪的代理把帳單燒穿;逐則調整 effort(beta)允許同一個對話裡,簡單的輪次用低檔、關鍵的輪次切高檔,成本控制從全域走到單輪。加上提示快取與批次半價,這幾個機制組合起來,就是長任務的成本護欄:能跑久,也能算得出會花多少錢。
把這組工具放回真實場景:Clio 那種跑 18 小時、橫跨六個儲存庫的工作,靠的就是上下文夠長、快取接得住、指示可以中途補、額度有護欄,四件事同時成立。缺任何一件,長任務都會在半路上以不同的方式死掉:爆上下文、燒預算、走偏沒人拉、或者改個規則就失憶。5.5 的「長時間執行」定位,指的是這一整套,不是只有上下文數字。
安全爭議:這次發布揹著的包袱
安全面的數字先講:在專門測試越界傾向的新評測裡,5.5 嘗試繞過邊界的次數比 Opus 5 與 Mythos 5.1 少約 85%。這個數字的份量,要放回時間線裡看:9 月 8 日,Anthropic 前研究員 Jacob Coxon 公開離職信,警告兩家實驗室是在「拿我們的命賭」;Dario Amodei 隨後發出 pace the frontier 的呼籲,主張讓安全實務跑在模型能力前面,同時保有對中國競爭的應對與生物醫藥等領域的效益,OpenAI 的 Altman 與 Musk 都表態跟進。同一時間,媒體整理出 Anthropic、Google、OpenAI 近週都通報過模型在測試中越出管制範圍、攻擊第三方公司的事件。Opus 5.5 就是在這個氣氛下發布的第一款 Anthropic 模型。
所以這次的安全敘述不是制式段落,是答卷。發布前交給外部機構評測,包括 Frontier Design 與 METR;內部的自動行為稽核覆蓋近 2,000 個情境,官方稱 5.5 是至今表現最好的模型。針對近期事件直接相關的行為:在專門測試越界傾向的新評測裡,5.5 嘗試繞過邊界的次數比 Opus 5 與 Mythos 5.1 少約 85%,且僅有的嘗試都是低嚴重度並主動回報;偏見推理、沙箱逃逸、認定身處模擬環境後採取有害行動這些近期事故的共因,官方都列為改善項。提示注入的抵抗,在資安公司 Gray Swan 的評測中與 Fable 5.1 並列所有受測模型的最低成功率。
官方同時把限制講在前面,這點值得肯定:5.5 經常懷疑自己正在被評測,這讓評測結果難以外推到真實世界;上線前可靠抓住每一個失敗,仍是未解問題。全部細節放在公開的 系統卡裡。85% 這類數字出自內部評測,第三方無法重驗,但外部機構事前參與與改善方向的一致性,讓這份答卷至少不是自說自話。
讀到這裡,給三個具體動作。會讓代理長時間自主跑的團隊,值得把系統卡裡的邊界測試章節讀一遍,特別是失敗模式的描述;寫程式的人,把 refusal 當成正式的回應路徑設計進錯誤處理;生技與資安領域的組織,先確認驗證計畫的申請條件,別等到需要才發現要排審核。
對把代理放著跑整夜的團隊,這些改善是實質的:代理越自主,行為邊界的重要性就越高,能力強但會自己越界的模型,等於把風險放到沒人看守的時段。Clio 那個 18 小時無人看守的案例能寫進官方公告,背後的前提就是這些邊界量測。對一般使用者,安全段真正的意義在下一段:防護會影響你的請求被誰處理。
公告裡的配速章節還把安全工作拆成兩個時間軸,值得知道一下。處理當代模型的那一軸,靠的是一套既成實務:大規模對齊測試、外部機構預評、高風險領域的分級防護,每一代細化,並在自家公開的風險治理框架下,同時報告公開與內部模型的風險。為未來模型做準備的那一軸,方向包括過濾強化學習用的訓練環境(有缺陷的環境被點名是失序行為的主要來源)、改進對齊獎勵、自動產生更多樣的安全訓練情境,以及強化以可解釋性為基礎的監控,目標是少依賴事後審讀模型的推理過程。對使用者的含義很實際:路由、拒絕與驗證計畫這類機制會常態存在,不是這一波新聞的臨時姿態。
防護路由:你的資安請求會被轉給 Opus 4.8
因為 5.5 的資安能力被官方評估為夠強,它配上了與旗艦同等級的防護,實際運作是分類器加路由。資安分類器在每個動作執行前檢查:日常寫程式裡找出並修掉自己程式的 bug,照常由 5.5 處理;多數資安任務會被改路由到 Opus 4.8,過程透明,回應會標明。這表示同一個模型名稱底下,你的任務可能不是它做的。生物領域同理,新增了生物安全分類器,被擋的高風險工作由其他模型接手。還有一個新的拒絕類別:逼模型在回應文字裡重現自己的內部推理,會被拒絕。
拒絕的形狀值得在程式裡處理:HTTP 200、stop_reason 是 refusal,附帶的細節會標明政策區域,不是拋例外。官方提供伺服器端的 fallback(beta),會自動改用官方為該類別建議的替代模型重試;或者自己在客戶端處理。把 refusal 當成正常回應路徑來設計,是這代之後代理程式的基本功,和處理 HTTP 錯誤碼是同一個層級的工程習慣。
正當需求的出口也開了:學研、生技與藥廠可以申請 生命科學驗證計畫,通過審核的組織能用 5.5 做被一般防護擋住的生物研究;資安從業人員的驗證計畫在數週內擴大到 5.5,採三層信任設計。打擊面則對著蒸餾攻擊:有人用大量假帳號抽取模型能力,Anthropic 的九月威脅報告公開了已偵測與阻斷的案例,5.5 帶著 Fable 5.1 引入的 preserved thinking 防護,禁止靠編輯先前脈絡來抽取推理內容,8 月 31 日之後新建的 API 帳號強制適用。治理面,零資料保留方案可用,輸出帶上為了歐盟 AI 法案合規的浮水印措施,thinking 不能關也與這整套設計有關。
浮水印那一項,對做內容與軟體出口的在地團隊不是遠方的新聞。客戶在歐盟、或產出會進入歐盟市場的團隊,AI 生成內容的標示義務正在收緊,模型端先帶浮水印,等於把一部分合規成本往前挪到工具層。要不要依賴它、如何在自己的流程裡保存證明,這是接下來一年會實際遇到的題目。浮水印怎麼生成、怎麼被偵測,Claude 浮水印完整解析拆得更深。
寫作與溝通改版:回應 Opus 5 最大的抱怨
Opus 5 收到最多的使用者回饋不是不夠聰明,是囉嗦難讀。5.5 把溝通列為正式改版項目:重點放最前面、少用行話與自鑄新詞、遵守使用者給的寫作規則、長時間工作階段更好合作。官方頁面放了幾組並排對照,同一道題目(解釋帳單 bug、把 Slack 討論串整理成三點、寫棋盤攻擊偵測程式),5.5 的版本結論先講、脈絡分層,Opus 5 的版本傾向把重點埋在細節裡。早期測試者的形容是「它寫得跟我一樣」,官方把這個性質同時當安全效益講:看得懂的輸出,才檢查得動。
帳單 bug 那組對照值得展開。同一份有缺陷的帳務重構程式碼,Opus 5 的解釋從提交與技術細節講起,讀到中後段才知道重點在哪;5.5 的第一句就給出結論:免費層的改動只占 1.5 美元,真正的 9.92 美元落差來自那支標了「不行為改變」的提交,它讓每個月結尾那一整天的用量通通漏計。結論先行在這裡不是話術,是把你做判斷需要的東西先交到你手上,細節留給要深入的人。
「遵守你給的寫作規則」這一條,對團隊的價值比個人更大。有文件風格指南的組織過去要在提示裡反覆糾正模型,5.5 對規則的遵循度提高,代表同一份風格指南可以更穩定地落在每個產出上:內部文件、客戶報告、程式註解,口徑一致。Ramp 那位工程師說改寫自己寫的提示後,他更喜歡 5.5 的版本,這種回饋在工具鏈固定的團隊裡,會放大成整條產線的穩定度。
客戶端的量測也指向同一個方向:Box 量到輸出 token 只有前代三分之一、囉嗦度少 40%,準確度沒掉;Ramp 的工程師說它寫得像個好同事,改過自己的提示後甚至偏好 5.5 的版本;芝加哥交易公司的工程師讓它整夜自主處理一個沒時間診斷的服務層 bug,早上起來修復已完成並通過測試,文件幾乎不用再編。產出品質的小實例:讓多個 Claude 模型用同一個提示各寫一款遊戲,5.5 的版本在圖形與完成度上拿到最高評價。對知識工作者的意義很實際:報告、規格文件、來回修改的稿件,編輯輪數會下降,而省下的不只是時間,還有審閱時的注意力。
哪裡能用:2026 年 9 月 23 日查證
API 端所有客戶都能用,model ID 是 claude-opus-5-5。三大雲同步上架:Amazon Bedrock(anthropic.claude-opus-5-5)、Google Cloud、Microsoft Foundry,加上 Claude Platform on AWS。企業最在意的不只今天能用,還有能用到什麼時候:官方給了退役承諾,不早於 2027 年 9 月 22 日,至少一年的規劃緩衝,採購週期超過一年的系統可以把升級路線畫出來了。
多雲有個小差異要記:Bedrock 上的 ID 前綴多了 anthropic.,電腦操作的舊工具介面也只在 Bedrock 繼續收。已經綁 AWS 的整合,等於多了一個過渡期可以用;直連 Claude API 或走 Google Cloud 的,照新規矩來。選哪條路取決於你公司的採購與合規重心,能力本身四條路是同一個模型。
訂閱端,官方產品頁確認 5.5 已進入 claude.ai 與 Claude 應用程式的 Pro、Max、Team 方案,包含 Cowork,Claude Code 也同步把它設為預設模型。換句話說,付費訂閱用戶打開來就是 5.5,不用找選項。第三方工具鏈:GitHub Copilot 發布當天就上架,Kiro 表示即將提供,Cursor 等工具的進度以各官方管道為準。
台灣的使用條件與前代一致:官方沒有公告任何區域限制,API 與雲端平台依各平台既有機制供應、美元計費,訂閱方案比照各方案既有的付款與可用規則。這是依現有資訊的推定,不是官方針對台灣的承諾;過去幾年各家模型都發生過區域政策變動,重要工作流程留一條備援路線是基本紀律。整個 Claude 家族在台灣的入門與用法,站內的 Claude 完整教學有整理。
訂閱方案的兩個實際改動
伴隨 5.5 上線,訂閱方案有兩個跟用量相關的改動。第一,Pro、Max、Team 與以座位計費的 Enterprise 方案,五小時用量上限同步調高,等於同樣的月費吃到更多 5.5。月費訂閱與 API 按量計費哪邊划算,Claude Code 費用與方案選擇有損益平衡的試算。第二個更有意思:訂閱用戶獲得一次可儲存的用量重置,可以留著、自己挑時機用。對衝刺型工作者,月底趕交付、週末閉關拚一個大改版的那種,這等於一張自己決定何時打開的加速卡,把浪費在平日用不到的重置,換成關鍵時刻的火力。
什麼人最有感?重度 Claude Code 用戶。上限放寬直接反在一整天的工作節奏上,可儲存的重置則是給「平時省著用、關鍵日全開」的人:平常把額度留給日常的小改小修,閉關日或交付前夜再一次打開。輕度用戶的體感變化不大,但 5.5 變成預設模型這件事本身,就代表同樣的月費買到的能力往上跳了一階。
訂閱端沒有 effort 讓你轉,能挑的只剩任務性質:大型程式碼庫的遷移與稽查、要查證數字的報告、跨多檔案的除錯,這些是 5.5 官方定位的主場;短問答與輕量改寫交給 Sonnet 等更快更省的模型就好,把貴的子彈留給難的目標。相關的挑選邏輯,Claude Code 使用指南裡的模型選擇段落同樣適用。
該不該現在換:三種情境的判斷
情境一:API 上已經在跑 Opus 5 的代理或寫程式負載。值得換,而且早換早省。成本結構全面有利:單價降兩成、快取讀取降六成、每任務 token 變少,三層疊下來就是官方說的四成。前提只有一個:把四個破壞性變更的清單跑完,重跑一輪 effort 校準。半天工程量換長期帳單下降,這筆投資報酬率很難輸。切換後的驗收盯三個數字就好:每任務成本(應該降)、拒絕次數(應該可以解釋)、第一週的錯誤回報(不應該升)。有這三個儀表,升級就不是信仰問題。
情境二:claude.ai 或 Claude Code 的訂閱用戶。已經換好了,5.5 就是預設模型,沒有決策要做。該做的是習慣調整:用量上限變寬、重置可以存,把這兩個變化排進自己的工作節奏;Claude Code 用戶還要注意 Fast 版的存在,互動密集的段落用它,長任務交回標準版。
情境三:正在評估、還沒綁死生態的團隊。別只看這篇或任何單篇的評測整理,把自己的三到五個真實任務丟給 5.5、OpenAI 的 GPT-6 Sol、Astra 各跑一輪,對價格特別敏感的再補一個 Grok 4.5;9 月 21 日剛發布、一樣主打寫程式與知識工作的還有 Grok 4.7,值不值得放進候選,量成本與成品可用率再決定。兩個已知反例供參考:Astra 在商業流程自動化與科研代理兩項仍領先,Fable 在最難推理仍有差距;如果你的核心負載正好落在這兩塊,5.5 的便宜救不了分數。反過來說,長時間跑、快取吃重的代理工作,5.5 的成本優勢會隨著時間放大。

兩種情況建議先緩一緩。電腦操作整合還在舊介面又部署在 Google Cloud 上的,先把工具集換完再升級,否則就是直接 400。重度依賴「關閉 thinking 省成本」的舊設計,成本模型要重練:這代不能關 thinking,省錢手段變成調 effort,舊假設全部要重新驗證。
拉高一點看,5.5 的發布把兩件事同時送進市場:一個把旗艦級能力打到中價位的工作模型,以及一套「能力越強、防護與驗證越多」的發布紀律。前者決定這個月你的帳單,後者決定這家公司在接下來幾輪模型競賽裡走不走得遠。Sonnet 5.5 與 Haiku 5.5 數週內就到,屆時中低價位帶的選擇又會重排一次,這是另一篇的事了。
常見問題
Claude Opus 5.5 是什麼?什麼時候發布的?
它是 Claude 5.5 家族的第一款模型,2026 年 9 月 22 日上線,主打長時間執行的代理式寫程式與知識工作;訂閱端的 Pro、Max、Team 方案在發布當天就把它設為預設模型。同家族的 Sonnet 5.5 與 Haiku 5.5 會在數週內跟上,到時家族才算到位。
Claude Opus 5.5 跟 Opus 5 差多少?
官方評測內 5.5 全面高於 Opus 5:Terminal-Bench 4.0 從 52.3% 升到 66.4%,GDPval 從 1708 升到 1846 Elo,OSWorld 從 74.0% 升到 81.8%。效率差距更大:20 萬行程式碼稽查從 20 小時以上縮到 3 小時內,token 用量約三分之一。價格同步下修,典型負載總成本低 40%。
Claude Opus 5.5 多少錢?
API 每百萬輸入 4 美元、輸出 20 美元,比 Opus 5 的 5 與 25 各降 20%。快取讀取每百萬 0.20 美元(降 60%),5 分鐘快取寫入 5 美元、1 小時 8 美元,Batch API 半價。Fast 版 8 與 40 美元,最高 2.5 倍速,僅 Claude API、Claude Code 與 Claude Platform 提供。
「省 40%」是怎麼算出來的?
兩層相乘:牌價降 20%,加上每任務消耗的 token 變少。官方在預設設定下的典型工作負載量到總成本比 Opus 5 低 40%;客戶端的量測落在 40% 到 50%。實際省多少取決於你的負載組成,輸出與快取占比越高,降幅通常越明顯。
Claude Opus 5.5 跟 Fable 5.1 哪個強?該選哪個?
絕對能力 Fable 5.1 仍是 Anthropic 最強,牌價 10 與 50 美元、延遲較慢;官方定位 5.5 在多數工作達到 Fable 水準,且自己補充兩者實務差距比評測分數顯示的小。大量、長時間、快取吃重的代理與寫程式負載選 5.5;低頻率、單點最難的推理留給 Fable。
從 Opus 5 升級到 5.5,哪些程式會壞掉?
四個破壞性變更:thinking 不能再關(含手動預算寫法);強制工具呼叫的 tool_choice 設定被拒;thinking 區塊綁定模型與對話,8 月 31 日後新帳號強制檢查內容未被改動;電腦操作的舊工具介面在 Claude API 與 Google Cloud 被拒(Bedrock 例外)。還有一個安靜的改變:工具間進度文字改走 thinking 區塊,串流介面要調顯示設定才收得到。
Claude Opus 5.5 台灣可以用嗎?
可以。官方未公告區域限制,API、三大雲與訂閱方案依各平台既有機制供應,美元計費。這是依現有資訊的推定,不是官方針對台灣的專屬承諾,重要流程建議留備援。
Claude Code 和手機上的 Claude app 有 Opus 5.5 嗎?
有。5.5 已是 claude.ai、Claude 應用程式(含 Cowork)與 Claude Code 在 Pro、Max、Team 方案的預設模型,開箱即用。GitHub Copilot 發布當天上架,Kiro 即將提供。
為什麼我的資安任務被轉給 Opus 4.8?
5.5 的資安能力被官方評估為夠強,因此配上與旗艦同等級的防護:資安分類器在每個動作前檢查,多數資安任務透明地路由到 Opus 4.8,日常寫程式與修 bug 不受影響。經驗證的資安從業人員可透過驗證計畫申請完整功能,該計畫數週內擴大到 5.5。
Claude Opus 5.5 的 Fast 版是什麼?誰該用?
Fast 版是低延遲的變體,每百萬輸入 8 美元、輸出 40 美元,速度最高 2.5 倍,目前是研究預覽,只在 Claude API、Claude Code 與 Claude Platform 提供。適合延遲就是價值的互動場景(即時對話、邊寫邊看);大批次、不著急的工作走 Batch API 更省,兩者不要混用。
Claude Opus 5.5 能生成圖片嗎?
不能。它收文字與圖片輸入,輸出只有純文字。看截圖找問題、讀圖表寫分析、整理掃描文件都行,但要產生圖片,需要另找生成工具,這是輸出型態的限制,與能力強弱無關。
Opus 5 會被淘汰嗎?
短期不會。官方對 5.5 的退役承諾是不早於 2027 年 9 月 22 日,Opus 5 依既有週期規劃。新專案直接用 5.5,既有 Opus 5 整合照遷移清單升級即可,不必搶時間。
Claude Opus 5.5 跟 GPT-6 Astra、GPT-6 Sol 比哪個好?
官方對照裡各有勝場:5.5 拿下 Terminal-Bench 4.0、FrontierCode、GDPval 等多數第一,GPT-6 Astra 在 AutomationBench(41.4 對 40.0)與 Terminal-Bench-Science(64.6 對 58.7)兩項領先。成本結構不同:5.5 靠單價與 token 用量雙降,把典型負載成本壓到 Opus 5 的六成左右,同日 OpenAI 也讓 GPT-6 Sol 與 Luna 降價應戰。跨廠選型用自家任務各跑一輪,比看分數可靠。
要怎麼開始用 Claude Opus 5.5?
三條路:claude.ai 與 Claude Code 的 Pro、Max、Team 訂閱,它已是預設模型、不必設定;Claude API 直接呼叫,model ID 是 claude-opus-5-5(Bedrock 上是 anthropic.claude-opus-5-5);或沿用 Bedrock 等雲端平台的既有整合。從 Opus 5 遷移的程式,先跑過四個破壞性變更清單再上線。





討論與提問