Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日發表的 Opus 梯隊新旗艦,API model ID 是 claude-opus-5,官方定位在「複雜 agentic coding 與企業工作」。它在 Claude 一般可用梯隊裡排在 Fable 5 之下、Sonnet 5 之上,標準價每百萬 tokens 輸入 5 美元、輸出 25 美元,與前代 Opus 4.8 完全相同,沒有推廣價。
重點先看
梯隊位置:Opus 梯隊最強,低於 Mythos-class 的 Fable 5、高於 Sonnet 5 與 Haiku 4.5;官方在 System Card 明說整體能力未超過 Fable 5。
規格:1M context、128k 最大輸出、thinking 預設開啟、effort 梯隊
low/medium/high(預設)/xhigh/max。價格:$5/$25 與 4.8 同價;賣點是「接近 Fable 5 的前沿智慧、但半價」;Fast mode $10/$50 是 research preview,僅 Claude API。
新功能:mid-conversation tool changes、default fallbacks、prompt cache 最小值降到 512 tokens、Fast mode。
遷移踩雷:thinking 預設開(4.8 預設關),
max_tokens要重看;同時關閉 thinking 又用xhigh/maxeffort 會回 400;effort 權重提高。取得:claude.ai(Max 預設、Pro 最強可選)、Claude Code、Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全 GA。
多數文章講到 Opus 5 只覆述規格表,說它「更聰明、更會寫程式、更 agentic」。規格表是對的,但對判斷要不要用、怎麼用幫助有限。最該先搞清楚的是它在梯隊裡的真實位置:Anthropic 自己在 Claude Opus 5 System Card 裡明說 Opus 5 整體並未超過 Fable 5。這句話讀起來像反面宣傳,其實是判斷 Opus 5 適用範圍最重要的線索,下面會一路展開。
文章目錄
Opus 5 的定位與發表
Opus 5 是 Anthropic「Opus 梯隊」首個第五代模型,把複雜的 agentic coding 與企業工作往前提了一階。官方給它兩個稱號:「Opus 梯隊最強」「complex agentic coding and enterprise work 的主力」。第一個基本屬實,第二個是行銷詞,實際多強看下面評測。
2026 年 7 月 24 日發表,當天 API、claude.ai、Claude Code、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全部同步開放。前身是 2026 年 5 月 28 日發布的 Claude Opus 4.8。Opus 4.x 這條線節奏很快,從 4.5(2025 年 11 月)到 4.8(2026 年 5 月)六個月內換了四代,4.8 才上線兩個月就被 5 接替。發表前,Opus 5 以代號 Honeycomb 在業界流傳,2026 年 7 月初曾短暫出現在 Cursor 裡,當時還是傳聞,現在已正式發布,可以代號淵源提一下,但以官方現況為準。
訂閱預設位置也調整了。Opus 5 是 Claude Max 方案的新預設模型,也是 Claude Pro 方案上最強的可選模型。付費最高的那一層用戶拿到它不必動作,Pro 用戶要手動切換才能用,用量限制也比較緊。
在 Claude 梯隊裡的位置:Fable 5、Opus 5、Sonnet 5、Haiku 4.5
Anthropic 目前一般可用的梯隊,由上到下是 Fable 5、Opus 5、Sonnet 5、Haiku 4.5。這個排序對應四種工作類型與四個價格帶,不是純粹的強弱階梯。
| 模型 | 定位 | API ID | 輸入/輸出(每百萬 tokens,USD) | Context | 適合什麼工作 |
|---|---|---|---|---|---|
| Fable 5 | Mythos-class 頂級 | claude-fable-5 | $10 / $50 | 1M | 最高判斷、企業旗艦、複雜資安研究 |
| Opus 5 | Opus 旗艦 workhorse | claude-opus-5 | $5 / $25 | 1M | 最難 agentic coding、企業大型部署、關鍵判斷 |
| Sonnet 5 | 平衡預設值 | claude-sonnet-5 | $3 / $15 | 1M | 多數開發、寫作、agentic workflow |
| Haiku 4.5 | 最快最便宜 | claude-haiku-4-5-20251001 | $1 / $5 | 200k | 量大、分類、摘要、結構化抽取 |
梯隊上下不等於永遠選最上面那顆。Fable 5 對多數日常任務是浪費,Sonnet 5 與 Haiku 4.5 對最難的任務會回不出來。想把整個 Claude 家族放進地圖一起看的話,可以回頭爬一篇 Claude 模型與工具的整體教學,這裡只聚焦 Opus 5 這一格。

Fable 5 是 Anthropic 首個公開的 Mythos-class 模型,2026 年 6 月 9 日發表,中間因為美國出口管制暫停過一陣子,7 月 1 日才全球重開。它與另一顆只給邀請制使用的 Mythos 5 同規格同定價,一般大眾只會碰到 Fable 5。Opus 5 不是 Mythos-class,沒有受到像 Fable 5 那樣的出口管制影響。
關鍵判斷點是「整體未超過 Fable 5」這條官方設的邊界。Anthropic 在 System Card 裡白紙黑字寫著 Opus 5 整體能力不超過 Fable 5,alignment 風險評估為 very low,與 Fable 5 同級。這句話的實際意思是:要用「最強」這個詞,最強的仍是 Fable 5;Opus 5 是「Opus 梯隊最強」與「同價位最強」。講白了,如果你本來就在 Fable 5 上跑最難的任務,沒有理由為了 Opus 5 切過去;如果你本來在 Opus 4.8 上跑,Opus 5 是明確升級。
把 Fable 5 與 Opus 5 的關係想成「研究員與資深工程師」會更踏實。Fable 5 是那種給最難、最前沿、最不可替代判斷的模型,量少但關鍵;Opus 5 是每天能把複雜工作穩定跑完的模型,量大、可重複、成本可控。企業真正大量部署的是後者,前者留在少數關鍵場景。Anthropic 把 Opus 5 稱為「complex agentic coding and enterprise work 的主力」,主力的意思是「每天在線上跑的主力部隊」,不是「最銳利的那一刀」。
規格亮點:1M context、128k 輸出、thinking 預設開
Context 與輸出上限
Context window 是 1M tokens,而且 1M 同時是預設值與最大值,沒有較小的 context 變體。意思是無論你用什麼介面叫 Opus 5,context 上限都是 1M。最大輸出 128k tokens,這個數字對長篇寫作、大型程式碼生成、多步驟報表都夠用。
Vision 與 tool use
輸入支援文字、圖片與檔案,具備 vision 與 tool use 能力,與 Opus 4.x 一致。你可以餵它截圖、PDF、CSV、程式碼檔案,它能在同一個對話裡讀、分析、來回操作。對文件審閱、資料整理、圖表理解這類工作,這個能力比純文字模型實用很多。
Vision 對辦公場景特別有感。把一份中文 PDF 合約丟給它,請它標出風險條款並比對你的範本;或把產品設計稿、競品登陸頁截圖一起餵進去,讓它比對文案與視覺、整理差異點。Tool use 則讓它能在對話中呼叫外部 API、查資料庫、操作瀏覽器,這是 agentic 工作流程的基礎建設。
Thinking 預設開、effort 梯隊
Thinking 這次預設開啟,這是與 Opus 4.8 最直接的行為差異之一。模型自己決定這個任務要不要想、想多久,你不用手動下指令。thinking:{type:"adaptive"} 仍有效且等同預設。effort 參數控制思考深度,梯隊是 low、medium、high(預設)、xhigh、max,無論 API 或 Claude Code 都是這個排序。
high 是預設這件事很重要。它代表 Anthropic 把「多想一點再回答」當成出廠值,多數任務你拿到的回答是模型已經想過一輪的版本。要省錢就往下調,要把最難的題目榨乾就往 xhigh 或 max 推。effort 直接影響 token 消耗與延遲,這也是成本規劃的關鍵變數。
effort 對 Opus 5 的影響比歷代 Opus 都更可靠。官方在發布公告裡提到,Opus 5 把額外 effort 轉成更好結果的可靠性是歷代 Opus 之最。意思是同樣從 high 推到 xhigh,Opus 5 比 4.8 更有機會真的換回更好的答案,而不是白花 token。這個觀察官方講得很正面,獨立驗證要等第三方評測,但方向值得記下來。
要特別注意一個 breaking change:同時關閉 thinking 又用 xhigh 或 max effort 的請求會回 400。API 仍保留關閉 thinking 的選項,但配合的 effort 上限就是 high。從 4.8 搬過來的 workload 如果本來關 thinking 又想在最難任務上推高 effort,要先決定要嘛開 thinking、要嘛接受 high effort 上限。

與 4.8 同價的背後:成本真相與 Fast mode
API 標準價是輸入 $5、輸出 $25(每百萬 tokens,USD),與 Opus 4.8 完全相同,沒有推廣價。官方在 Claude Opus 規格頁 與發布公告裡重複強調一句話:「接近 Claude Fable 5 的前沿智慧,但半價」。Fable 5 是 $10/$50,所以 Opus 5 的單價正好是 Fable 5 的一半。這就是 Opus 5 的成本故事主軸,不是「比 4.8 便宜」,因為它沒有比 4.8 便宜。
把情境算給你看(示意)。假設你有一段 8,000 tokens 的 system prompt,每天重複叫 1,000 次,每次輸出約 2,000 tokens。輸入成本是 8,000 × 1,000 ÷ 1,000,000 × $5 = $40,輸出成本是 2,000 × 1,000 ÷ 1,000,000 × $25 = $50,合計一天 $90,一個月(22 個工作天)約 $1,980。換成 Fable 5 做相同工作量,是 8 × $10 + 2 × $50 = $180 一天,一個月約 $3,960。同一份工作量在 Fable 5 上要花兩倍錢,這就是官方「半價」那段話的實際意義。
再換一個團隊場景(示意)。假設一個五人開發團隊,每人每天跑 Claude Code 約 200 次請求,每次平均 12,000 tokens 輸入與 3,000 tokens 輸出。一天總請求 1,000 次,輸入 1,200 萬 tokens、輸出 300 萬 tokens。在 Opus 5 上,一天成本是 12 × $5 + 3 × $25 = $135,一個月約 $2,970。把 Prompt caching 設好(重複的 system prompt 與專案 context 命中率高),這個數字可以再壓三到五成。
壓成本的兩個主要機制要記得設。Prompt caching 在重複 prefix 命中時,cache read 的價格只有 base input 的十分之一,官方數字是最高省 90%;這次 Opus 5 把最低可快取 prompt 長度從 4.8 的 1,024 tokens 降到 512 tokens,等於把 cache 的實用門檻下調一半,較短的 system prompt 也能開始享受 cache 紅利。Batch processing 是另一條獨立路徑,把沒有即時性需求的請求打包送,省 50%,代價是回傳時間最多 24 小時;適合大批資料標註、文件分類、回 email 草稿生成這類不在乎一兩個小時內拿到結果的任務。
US-only inference(資料留美)是另一個成本變數,加價 1.1 倍。這個選項主要給有資料主權合規需求的企業,例如金融、醫療、政府合約;一般使用者與多數企業不需要,預設不開啟就好。
Fast mode 是這次新出現的 research preview,定價 $10 輸入 / $50 輸出,大約 2.5 倍速度、2 倍價格,僅在 Claude API 提供,Bedrock、Vertex AI、Foundry 暫不支援。要把它當成「必要時花兩倍錢買 2.5 倍速度」的窄用途選項,長期 workload 仍然用標準價評估。
老實說,看完整個定價結構,Opus 5 對本來就用 Opus 4.8 的人是「成本不變、能力全面提升」;對本來用 Sonnet 5 的人是多花 1.67 倍錢換 Opus 梯隊的判斷力;對本來用 Fable 5 的人是「能在很多任務上切下來省一半」。三種帳本要分開算,不要混在一起。

再算一個更直接的 Opus 5 與 Sonnet 5 比較(示意)。同一份工作:每次 8,000 tokens 輸入、2,000 tokens 輸出,每天跑 1,000 次。Sonnet 5 標準價一天是 8 × $3 + 2 × $15 = $54,一個月約 $1,188;Opus 5 一天是 8 × $5 + 2 × $25 = $90,一個月約 $1,980。差價每個月約 $792,一年接近 $9,500。這筆錢要不要花,取決於你最難任務的出錯成本:如果一次判斷錯誤的成本超過這個數字,Opus 5 是划算的;如果任務本身對正確性要求不高,Sonnet 5 反而是甜蜜點。說穿了,模型選擇不是技術問題,是你出錯預算的財務問題。
效能評測:對前代全面勝出、對 Fable 5 仍落後的雙向解讀
這些評測數字都是 Anthropic 自己測的,看看趨勢就好,要查證去翻 System Card 與發布公告裡的 chart。

Opus 5 對前代 Opus 4.8 是全面勝出。Frontier-Bench v0.1 上,Opus 5 以更低單任務成本達到 Opus 4.8 的兩倍以上表現;ARC-AGI 3(專門考新穎問題求解)分數是次佳模型的三倍;Zapier AutomationBench(端到端商務任務)通過率約是次佳模型的 1.5 倍;OSWorld 2.0(computer use)以約三分之一成本超越 Fable 5 的最佳結果。生命科學這條線也全面提升,有機化學(從光譜推分子結構)內部 benchmark 比 4.8 多 10.2 個百分點;GDPval-AA(知識工作)拿下新 SOTA。這幾個數字是這一代升級幅度最直接的證據。
但跟 Fable 5 比,畫面就轉了。Anthropic 在 System Card 裡白紙黑字寫著 Opus 5 整體並未超過 Fable 5;CursorBench 3.2(max effort)上 Opus 5 在 Fable 5 巔峰分數的 0.5% 以內,但單任務成本減半。意思是分數追得上、成本省得多,但「整體最強」這個頭銜還在 Fable 5 手上。
Cyber 是另一個不能不提的面向。Opus 5 的資安能力優於 Opus 4.8(辨識軟體漏洞能力提升),但仍落後 Mythos 5。具體一點:防禦型的原始碼漏洞發現變強,進攻型的編譯二進位檔漏洞發現仍然不行。所以需要做進攻型資安研究的場景,要拿 Fable 5 或 Mythos 5;做防禦方工作,Opus 5 比 4.8 更好用。
合作夥伴的見證也值得記一筆,但要知道這些是發表會挑過的,聽方向就好。Devin(Cognition)說 Opus 5 在 FrontierCode 1.1 上接近 Fable 水準、半價,對困難 debug 與 root-cause 分析特別強;Cursor 說 Opus 5 以 Opus 的速度與成本提供接近 Fable 5 的智慧,CursorBench 上略低於 Fable 5、行為相近。兩家都把「半價接近 Fable」這個賣點講出來,與官方定調一致。
數字讀起來分兩層:對前代 4.8 是全面勝出、沒有回退,對 Fable 5 則是分數逼近、整體仍落後、成本省一半。三個方向同時存在,不互相打架。講「Opus 5 已經等於 Fable 5」是過度陳述,比較準的講法是「在多數實際工作量下,Opus 5 用一半的錢拿到接近 Fable 5 的結果」。
對一般使用者到底意味什麼:agentic、thinking 預設開、effort 梯隊
agentic 這個詞被各家廠商用得很浮濫,講到後來常常只剩「會自己做事」這種沒資訊量的口號。對一般使用者,agentic 的具體意思是:模型能接工具、能連續做好幾步、會在中間自己判斷要不要再查一次。
換到工作場景,這幾件事的實際效果是交辦的顆粒度變大。以前你要把一件工作拆成「查 A、查 B、把 A 跟 B 比較、寫結論」幾個 prompt 分別餵,現在你給 Opus 5 一個目標,讓它自己排流程。它發現缺了訓練截止後的資訊,會自己用瀏覽器或 API 去查,而不是硬猜。它也能在多檔、多步驟的環境裡維持狀態,Claude Code 跑一個 repo 的重構、claude.ai 跑一個研究任務,背後都是這個能力。
落到三種工作會比較具體。做內容研究的人,把十家競品的定位、定價、近期新聞整理成交付給客戶的產業報告,從前要花三天手動爬資料,現在把十家清單與分析框架交代給 Opus 5,它自己排詢問順序、分批爬資料、整理成結構化輸出,再交一份草稿加來源清單給你。你的工作從「執行」挪到「設定目標、驗收、補框架」,驗收標準可以訂成:每條結論都要能對回某條可點擊來源。
寫程式的人不必憑空想像,Claude Code 裡直接看得到。丟一個五人團隊維護兩年、約五十個檔案的舊模組給它重構,把目標與限制設好,它讀完整個模組、規劃改動、分批修、跑測試、自我修正,開一個分支跟 PR 等你審。你審的是 PR,不是逐行改碼,驗收門檻就是那個 PR 得過你既有的測試套件。要把這條工作流程與其他 coding agent 比節奏,可以參考另一篇 Codex 與 Claude Code 的節奏差異。
行銷的量大任務也合用。電商檔期要為二十檔 SKU 各發一篇社群貼文、每篇對應不同受眾與平台,把產品資訊、受眾清單、平台規範一次給齊,它自己生成、自己按平台特性調整、產出帶配圖建議的成品,驗收時按受眾清單逐篇核對即可。
三種工作表面不同,底層是同一個位移:你交辦的單位從「一句話」放大成「一個任務」,重心從「產出」挪到「設計任務與驗收」。thinking 預設開、effort 梯隊這兩個設計,就是支撐這個位移的引擎:模型自己在每次任務裡決定要想多久,你再透過 effort 微調深度。

agentic 也有它做不到的事。它不會替你判斷「這個任務該不該做」,不會替你做倫理與合規決定,不會處理需要人際信任與判斷的溝通。策略、判斷、關係這幾件事它接不了,留給人類自己;能交給它的,是重複、可驗收、有明確定義的執行。
什麼情況選 Opus 5、什麼情況升 Fable 5、什麼情況退 Sonnet 5
問題不是哪顆最強,是你要它做哪一種活。Opus 5 是企業與高難度開發的合理預設,但不是所有人的最佳解。把任務類型、模型、effort 擺在同一張表看,判斷會快很多。

| 任務類型 | 推薦模型 | effort 建議 | 理由 |
|---|---|---|---|
| 客服分類、標籤、摘要 | Haiku 4.5 | 不適用 | 量大、規則明確,貴模型做浪費 |
| 翻譯、改寫、潤稿 | Haiku 4.5 或 Sonnet 5 low | low | 機械化任務,effort 高低差距小 |
| 日常寫作、email、報告 | Sonnet 5 | medium 到 high | 平衡品質與成本 |
| 中型程式開發、debug | Sonnet 5 | high | 多數開發主場景 |
| 大型 repo 重構、複雜除錯 | Opus 5 | high 到 max | Opus 梯隊主場景 |
| 高風險決策支援、複雜推理 | Opus 5 | xhigh 到 max | 判斷正確性優先 |
| 多步驟 agentic workflow(企業) | Opus 5 | high 到 xhigh | 連續推理 + 可靠性 |
| 進攻型資安研究、最先進判斷 | Fable 5 | high 以上 | Opus 5 cyber 仍落後 Mythos 5 |
選 Opus 5:最難的 agentic coding(大型 repo 重構、複雜除錯)、需要最高判斷正確性的企業決策支援、多步驟 agentic workflow、需要長 context 與大量工具協作的企業工作。如果你本來用 Opus 4.8,Opus 5 是直接升級,紙面成本不變、能力全面提升。
升 Fable 5:需要「整體最強」判斷的關鍵任務、進攻型資安研究、可以接受兩倍成本換取巔峰分數的場景。Fable 5 與 Opus 5 的價差是整整兩倍,要花這個錢之前先問自己這個任務的產出值不值那兩倍。判斷其實很實際:任務出錯會掉錢(退單、合規罰款、客戶流失)、會觸法、或會對外發出造成不可逆影響,就直接升 Fable 5,不必去算那兩倍。
退 Sonnet 5:日常寫作、中型程式開發、長文件處理、量大的 agentic workflow。Sonnet 5 的 $3/$15 是 Opus 5 的 0.6 倍,多數工作用它就夠。把 Sonnet 5 放在量大工作層、Opus 5 放在關鍵判斷層,是常見的兩層配置。例如客服系統,第一層用 Sonnet 5(甚至 Haiku 4.5)做意圖分類與常見問題回覆,分不出來或高風險的再交給 Opus 5 處理,成本與品質都最佳化。
梯隊之間不是越強越好。最強的模型做簡單事就是浪費錢和延遲。把任務分類、對應到對的模型,比一路用最強要省很多。這個判斷在企業部署裡尤其重要,因為量大,幾個百分點的模型選擇錯誤就放大成實質的成本差。
台灣怎麼用 Opus 5:四條取得路徑
取得 Opus 5 有四條主要路徑,難易度與成本結構各不相同。

claude.ai:多數人最快上手的入口。網頁、iOS、Android 都有,桌面端也有 Claude Desktop。Opus 5 是 Claude Max 的預設模型,也是 Claude Pro 上最強的可選模型。區域可用性方面,Opus 5 是 ASL-3、非 Mythos-class,沒有受到像 Fable 5 那樣的美國出口管制;不過 Opus 5 專屬的台灣可用性,目前沒有直接的第三方報導,與同系列模型相同,使用前建議再確認一次 Anthropic 官方支援區域,區域政策本來就會調整。要省事,訂 Max 就直接拿到 Opus 5;不想花到 Max 月費的,Pro 訂閱者手動切換也能用,但用量限制比較緊。
Claude Code:開發者的主力入口。命令列與 IDE 內整合,能直接操作檔案系統、跑終端機、改 repo,是 Opus 5 在 coding 場景的主要介面。要把 Claude Code 跑起來、搭配 Opus 5 的命令列與 IDE 整合細節,可以參考 Claude Code 的命令列與 IDE 整合。
Anthropic API:直接用 model ID claude-opus-5 呼叫,是唯一讓你完全控制 effort、context、caching 的路徑。量大、要做快取、要批次、要用 Fast mode、要 US-only inference 的場景,只能在這裡。門檻是技術能力,要會寫程式或用 Postman 之類的工具,但靈活度與成本控制遠高於訂閱制。
雲端夥伴:Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 三家都已 GA。Vertex AI 與 Foundry 用 claude-opus-5(與 API ID 一致),Amazon Bedrock 的模型 ID 命名規則與 API 不同,實際字串以 Bedrock 主控台顯示為準。一個額外好處:Bedrock 上 zero data retention (ZDR) by default,對合規敏感的企業是實質加分。已在這些雲端上跑工作流程的,透過自家雲端叫 Opus 5 不必另開 Anthropic 帳號,帳單、合規、IAM 全走雲端既有架構。
四條路徑怎麼選?個人使用者與內容工作者走 claude.ai 最簡單,開發者加訂 Claude Code,企業 API 用量大或需要嚴格成本控制走 Anthropic API 直連,已在雲端生態裡的企業走自家雲端夥伴。Fast mode 只在 Claude API 提供,要走 Fast mode 的人只能在 API 直連這條路上。
從 Opus 4.8 搬過來會踩哪些雷
Opus 4.8 沒有被強迫退役,沒有發布 dead line 強制遷移時程。所以「要不要升級」是你自己評估,不是急著動手。
但遷移要小心三個層面。

第一個是 thinking 預設開這件事造成的 max_tokens 重算。4.8 預設不開 thinking,你設多少 max_tokens 就是回覆上限;Opus 5 預設開 thinking,max_tokens 變成「思考 + 回覆」的合計硬上限。從 4.8 搬過來的 workload,如果本來 max_tokens 設得剛剛好,搬到 Opus 5 後可能因為模型把一部分預算花在思考上、導致回覆被截斷。升級前把 max_tokens 全部重看一遍,這是最常見的雷。
第二個是前面提過的 breaking change:同時關閉 thinking 又用 xhigh 或 max effort 的請求會回 400。API 仍保留關閉 thinking 的選項,但配合的 effort 上限是 high。看個 before/after。
4.8 時代這樣寫還能跑:
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"thinking": {"type": "disabled"},
"effort": "max",
"messages": [{"role": "user", "content": "..."}]
}
搬到 Opus 5,要嘛把 thinking 拿掉(接受預設開),要嘛把 effort 降到 high 以內,否則回 400:
{
"model": "claude-opus-5",
"max_tokens": 8192,
"effort": "max",
"messages": [{"role": "user", "content": "..."}]
}
注意 max_tokens 從 4096 拉到 8192,是因為 thinking 預設會吃一部分預算,不拉高就可能截斷。
第三個是行為校準。effort 權重在 Opus 5 提高,同樣的 high 在 4.8 與 5 上表現出來的「想多久」可能不同;本來寫給 4.8 的 prompt 不需要全部重寫,但建議先在非生產環境跑兩週 A/B,把輸出與成本和 4.8 並排比較,再決定要不要全面切換。Prompt caching 最低值降到 512 tokens 是好消息,本來因為 system prompt 太短不能開 cache 的場景,現在可以開始用了,這個要在搬遷時一起設定,否則等於把可省的錢放著不撿。
prompt 本身的寫法也建議跟著調整。Opus 5 的 thinking 預設開、effort 權重高,對「目標導向」的 prompt 反應比「步驟導向」更好。4.8 時代常見的寫法「先做 A、再做 B、再做 C」這種過度具體的步驟指令,到了 Opus 5 反而可能綁住模型的思考;改成「給我 X 結果,考慮 Y 限制,輸出格式是 Z」這種目標與限制描述,產出通常更接近你要的。這個調整方向與 Anthropic 近幾代的 API 設計哲學一致:模型自己決定怎麼想,你用自然語言描述目標,不要用抽樣參數或步驟指令微調。
新功能裡最該注意的三個:tool changes、default fallbacks、cache 最小值
這次的新功能寫在 Opus 5 what’s-new 文件 裡,多數是給開發者用的 API 層改進,一般訂閱用戶感覺不到,但對企業部署很重要。

Mid-conversation tool changes(beta):對話中途可增刪工具,而且保留 prompt cache。以前要嘛一開始就把工具清單固定下來,要嘛改一次就重送整段、cache 失效;現在可以視任務進展動態加工具,cache 還能繼續用。這個對長程 agentic workflow 的成本控制是實質改善。beta header 是 mid-conversation-tool-changes-2026-07-01。
Default fallbacks mode(beta):fallbacks 參數新增 "default" 模式,依拒絕分類套用 Anthropic 建議的 fallback 模型,開發者不必自己維護 fallback 模型清單。整個 fallbacks 參數為 beta、opt-in,不是自動行為。要特別知道的是,Opus 5 在高風險領域可能 fallback 到 Opus 4.8,會通知使用者;這是 System Card 明講的設計。beta header 是 server-side-fallback-2026-07-01。
Lower prompt cache minimum:最低可快取 prompt 長度從 1,024 tokens 降到 512 tokens。這個改動看起來小,實務上很有感,因為不少應用的 system prompt 剛好落在 500 到 1,000 tokens 這個尷尬帶,本來開 cache 沒效果、現在可以開始用了。
這三個都是 opt-in 的 beta 或設定,預設不開,遷移時要自己選起來。
常見迷思
最常見的,是把 Opus 5 當成 Fable 5 的等價品。System Card 白紙黑字寫著 Opus 5 整體未超過 Fable 5,CursorBench 上也是略低於 Fable 5。把推薦文寫成「Opus 5 已超越 Fable 5」是過度陳述,任何這樣講的評測或評論都該打折。比較準的講法是「同成本下最強」「半價接近 Fable 5」。
另一個誤解,是把「thinking 預設開」當成「每次都要付思考成本」。預設開不代表每次都會想很久,模型自己會判斷任務需不需要想、想多久;簡單任務的思考成本可能接近零,複雜任務才會把思考預算吃滿。要把思考關掉也可以,但受 effort 上限限制(關閉 thinking 時 effort 最高到 high)。
effort 越高越好,同樣不是鐵律。high 是預設,多數任務合理;量大或對延遲敏感的任務就該往下調。同一個 prompt 每天跑破千次,或延遲預算壓在兩秒內,往下調到 medium 甚至 low,多數情況輸出品質只掉一點點,成本卻可能差好幾倍。effort 調的是花多少,不是做多好。
「Opus 5 很安全,所以能做進攻型資安工作」這句只對一半。Opus 5 整體 alignment 風險評估為 very low,prompt injection 抵抗力是歷代 Opus 提升最多的;它也允許所有存取層級的原始碼漏洞發現,做防禦方工作比 4.8 更好用。但進攻型、編譯二進位檔的漏洞發現仍然不行,整體 cyber 能力仍落後 Mythos 5。做防禦方工作它很好,做需要進攻能力的資安研究,要拿 Fable 5。
1M context 也是常被高估的數字。技術上可以把整個知識庫塞進去,實務上 context 越長、recall 越差,這是所有 LLM 共通的現象。1M context 的正確用法是放完整長文件、整個 repo、整場會議逐字稿這類結構清楚的內容,不是把雜亂無章的資料全塞進去期待它找得到。
使用限制與審核邊界
幻覺與諂媚(sycophancy)的具體數字官方沒有公布,你要的是「方向」這個訊號,不是某個精確百分比。Over-refusal 在良性請求上是近期模型最低之一,這對實際使用體驗是好消息,因為前幾代 Claude 為人詬病的就是過度拒絕。多輪回應可能較冗長詳細,這對需要簡短輸出的場景要注意。
Opus 5 沿用與 Opus 4.8 相同的 ASL-3 防護。化生風險評為 CB-1(非新型武器合成),不是 CB-2,與 Mythos 5 的 CB 風險相當;未跨越 RSP 的 automated AI R&D 門檻,AI R&D 能力與 Mythos 5 相當但未接近替代研究員;沒有新令人擔憂的 covert capabilities。這些是 System Card 公開的評估,不是負評,但企業部署要把 ASL-3 這個標籤放進合規討論。
對合規敏感的產業還有一個設計要曉得:Opus 5 在高風險領域可能 fallback 到 Opus 4.8,會通知使用者。這個 fallback 不是隱藏行為,是寫進 System Card 的明文機制,開發者也可以透過 API 的 fallbacks 參數自己設定。對金融、醫療、政府合約這類需要可預測行為的場景,這個機制要在 SLA 與使用者告知裡寫清楚:你的請求有時會跑到 4.8,行為可能與 5 略有差異,審計要能區分兩者。防禦型資安工作則有一個實質利好:Opus 5 允許所有存取層級的原始碼漏洞發現,但仍阻擋編譯二進位檔的漏洞發現(後者較常用於進攻)。
Opus 5 的同期競爭對手還有 OpenAI 的 GPT-5.6 與 xAI 的 Grok 4.5,各自在 coding、agentic、知識工作有不同的強項與定價結構,橫向比較留給那兩篇。選哪一個,看你的主要任務類型、生態綁定(IDE、雲端、API SDK)、合規需求,沒有絕對贏家,建議實際拿你的真實任務跑 A/B,比看評測分數準。
實際使用上要設計人類審核環節的幾個情境。對外發送的內容(email、公關稿、社群貼文、客服回覆)一定要人看過再送,因為 LLM 偶爾會自信地寫出錯誤事實或語氣不合的句子,這不是 Opus 5 獨有,但它的 agentic 能力讓它「自己跑完」的範圍變大,等於把這個風險面也放大了。涉及金額、日期、合約條款、法規解讀的輸出,必須雙重核對原始資料,不要相信它「記得」。需要原地修改外部系統的 agentic 動作(寫資料庫、改檔案、發 API 請求),最好先在沙盒或 staging 環境跑,確認行為符合預期再開放正式環境。

哪種任務絕對不要完全交給它?涉及人際判斷的(例如錄用決定、績效評估、客戶關係處理)、需要創始人直覺的(例如產品方向、品牌定位)、需要承擔法律責任的(例如醫療診斷、法律建議、投資建議)。這些領域它可以做草稿、做資料整理、做假設情境分析,但最終判斷與責任在人類身上。
下一步:三種讀者怎麼動手
如果你是 Claude Max 訂閱用戶,什麼都不用做,Opus 5 已經是預設模型。要做的是認識 thinking 預設開與 effort 梯隊,給任務時調整 prompt 習慣,少寫死步驟,多描述目標與限制。第一次試可以用一段你常做的工作,分別用 high 與 xhigh 各跑一次,看輸出差異與用量差異,建立自己的 effort 直覺。如果你是 Pro 訂閱用戶,要到設定裡手動切換才能用 Opus 5,用量上限比 Max 緊,建議把最難的任務留給它,日常用 Sonnet 5 即可。
如果你是開發者,本來用 Opus 4.8 寫 API 或跑 Claude Code,先在非生產環境試跑,把 max_tokens 重看一遍(因為 thinking 預設吃預算)、確認沒有「關閉 thinking 又用 xhigh/max effort」這種會回 400 的組合、把 Prompt caching 設起來(最低 512 tokens 現在更實用)。確認沒問題再切換 production。Opus 4.8 沒有強制退役,你不急的話可以分階段搬,先搬低風險 workflow,觀察兩週再擴大。
如果你是企業在評估大規模部署,走雲端夥伴(Bedrock、Vertex AI、Foundry)比較省事,帳單合規都走既有架構。Bedrock 的 ZDR by default 對合規敏感的產業是實質加分。要做的事是重新校準 TCO,把 effort 提高帶來的多算幾輪、Prompt caching 命中率、Fast mode 是否需要、US-only inference 1.1 倍加價全算進去,再跟 Sonnet 5、Haiku 4.5 的混合配置比一遍(粗估:月呼叫 5,000 萬 tokens、cache 命中七成,用上面的單價套一遍,就是企業要編進預算的那個數字)。光看單價會選錯。同時要設計人類審核環節,因為 Opus 5 在高風險領域會 fallback 到 4.8,這個 fallback 路徑要在 SLA 與使用者告知裡寫清楚。
不管走哪條路,都別只看規格表就下判斷,拿你的真實任務實跑一週,讓數字自己說話。規格表告訴你上限,實跑告訴你均值,兩者差距就是你決策的空間。切換以後第一個月也要加強監控實際成本,effort 權重提高與 thinking 預設開會在你意料之外的地方偷跑出來,最常見的浪費點是高 effort 跑了大量其實只需要 medium 的任務,這個落差只有實際看用量資料才看得出來,靠感覺抓不準。
常見問題
Claude Opus 5 跟 Claude Opus 4.8 差在哪?
規格升級,API 標準價不變,都是 $5/$25。Context 1M、最大輸出 128k 與 4.8 相同,但 thinking 預設開啟(4.8 預設關)、effort 權重提高(Opus 5 是歷代 Opus 中把額外 effort 轉成更好結果最可靠的一代),並新增 mid-conversation tool changes、default fallbacks、cache 最小值降到 512 tokens、Fast mode 等功能。效能上對 4.8 是全面勝出,Frontier-Bench v0.1 達到 4.8 兩倍以上表現、ARC-AGI 3 是次佳模型三倍。遷移要注意 thinking 預設開會吃 max_tokens 預算,以及關閉 thinking 又用 xhigh/max effort 會回 400。
Claude Opus 5 真的比 Fable 5 強嗎?
不。Anthropic 在 System Card 裡明說 Opus 5 整體能力並未超過 Fable 5。CursorBench 3.2 上 Opus 5 在 Fable 5 巔峰分數的 0.5% 內,但單任務成本減半;進攻型 cyber 能力仍落後 Mythos 5。正確說法是「Opus 梯隊最強」「同成本下最強」「半價接近 Fable 5 智慧」,不是「整體最強」。
Claude Opus 5 一個月要花多少錢?
訂閱制與計量制結構不同。claude.ai Free 方案不提供 Opus 5;Pro 是固定月費、可手動選用 Opus 5 但用量較緊;Max 是固定月費、Opus 5 是預設模型。API 計量制是 $5/$25(每百萬 tokens),實際花費取決於 token 用量。例如每天 1,000 次呼叫、每次約 8,000 tokens 輸入與 2,000 tokens 輸出,一天約 $90,一個月(22 個工作天)約 $1,980。把 Prompt caching(cache min 512 tokens)與 Batch API 設起來可以把這數字再壓一大塊。Fast mode 是 $10/$50,2 倍價格換 2.5 倍速度,且僅 Claude API 提供。
Claude Opus 5 台灣能用嗎?
Opus 5 是 ASL-3、非 Mythos-class,沒有受到像 Fable 5 那樣的美國出口管制。Opus 5 專屬的台灣可用性目前沒有直接的第三方報導,與同系列模型相同,使用前建議再確認一次 Anthropic 官方支援區域,區域政策會調整。要完全控制 API,可直接用 model ID claude-opus-5 呼叫 Anthropic API,或透過 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry(三個都已 GA)。在企業雲端上跑工作流程的,走自家雲端叫 Opus 5 不必另開 Anthropic 帳號。
Claude Opus 5 適合寫程式嗎?
適合,而且是它的主力場景,官方定位就是「complex agentic coding and enterprise work」。Frontier-Bench v0.1 達到 Opus 4.8 兩倍以上表現、CursorBench 3.2 在 Fable 5 巔峰的 0.5% 內但成本減半、ARC-AGI 3 是次佳模型三倍。Claude Code 把它設成 Max 訂閱的預設模型,Devin 與 Cursor 都把它列為主力選項。一般中型開發 Sonnet 5 也夠,但最難的大型 repo 重構與複雜除錯,Opus 5 是 Opus 梯隊裡最合理的選擇。
Claude Opus 5 何時會被取代?
官方沒有公布下一代發表時程。Opus 4.x 這條線在六個月內換了四代(4.5 到 4.8),4.8 才上線兩個月就被 Opus 5 接替,但這不是固定週期,不能直接外推。Opus 5 是否沿用類似的支援週期,官方還沒說;要追最新時程,以 Anthropic 官方公告與 Models overview 為準。對企業部署來說,假設主力模型一年內可能被接替、API 支援至少再維持一年以上,是比較穩的規劃假設。
