Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日發表的 Opus 梯隊新旗艦,API model ID 是 claude-opus-5,官方定位在「複雜 agentic coding 與企業工作」。它在 Claude 一般可用梯隊裡排在 Fable 5 之下、Sonnet 5 之上,標準價每百萬 tokens 輸入 5 美元、輸出 25 美元,與前代 Opus 4.8 完全相同,沒有推廣價。
這篇是我查證 Anthropic 的官方公告、System Card 與 API 文件後,對 Opus 5 的整理;我平常在 seo.whoops.com.tw 用 Claude 跑內容產線,會把查證到的官方事實與實際使用觀察分開標示,不把規格表整篇照搬。本文於 2026 年 7 月整理。
重點先看
梯隊位置:Opus 梯隊最強,低於 Mythos-class 的 Fable 5、高於 Sonnet 5 與 Haiku 4.5;官方在 System Card 明說整體能力未超過 Fable 5。
規格:1M context、128k 最大輸出、thinking 預設開啟、effort 梯隊
low/medium/high(預設)/xhigh/max。價格:$5/$25 與 4.8 同價;賣點是「接近 Fable 5 的前沿智慧、但半價」;Fast mode $10/$50 是 research preview,僅 Claude API。
新功能:mid-conversation tool changes、default fallbacks、prompt cache 最小值降到 512 tokens、Fast mode。
遷移踩雷:thinking 預設開(4.8 預設關),
max_tokens要重看;同時關閉 thinking 又用xhigh/maxeffort 會回 400;effort 權重提高。取得:claude.ai(Max 預設、Pro 最強可選)、Claude Code、Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全 GA。
多數文章講到 Opus 5 只覆述規格表,說它「更聰明、更會寫程式、更 agentic」。規格表是對的,但對判斷要不要用、怎麼用幫助有限。最該先搞清楚的是它在梯隊裡的真實位置:Anthropic 自己在 Claude Opus 5 System Card 裡明說 Opus 5 整體並未超過 Fable 5。這句話讀起來像反面宣傳,其實是判斷 Opus 5 適用範圍最重要的線索,下面會一路展開。
文章目錄
Opus 5 的定位與發表
Opus 5 是 Anthropic「Opus 梯隊」首個第五代模型,把複雜的 agentic coding 與企業工作往前提了一階。官方給它兩個稱號:「Opus 梯隊最強」「complex agentic coding and enterprise work 的主力」。第一個基本屬實,第二個是行銷詞,實際多強看下面評測。
2026 年 7 月 24 日發表,當天 API、claude.ai、Claude Code、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 全部同步開放。前身是 2026 年 5 月 28 日發布的 Claude Opus 4.8。Opus 4.x 這條線節奏很快,從 4.5(2025 年 11 月)到 4.8(2026 年 5 月)六個月內換了四代,4.8 才上線兩個月就被 5 接替。發表前,Opus 5 以代號 Honeycomb 在業界流傳,2026 年 7 月初曾短暫出現在 Cursor 裡,當時還是傳聞,現在已正式發布,可以代號淵源提一下,但以官方現況為準。
訂閱預設位置也調整了。Opus 5 是 Claude Max 方案的新預設模型,也是 Claude Pro 方案上最強的可選模型。付費最高的那一層用戶拿到它不必動作,Pro 用戶要手動切換才能用,用量限制也比較緊。
在 Claude 梯隊裡的位置:Fable 5、Opus 5、Sonnet 5、Haiku 4.5
Anthropic 目前一般可用的梯隊,由上到下是 Fable 5、Opus 5、Sonnet 5、Haiku 4.5。這個排序對應四種工作類型與四個價格帶,不是純粹的強弱階梯。
| 模型 | 定位 | API ID | 輸入/輸出(每百萬 tokens,USD) | Context | 適合什麼工作 |
|---|---|---|---|---|---|
| Fable 5 | Mythos-class 頂級 | claude-fable-5 | $10 / $50 | 1M | 最高判斷、企業旗艦、複雜資安研究 |
| Opus 5 | Opus 旗艦 workhorse | claude-opus-5 | $5 / $25 | 1M | 最難 agentic coding、企業大型部署、關鍵判斷 |
| Sonnet 5 | 平衡預設值 | claude-sonnet-5 | $3 / $15 | 1M | 多數開發、寫作、agentic workflow |
| Haiku 4.5 | 最快最便宜 | claude-haiku-4-5-20251001 | $1 / $5 | 200k | 量大、分類、摘要、結構化抽取 |
梯隊上下不等於永遠選最上面那顆。Fable 5 對多數日常任務是浪費,Sonnet 5 與 Haiku 4.5 對最難的任務會回不出來。想把整個 Claude 家族放進地圖一起看的話,可以回頭爬一篇 Claude 模型與工具的整體教學,這裡只聚焦 Opus 5 這一格。

Fable 5 是 Anthropic 首個公開的 Mythos-class 模型,2026 年 6 月 9 日發表,中間因為美國出口管制暫停過一陣子,7 月 1 日才全球重開。它與另一顆只給邀請制使用的 Mythos 5 同規格同定價,一般大眾只會碰到 Fable 5。Opus 5 不是 Mythos-class,沒有受到像 Fable 5 那樣的出口管制影響。
關鍵判斷點是「整體未超過 Fable 5」這條官方設的邊界。Anthropic 在 System Card 裡白紙黑字寫著 Opus 5 整體能力不超過 Fable 5,alignment 風險評估為 very low,與 Fable 5 同級。這句話的實際意思是:要用「最強」這個詞,最強的仍是 Fable 5;Opus 5 是「Opus 梯隊最強」與「同價位最強」。講白了,如果你本來就在 Fable 5 上跑最難的任務,沒有理由為了 Opus 5 切過去;如果你本來在 Opus 4.8 上跑,Opus 5 是明確升級。
把 Fable 5 與 Opus 5 的關係想成「研究員與資深工程師」會更踏實。Fable 5 是那種給最難、最前沿、最不可替代判斷的模型,量少但關鍵;Opus 5 是每天能把複雜工作穩定跑完的模型,量大、可重複、成本可控。企業真正大量部署的是後者,前者留在少數關鍵場景。Anthropic 把 Opus 5 稱為「complex agentic coding and enterprise work 的主力」,主力的意思是「每天在線上跑的主力部隊」,不是「最銳利的那一刀」。
Claude Opus 5 規格:1M context、128k 輸出、thinking 預設開
把上述規格整理成快速對照表,方便直接查數字:
| 項目 | Claude Opus 5 規格 |
|---|---|
| API model ID | claude-opus-5 |
| 梯隊定位 | Opus 梯隊最強;低於 Mythos-class 的 Fable 5,高於 Sonnet 5 與 Haiku 4.5 |
| Context window | 1M tokens(預設值同時是最大值,無較小變體) |
| 最大輸出 | 128k tokens |
| Thinking | 預設開啟(Opus 4.8 預設關閉) |
| Effort 梯隊 | low / medium / high(預設)/ xhigh / max |
| 輸入能力 | 文字、圖片、檔案;具備 vision 與 tool use |
| 標準 API 價 | 輸入 $5 / 輸出 $25(每百萬 tokens,USD),與 Opus 4.8 同價 |
| Fast mode | $10 / $50,約 2.5 倍速度、2 倍價格;research preview,僅 Claude API |
| Batch processing | 省 50% |
| Prompt caching | 最高省 90%;最低可快取長度 512 tokens |
| 發表日 | 2026 年 7 月 24 日 |
| 取得管道 | claude.ai、Claude Code、Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry |
Context 與輸出上限
Context window 是 1M tokens,而且 1M 同時是預設值與最大值,沒有較小的 context 變體。意思是無論你用什麼介面叫 Opus 5,context 上限都是 1M。最大輸出 128k tokens,這個數字對長篇寫作、大型程式碼生成、多步驟報表都夠用。
Vision 與 tool use
輸入支援文字、圖片與檔案,具備 vision 與 tool use 能力,與 Opus 4.x 一致。你可以餵它截圖、PDF、CSV、程式碼檔案,它能在同一個對話裡讀、分析、來回操作。對文件審閱、資料整理、圖表理解這類工作,這個能力比純文字模型實用很多。
Vision 對辦公場景特別有感。把一份中文 PDF 合約丟給它,請它標出風險條款並比對你的範本;或把產品設計稿、競品登陸頁截圖一起餵進去,讓它比對文案與視覺、整理差異點。Tool use 則讓它能在對話中呼叫外部 API、查資料庫、操作瀏覽器,這是 agentic 工作流程的基礎建設。
Thinking 預設開、effort 梯隊
Thinking 這次預設開啟,這是與 Opus 4.8 最直接的行為差異之一。模型自己決定這個任務要不要想、想多久,你不用手動下指令。thinking:{type:"adaptive"} 仍有效且等同預設。effort 參數控制思考深度,梯隊是 low、medium、high(預設)、xhigh、max,無論 API 或 Claude Code 都是這個排序。
high 是預設這件事很重要。它代表 Anthropic 把「多想一點再回答」當成出廠值,多數任務你拿到的回答是模型已經想過一輪的版本。要省錢就往下調,要把最難的題目榨乾就往 xhigh 或 max 推。effort 直接影響 token 消耗與延遲,這也是成本規劃的關鍵變數。
effort 對 Opus 5 的影響比歷代 Opus 都更可靠。官方在發布公告裡提到,Opus 5 把額外 effort 轉成更好結果的可靠性是歷代 Opus 之最。意思是同樣從 high 推到 xhigh,Opus 5 比 4.8 更有機會真的換回更好的答案,而不是白花 token。這個觀察官方講得很正面,獨立驗證要等第三方評測,但方向值得記下來。
要特別注意一個 breaking change:同時關閉 thinking 又用 xhigh 或 max effort 的請求會回 400。API 仍保留關閉 thinking 的選項,但配合的 effort 上限就是 high。從 4.8 搬過來的 workload 如果本來關 thinking 又想在最難任務上推高 effort,要先決定要嘛開 thinking、要嘛接受 high effort 上限。

與 4.8 同價的背後:成本真相與 Fast mode
API 標準價是輸入 $5、輸出 $25(每百萬 tokens,USD),與 Opus 4.8 完全相同,沒有推廣價。官方在 Claude Opus 規格頁 與發布公告裡重複強調一句話:「接近 Claude Fable 5 的前沿智慧,但半價」。Fable 5 是 $10/$50,所以 Opus 5 的單價正好是 Fable 5 的一半。這就是 Opus 5 的成本故事主軸,不是「比 4.8 便宜」,因為它沒有比 4.8 便宜。
把情境算給你看(示意)。假設你有一段 8,000 tokens 的 system prompt,每天重複叫 1,000 次,每次輸出約 2,000 tokens。輸入成本是 8,000 × 1,000 ÷ 1,000,000 × $5 = $40,輸出成本是 2,000 × 1,000 ÷ 1,000,000 × $25 = $50,合計一天 $90,一個月(22 個工作天)約 $1,980。換成 Fable 5 做相同工作量,是 8 × $10 + 2 × $50 = $180 一天,一個月約 $3,960。同一份工作量在 Fable 5 上要花兩倍錢,這就是官方「半價」那段話的實際意義。
再換一個團隊場景(示意)。假設一個五人開發團隊,每人每天跑 Claude Code 約 200 次請求,每次平均 12,000 tokens 輸入與 3,000 tokens 輸出。一天總請求 1,000 次,輸入 1,200 萬 tokens、輸出 300 萬 tokens。在 Opus 5 上,一天成本是 12 × $5 + 3 × $25 = $135,一個月約 $2,970。把 Prompt caching 設好(重複的 system prompt 與專案 context 命中率高),這個數字可以再壓三到五成。
壓成本的兩個主要機制要記得設。Prompt caching 在重複 prefix 命中時,cache read 的價格只有 base input 的十分之一,官方數字是最高省 90%;這次 Opus 5 把最低可快取 prompt 長度從 4.8 的 1,024 tokens 降到 512 tokens,等於把 cache 的實用門檻下調一半,較短的 system prompt 也能開始享受 cache 紅利。Batch processing 是另一條獨立路徑,把沒有即時性需求的請求打包送,省 50%;官方說多數 batch 在 1 小時內完成,最長可達 24 小時;適合大批資料標註、文件分類、回 email 草稿生成這類不在乎一兩個小時內拿到結果的任務。
US-only inference(資料留美)是另一個成本變數,加價 1.1 倍。這個選項主要給有資料主權合規需求的企業,例如金融、醫療、政府合約;一般使用者與多數企業不需要,預設不開啟就好。
Fast mode 是這次新出現的 research preview,定價 $10 輸入 / $50 輸出,大約 2.5 倍速度、2 倍價格,僅在 Claude API 提供,Bedrock、Vertex AI、Foundry 暫不支援。要把它當成「必要時花兩倍錢買 2.5 倍速度」的窄用途選項,長期 workload 仍然用標準價評估。
老實說,看完整個定價結構,Opus 5 對本來就用 Opus 4.8 的人是「成本不變、能力全面提升」;對本來用 Sonnet 5 的人是多花 1.67 倍錢換 Opus 梯隊的判斷力;對本來用 Fable 5 的人是「能在很多任務上切下來省一半」。三種帳本要分開算,不要混在一起。

再算一個更直接的 Opus 5 與 Sonnet 5 比較(示意)。同一份工作:每次 8,000 tokens 輸入、2,000 tokens 輸出,每天跑 1,000 次。Sonnet 5 標準價一天是 8 × $3 + 2 × $15 = $54,一個月約 $1,188;Opus 5 一天是 8 × $5 + 2 × $25 = $90,一個月約 $1,980。差價每個月約 $792,一年接近 $9,500。這筆錢要不要花,取決於你最難任務的出錯成本:如果一次判斷錯誤的成本超過這個數字,Opus 5 是划算的;如果任務本身對正確性要求不高,Sonnet 5 反而是甜蜜點。說穿了,模型選擇不是技術問題,是你出錯預算的財務問題。
效能評測:對前代全面勝出、對 Fable 5 仍落後的雙向解讀
這些評測數字都是 Anthropic 自己測的,看看趨勢就好,要查證去翻 System Card 與發布公告裡的 chart。

Opus 5 對前代 Opus 4.8 是全面勝出。Frontier-Bench v0.1 上,Opus 5 以更低單任務成本達到 Opus 4.8 的兩倍以上表現;ARC-AGI 3(專門考新穎問題求解)分數是次佳模型的三倍;Zapier AutomationBench(端到端商務任務)通過率約是次佳模型的 1.5 倍;OSWorld 2.0(computer use)以約三分之一成本超越 Fable 5 的最佳結果。生命科學這條線也全面提升,有機化學(從光譜推分子結構)內部 benchmark 比 4.8 多 10.2 個百分點;GDPval-AA(知識工作)拿下新 SOTA。這幾個數字是這一代升級幅度最直接的證據。
但跟 Fable 5 比,畫面就轉了。Anthropic 在 System Card 裡白紙黑字寫著 Opus 5 整體並未超過 Fable 5;CursorBench 3.2(max effort)上 Opus 5 在 Fable 5 巔峰分數的 0.5% 以內,但單任務成本減半。意思是分數追得上、成本省得多,但「整體最強」這個頭銜還在 Fable 5 手上。
Cyber 是另一個不能不提的面向。Opus 5 的資安能力優於 Opus 4.8(辨識軟體漏洞能力提升),但仍落後 Mythos 5。具體一點:防禦型的原始碼漏洞發現變強,進攻型的編譯二進位檔漏洞發現仍然不行。所以需要做進攻型資安研究的場景,要拿 Fable 5 或 Mythos 5;做防禦方工作,Opus 5 比 4.8 更好用。
合作夥伴的見證也值得記一筆,但要知道這些是發表會挑過的,聽方向就好。Devin(Cognition)說 Opus 5 在 FrontierCode 1.1 上接近 Fable 水準、半價,對困難 debug 與 root-cause 分析特別強;Cursor 說 Opus 5 以 Opus 的速度與成本提供接近 Fable 5 的智慧,CursorBench 上略低於 Fable 5、行為相近。兩家都把「半價接近 Fable」這個賣點講出來,與官方定調一致。
數字讀起來分兩層:對前代 4.8 是全面勝出、沒有回退,對 Fable 5 則是分數逼近、整體仍落後、成本省一半。三個方向同時存在,不互相打架。講「Opus 5 已經等於 Fable 5」是過度陳述,比較準的講法是「在多數實際工作量下,Opus 5 用一半的錢拿到接近 Fable 5 的結果」。
Claude Opus 5 vs Fable 5:規格、價格、能力與適用場景比較
「Opus 5 是不是已經等於 Fable 5」是這一代最常被問的問題。答案不是非黑即白:Opus 5 在多數 coding 與知識工作評測追得上 Fable 5、成本只要一半,但「整體最強」這個位置,System Card 明說還在 Fable 5 手上。把兩顆模型放在同一張表比較,比單看分數更容易判斷自己該站哪一邊。
| 比較維度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 梯隊等級 | Opus 梯隊最強 | Mythos-class,Anthropic 一般可用模型裡整體最強 |
| 標準 API 價 | $5 / $25 | $10 / $50(正好兩倍) |
| Frontier-Bench v0.1 | 官方自測超越所有模型,單任務成本更低 | 在此評測被 Opus 5 超越 |
| CursorBench 3.2(max effort) | 在 Fable 5 巔峰分數 0.5% 內,單任務成本減半 | 巔峰分數仍領先 |
| 整體能力 | System Card 明說未超過 Fable 5 | 整體最強 |
| Cyber 能力 | 防禦型漏洞發現提升,進攻型仍落後 Mythos 5 | 進攻型資安研究首選 |
| 出口與合規 | ASL-3,未受美國出口管制限制 | Mythos-class,曾因出口管制暫停 |
| 最適合 | agentic coding、企業高難度工作、要壓成本的量大場景 | 關鍵判斷、進攻型資安、可接受兩倍成本換巔峰 |
做 Claude Opus 5 比較時,把這張表看完會比單看 benchmark 分數更容易下結論:兩顆模型的差距集中在「整體最強」與「進攻型資安」這兩類,不在多數日常開發與知識工作。如果你的任務不屬於那兩類,Opus 5 用一半的錢拿到接近的結果;如果屬於,就直接升 Fable 5,不必在兩倍價差上猶豫。
Claude Opus 5 寫程式:為什麼 agentic coding 是它的主場
官方給 Opus 5 的定位寫得很明白:複雜 agentic coding 與企業工作。這不是公關話術,評測數字也指向同一個方向。Frontier-Bench v0.1 上,Opus 5 以更低單任務成本達到 Opus 4.8 兩倍以上的表現,並超越所有參與評測的模型;CursorBench 3.2 在 max effort 下,Opus 5 落在 Fable 5 巔峰分數的 0.5% 內,但成本只要一半。把這兩個數字放在一起看,Opus 5 在 coding 任務的性價比是這一代最突出的。
實際把 Opus 5 接進開發流程的人怎麼說,也值得參考,但這些是發表會挑過的合作夥伴見證,聽方向就好。Cognition 的 Devin 在 FrontierCode 1.1 上看到 Opus 5 接近 Fable 水準、半價,對困難 debug 與 root-cause 分析特別強;Cursor 則說 Opus 5 用 Opus 的速度與成本提供接近 Fable 5 的智慧。兩家都把半價接近 Fable 這個賣點講出來,與官方定調一致。
在自己的工作流裡,Opus 5 最適合的場景是大型 repo 重構、跨檔案修改、複雜除錯,以及需要連續多步推理的 agentic 任務。effort 是關鍵控制桿:日常開發用 high,遇到最難的除錯或架構判斷再推到 xhigh 或 max;Opus 5 把額外 effort 轉成更好結果的可靠性是歷代 Opus 之最,所以拉高 effort 比在 4.8 上更有機會換回實質改善。透過 Claude Code 或 API 把 Opus 5 接進現有 repo,讓它讀完整專案 context 再動手,是發揮它 coding 主場優勢的基本配置。
規格表之外:開發者用 Opus 5 做出的驚人成品
規格表與官方 benchmark 之外,Opus 5 上線後實際跑過它的開發者,陸續在 X 上公開了讓社群驚呼的實做成品。這些 demo 比分數更能說明 Opus 5 的真實能力邊界,也點出它目前最強勢的應用場景。底下挑三則流量最高、具代表性的實做,把官方評測沒展現的那一面補上。
第一則來自知名 AI 開發者、HyperWrite 共同創辦人 Matt Shumer。他在 Opus 5 發表隔天用一個 prompt 生成出完整的 3D 第一人稱射擊遊戲 Claude of Duty,畫面上看到的全是模型自己寫的程式碼,沒有用到任何外部素材,連美術與關卡都是模型一手產出。這則 demo 在短時間內累積超過 140 萬次觀看,是 Opus 5 發表週最具代表性的實做:
Claude Opus 5 one-shotted this game.
— Matt Shumer (@mattshumer_) July 25, 2026
EVERYTHING you see in this demo is custom code… not a single external asset was used.
AI games are going to be amazing.
(sound on) pic.twitter.com/zc7C61kgv1
同一類 3D 任務,也有開發者拿 Opus 5 與前一代旗艦 Fable 5 Max 下相同指令做並排對比。結果兩邊特性很清楚:Opus 5 在材質與細節上被評為極為驚人,Fable 5 Max 則勝在一次就成功生成。這種換模型、同 prompt 的對比,是看一代模型個性與進步幅度最直觀的方式,也比單看分數更能感受差異:
i tried Opus 5.0 vs Fable 5 Max.
— sui ☄️ (@birdabo) July 23, 2026
Claude Opus 5.0 is quite the AGI beast in 3D, the texture and details are absolutely insane.
Fable one shotted this though, could be improved.
credit to @chetaslua for the Opus 5 code. pic.twitter.com/ZAKAjjapuX
更出乎意料的是效率。開發者 am.will 實測 Opus 5 建出一個可玩的 Rocket League 仿作版,過程中消耗的 token 只有他預期的 27%,模型不只做得出來,還用更少資源做到。不過他也誠實提醒,這類一次成型的複雜 demo 雖然驚人,實際要搬進產品線時,程式碼品質與邊界條件仍要自己把關:
WOW! I thought Opus 5 would just be a cheaper Fable. I was dead wrong.
— am.will (@LLMJunky) July 24, 2026
This model is absolutely BONKERS. I'm genuinely blown away.
Opus 5 built the best Rocket League clone i've ever seen, and it did it while consuming only 27% of my 5x Max sub.
Sound on. There's layers to… pic.twitter.com/5ZzqpluF9K
把這幾個實做疊起來看,Opus 5 在「一次生成複雜可互動成品」這個面向,確實拉開了與前代的距離,尤其是 3D 遊戲、即時模擬這類過去要反覆多輪才有結果的任務。但驚人 demo 不等於可直接上線的產品,一次生成的程式碼仍需審查、token 消耗要自行監控,這也呼應前面提醒過的 effort 要與任務匹配。規格表告訴你 Opus 5 多了哪些能力,這些開發者的實做則告訴你那些能力在真實專案裡能走多遠。
對一般使用者到底意味什麼:agentic、thinking 預設開、effort 梯隊
agentic 這個詞被各家廠商用得很浮濫,講到後來常常只剩「會自己做事」這種沒資訊量的口號。對一般使用者,agentic 的具體意思是:模型能接工具、能連續做好幾步、會在中間自己判斷要不要再查一次。
換到工作場景,這幾件事的實際效果是交辦的顆粒度變大。以前你要把一件工作拆成「查 A、查 B、把 A 跟 B 比較、寫結論」幾個 prompt 分別餵,現在你給 Opus 5 一個目標,讓它自己排流程。它發現缺了訓練截止後的資訊,會自己用瀏覽器或 API 去查,而不是硬猜。它也能在多檔、多步驟的環境裡維持狀態,Claude Code 跑一個 repo 的重構、claude.ai 跑一個研究任務,背後都是這個能力。
落到三種工作會比較具體。做內容研究的人,把十家競品的定位、定價、近期新聞整理成交付給客戶的產業報告,從前要花三天手動爬資料,現在把十家清單與分析框架交代給 Opus 5,它自己排詢問順序、分批爬資料、整理成結構化輸出,再交一份草稿加來源清單給你。你的工作從「執行」挪到「設定目標、驗收、補框架」,驗收標準可以訂成:每條結論都要能對回某條可點擊來源。
寫程式的人不必憑空想像,Claude Code 裡直接看得到。丟一個五人團隊維護兩年、約五十個檔案的舊模組給它重構,把目標與限制設好,它讀完整個模組、規劃改動、分批修、跑測試、自我修正,開一個分支跟 PR 等你審。你審的是 PR,不是逐行改碼,驗收門檻就是那個 PR 得過你既有的測試套件。要把這條工作流程與其他 coding agent 比節奏,可以參考另一篇 Codex 與 Claude Code 的節奏差異。
行銷的量大任務也合用。電商檔期要為二十檔 SKU 各發一篇社群貼文、每篇對應不同受眾與平台,把產品資訊、受眾清單、平台規範一次給齊,它自己生成、自己按平台特性調整、產出帶配圖建議的成品,驗收時按受眾清單逐篇核對即可。
三種工作表面不同,底層是同一個位移:你交辦的單位從「一句話」放大成「一個任務」,重心從「產出」挪到「設計任務與驗收」。thinking 預設開、effort 梯隊這兩個設計,就是支撐這個位移的引擎:模型自己在每次任務裡決定要想多久,你再透過 effort 微調深度。

agentic 也有它做不到的事。它不會替你判斷「這個任務該不該做」,不會替你做倫理與合規決定,不會處理需要人際信任與判斷的溝通。策略、判斷、關係這幾件事它接不了,留給人類自己;能交給它的,是重複、可驗收、有明確定義的執行。
什麼情況選 Opus 5、什麼情況升 Fable 5、什麼情況退 Sonnet 5
問題不是哪顆最強,是你要它做哪一種活。Opus 5 是企業與高難度開發的合理預設,但不是所有人的最佳解。把任務類型、模型、effort 擺在同一張表看,判斷會快很多。

| 任務類型 | 推薦模型 | effort 建議 | 理由 |
|---|---|---|---|
| 客服分類、標籤、摘要 | Haiku 4.5 | 不適用 | 量大、規則明確,貴模型做浪費 |
| 翻譯、改寫、潤稿 | Haiku 4.5 或 Sonnet 5 low | low | 機械化任務,effort 高低差距小 |
| 日常寫作、email、報告 | Sonnet 5 | medium 到 high | 平衡品質與成本 |
| 中型程式開發、debug | Sonnet 5 | high | 多數開發主場景 |
| 大型 repo 重構、複雜除錯 | Opus 5 | high 到 max | Opus 梯隊主場景 |
| 高風險決策支援、複雜推理 | Opus 5 | xhigh 到 max | 判斷正確性優先 |
| 多步驟 agentic workflow(企業) | Opus 5 | high 到 xhigh | 連續推理 + 可靠性 |
| 進攻型資安研究、最先進判斷 | Fable 5 | high 以上 | Opus 5 cyber 仍落後 Mythos 5 |
選 Opus 5:最難的 agentic coding(大型 repo 重構、複雜除錯)、需要最高判斷正確性的企業決策支援、多步驟 agentic workflow、需要長 context 與大量工具協作的企業工作。如果你本來用 Opus 4.8,Opus 5 是直接升級,紙面成本不變、能力全面提升。
升 Fable 5:需要「整體最強」判斷的關鍵任務、進攻型資安研究、可以接受兩倍成本換取巔峰分數的場景。Fable 5 與 Opus 5 的價差是整整兩倍,要花這個錢之前先問自己這個任務的產出值不值那兩倍。判斷其實很實際:任務出錯會掉錢(退單、合規罰款、客戶流失)、會觸法、或會對外發出造成不可逆影響,就直接升 Fable 5,不必去算那兩倍。
退 Sonnet 5:日常寫作、中型程式開發、長文件處理、量大的 agentic workflow。Sonnet 5 的 $3/$15 是 Opus 5 的 0.6 倍,多數工作用它就夠。把 Sonnet 5 放在量大工作層、Opus 5 放在關鍵判斷層,是常見的兩層配置。例如客服系統,第一層用 Sonnet 5(甚至 Haiku 4.5)做意圖分類與常見問題回覆,分不出來或高風險的再交給 Opus 5 處理,成本與品質都最佳化。
梯隊之間不是越強越好。最強的模型做簡單事就是浪費錢和延遲。把任務分類、對應到對的模型,比一路用最強要省很多。這個判斷在企業部署裡尤其重要,因為量大,幾個百分點的模型選擇錯誤就放大成實質的成本差。
台灣怎麼用 Opus 5:四條取得路徑
取得 Opus 5 有四條主要路徑,難易度與成本結構各不相同。

claude.ai:多數人最快上手的入口。網頁、iOS、Android 都有,桌面端也有 Claude Desktop。Opus 5 是 Claude Max 的預設模型,也是 Claude Pro 上最強的可選模型。區域可用性方面,Opus 5 是 ASL-3、非 Mythos-class,沒有受到像 Fable 5 那樣的美國出口管制;不過 Opus 5 專屬的台灣可用性,目前沒有直接的第三方報導,與同系列模型相同,使用前建議再確認一次 Anthropic 官方支援區域,區域政策本來就會調整。要省事,訂 Max 就直接拿到 Opus 5;不想花到 Max 月費的,Pro 訂閱者手動切換也能用,但用量限制比較緊。
Claude Code:開發者的主力入口。命令列與 IDE 內整合,能直接操作檔案系統、跑終端機、改 repo,是 Opus 5 在 coding 場景的主要介面。要把 Claude Code 跑起來、搭配 Opus 5 的命令列與 IDE 整合細節,可以參考 Claude Code 的命令列與 IDE 整合。
Anthropic API:直接用 model ID claude-opus-5 呼叫,是唯一讓你完全控制 effort、context、caching 的路徑。量大、要做快取、要批次、要用 Fast mode、要 US-only inference 的場景,只能在這裡。門檻是技術能力,要會寫程式或用 Postman 之類的工具,但靈活度與成本控制遠高於訂閱制。
Opus 5 API 第一次呼叫(curl)
若要最快驗證 Opus 5 的中文回應,一支 curl 就夠。先把 ANTHROPIC_API_KEY 設成環境變數再執行:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"messages": [{"role":"user","content":"用繁體中文介紹 Opus 5 與 Opus 4.8 的差異"}]
}'
回應裡的 usage 欄位會把思考與回覆的 token 分開計;把相同 prompt 分別用 high 與 xhigh effort 各跑一次,就能親眼看到 effort 對 token 消耗與回覆深度的實際影響,比看規格表更具體。注意 max_tokens 是思考加回覆的合計上限,從 Opus 4.8 搬過來的腳本要記得拉高,否則思考把額度吃掉會讓回覆被截斷。
雲端夥伴:Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 三家都已 GA。Vertex AI 與 Foundry 用 claude-opus-5(與 API ID 一致),Amazon Bedrock 的模型 ID 命名規則與 API 不同,實際字串以 Bedrock 主控台顯示為準。一個額外好處:Bedrock 上 zero data retention (ZDR) by default,對合規敏感的企業是實質加分。已在這些雲端上跑工作流程的,透過自家雲端叫 Opus 5 不必另開 Anthropic 帳號,帳單、合規、IAM 全走雲端既有架構。
四條路徑怎麼選?個人使用者與內容工作者走 claude.ai 最簡單,開發者加訂 Claude Code,企業 API 用量大或需要嚴格成本控制走 Anthropic API 直連,已在雲端生態裡的企業走自家雲端夥伴。Fast mode 只在 Claude API 提供,要走 Fast mode 的人只能在 API 直連這條路上。
從 Opus 4.8 搬過來會踩哪些雷
Opus 4.8 沒有被強迫退役,沒有發布 dead line 強制遷移時程。所以「要不要升級」是你自己評估,不是急著動手。
但遷移要小心三個層面。

第一個是 thinking 預設開這件事造成的 max_tokens 重算。4.8 預設不開 thinking,你設多少 max_tokens 就是回覆上限;Opus 5 預設開 thinking,max_tokens 變成「思考 + 回覆」的合計硬上限。從 4.8 搬過來的 workload,如果本來 max_tokens 設得剛剛好,搬到 Opus 5 後可能因為模型把一部分預算花在思考上、導致回覆被截斷。升級前把 max_tokens 全部重看一遍,這是最常見的雷。
第二個是前面提過的 breaking change:同時關閉 thinking 又用 xhigh 或 max effort 的請求會回 400。API 仍保留關閉 thinking 的選項,但配合的 effort 上限是 high。看個 before/after。
4.8 時代這樣寫還能跑:
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"thinking": {"type": "disabled"},
"effort": "max",
"messages": [{"role": "user", "content": "..."}]
}
搬到 Opus 5,要嘛把 thinking 拿掉(接受預設開),要嘛把 effort 降到 high 以內,否則回 400:
{
"model": "claude-opus-5",
"max_tokens": 8192,
"effort": "max",
"messages": [{"role": "user", "content": "..."}]
}
注意 max_tokens 從 4096 拉到 8192,是因為 thinking 預設會吃一部分預算,不拉高就可能截斷。
第三個是行為校準。effort 權重在 Opus 5 提高,同樣的 high 在 4.8 與 5 上表現出來的「想多久」可能不同;本來寫給 4.8 的 prompt 不需要全部重寫,但建議先在非生產環境跑兩週 A/B,把輸出與成本和 4.8 並排比較,再決定要不要全面切換。Prompt caching 最低值降到 512 tokens 是好消息,本來因為 system prompt 太短不能開 cache 的場景,現在可以開始用了,這個要在搬遷時一起設定,否則等於把可省的錢放著不撿。
prompt 本身的寫法也建議跟著調整。Opus 5 的 thinking 預設開、effort 權重高,對「目標導向」的 prompt 反應比「步驟導向」更好。4.8 時代常見的寫法「先做 A、再做 B、再做 C」這種過度具體的步驟指令,到了 Opus 5 反而可能綁住模型的思考;改成「給我 X 結果,考慮 Y 限制,輸出格式是 Z」這種目標與限制描述,產出通常更接近你要的。這個調整方向與 Anthropic 近幾代的 API 設計哲學一致:模型自己決定怎麼想,你用自然語言描述目標,不要用抽樣參數或步驟指令微調。
新功能裡最該注意的三個:tool changes、default fallbacks、cache 最小值
這次的新功能寫在 Opus 5 what’s-new 文件 裡,多數是給開發者用的 API 層改進,一般訂閱用戶感覺不到,但對企業部署很重要。

Mid-conversation tool changes(beta):對話中途可增刪工具,而且保留 prompt cache。以前要嘛一開始就把工具清單固定下來,要嘛改一次就重送整段、cache 失效;現在可以視任務進展動態加工具,cache 還能繼續用。這個對長程 agentic workflow 的成本控制是實質改善。beta header 是 mid-conversation-tool-changes-2026-07-01。
Default fallbacks mode(beta):fallbacks 參數新增 "default" 模式,依拒絕分類套用 Anthropic 建議的 fallback 模型,開發者不必自己維護 fallback 模型清單。整個 fallbacks 參數為 beta、opt-in,不是自動行為。要特別知道的是,Opus 5 在高風險領域可能 fallback 到 Opus 4.8,會通知使用者;這是 System Card 明講的設計。beta header 是 server-side-fallback-2026-07-01。
Lower prompt cache minimum:最低可快取 prompt 長度從 1,024 tokens 降到 512 tokens。這個改動看起來小,實務上很有感,因為不少應用的 system prompt 剛好落在 500 到 1,000 tokens 這個尷尬帶,本來開 cache 沒效果、現在可以開始用了。
這三個都是 opt-in 的 beta 或設定,預設不開,遷移時要自己選起來。
常見迷思
最常見的,是把 Opus 5 當成 Fable 5 的等價品。System Card 白紙黑字寫著 Opus 5 整體未超過 Fable 5,CursorBench 上也是略低於 Fable 5。把推薦文寫成「Opus 5 已超越 Fable 5」是過度陳述,任何這樣講的評測或評論都該打折。比較準的講法是「同成本下最強」「半價接近 Fable 5」。
另一個誤解,是把「thinking 預設開」當成「每次都要付思考成本」。預設開不代表每次都會想很久,模型自己會判斷任務需不需要想、想多久;簡單任務的思考成本可能接近零,複雜任務才會把思考預算吃滿。要把思考關掉也可以,但受 effort 上限限制(關閉 thinking 時 effort 最高到 high)。
effort 越高越好,同樣不是鐵律。high 是預設,多數任務合理;量大或對延遲敏感的任務就該往下調。同一個 prompt 每天跑破千次,或延遲預算壓在兩秒內,往下調到 medium 甚至 low,多數情況輸出品質只掉一點點,成本卻可能差好幾倍。effort 調的是花多少,不是做多好。
「Opus 5 很安全,所以能做進攻型資安工作」這句只對一半。Opus 5 整體 alignment 風險評估為 very low,prompt injection 抵抗力是歷代 Opus 提升最多的;它也允許所有存取層級的原始碼漏洞發現,做防禦方工作比 4.8 更好用。但進攻型、編譯二進位檔的漏洞發現仍然不行,整體 cyber 能力仍落後 Mythos 5。做防禦方工作它很好,做需要進攻能力的資安研究,要拿 Fable 5。
1M context 也是常被高估的數字。技術上可以把整個知識庫塞進去,實務上 context 越長、recall 越差,這是所有 LLM 共通的現象。1M context 的正確用法是放完整長文件、整個 repo、整場會議逐字稿這類結構清楚的內容,不是把雜亂無章的資料全塞進去期待它找得到。
使用限制與審核邊界
幻覺與諂媚(sycophancy)的具體數字官方沒有公布,你要的是「方向」這個訊號,不是某個精確百分比。Over-refusal 在良性請求上是近期模型最低之一,這對實際使用體驗是好消息,因為前幾代 Claude 為人詬病的就是過度拒絕。多輪回應可能較冗長詳細,這對需要簡短輸出的場景要注意。
Opus 5 沿用與 Opus 4.8 相同的 ASL-3 防護。化生風險評為 CB-1(非新型武器合成),不是 CB-2,與 Mythos 5 的 CB 風險相當;未跨越 RSP 的 automated AI R&D 門檻,AI R&D 能力與 Mythos 5 相當但未接近替代研究員;沒有新令人擔憂的 covert capabilities。這些是 System Card 公開的評估,不是負評,但企業部署要把 ASL-3 這個標籤放進合規討論。
對合規敏感的產業還有一個設計要曉得:Opus 5 在高風險領域可能 fallback 到 Opus 4.8,會通知使用者。這個 fallback 不是隱藏行為,是寫進 System Card 的明文機制,開發者也可以透過 API 的 fallbacks 參數自己設定。對金融、醫療、政府合約這類需要可預測行為的場景,這個機制要在 SLA 與使用者告知裡寫清楚:你的請求有時會跑到 4.8,行為可能與 5 略有差異,審計要能區分兩者。防禦型資安工作則有一個實質利好:Opus 5 允許所有存取層級的原始碼漏洞發現,但仍阻擋編譯二進位檔的漏洞發現(後者較常用於進攻)。
Opus 5 的同期競爭對手還有 OpenAI 的 GPT-5.6 與 xAI 的 Grok 4.5,各自在 coding、agentic、知識工作有不同的強項與定價結構,橫向比較留給那兩篇。選哪一個,看你的主要任務類型、生態綁定(IDE、雲端、API SDK)、合規需求,沒有絕對贏家,建議實際拿你的真實任務跑 A/B,比看評測分數準。
實際使用上要設計人類審核環節的幾個情境。對外發送的內容(email、公關稿、社群貼文、客服回覆)一定要人看過再送,因為 LLM 偶爾會自信地寫出錯誤事實或語氣不合的句子,這不是 Opus 5 獨有,但它的 agentic 能力讓它「自己跑完」的範圍變大,等於把這個風險面也放大了。涉及金額、日期、合約條款、法規解讀的輸出,必須雙重核對原始資料,不要相信它「記得」。需要原地修改外部系統的 agentic 動作(寫資料庫、改檔案、發 API 請求),最好先在沙盒或 staging 環境跑,確認行為符合預期再開放正式環境。

哪種任務絕對不要完全交給它?涉及人際判斷的(例如錄用決定、績效評估、客戶關係處理)、需要創始人直覺的(例如產品方向、品牌定位)、需要承擔法律責任的(例如醫療診斷、法律建議、投資建議)。這些領域它可以做草稿、做資料整理、做假設情境分析,但最終判斷與責任在人類身上。
下一步:三種讀者怎麼動手
如果你是 Claude Max 訂閱用戶,什麼都不用做,Opus 5 已經是預設模型。要做的是認識 thinking 預設開與 effort 梯隊,給任務時調整 prompt 習慣,少寫死步驟,多描述目標與限制。第一次試可以用一段你常做的工作,分別用 high 與 xhigh 各跑一次,看輸出差異與用量差異,建立自己的 effort 直覺。如果你是 Pro 訂閱用戶,要到設定裡手動切換才能用 Opus 5,用量上限比 Max 緊,建議把最難的任務留給它,日常用 Sonnet 5 即可。
如果你是開發者,本來用 Opus 4.8 寫 API 或跑 Claude Code,先在非生產環境試跑,把 max_tokens 重看一遍(因為 thinking 預設吃預算)、確認沒有「關閉 thinking 又用 xhigh/max effort」這種會回 400 的組合、把 Prompt caching 設起來(最低 512 tokens 現在更實用)。確認沒問題再切換 production。Opus 4.8 沒有強制退役,你不急的話可以分階段搬,先搬低風險 workflow,觀察兩週再擴大。
如果你是企業在評估大規模部署,走雲端夥伴(Bedrock、Vertex AI、Foundry)比較省事,帳單合規都走既有架構。Bedrock 的 ZDR by default 對合規敏感的產業是實質加分。要做的事是重新校準 TCO,把 effort 提高帶來的多算幾輪、Prompt caching 命中率、Fast mode 是否需要、US-only inference 1.1 倍加價全算進去,再跟 Sonnet 5、Haiku 4.5 的混合配置比一遍(粗估:月呼叫 5,000 萬 tokens、cache 命中七成,用上面的單價套一遍,就是企業要編進預算的那個數字)。光看單價會選錯。同時要設計人類審核環節,因為 Opus 5 在高風險領域會 fallback 到 4.8,這個 fallback 路徑要在 SLA 與使用者告知裡寫清楚。
不管走哪條路,都別只看規格表就下判斷,拿你的真實任務實跑一週,讓數字自己說話。規格表告訴你上限,實跑告訴你均值,兩者差距就是你決策的空間。切換以後第一個月也要加強監控實際成本,effort 權重提高與 thinking 預設開會在你意料之外的地方偷跑出來,最常見的浪費點是高 effort 跑了大量其實只需要 medium 的任務,這個落差只有實際看用量資料才看得出來,靠感覺抓不準。
常見問題
Claude Opus 5 規格是什麼?
API model ID 是 claude-opus-5,1M context window、128k 最大輸出、thinking 預設開啟、effort 梯隊 low 到 max(預設 high),支援文字、圖片、檔案輸入與 tool use。標準 API 價 $5/$25(每百萬 tokens),與 Opus 4.8 同價、是 Fable 5 的半價;梯隊定位是 Opus 梯隊最強,低於 Fable 5、高於 Sonnet 5 與 Haiku 4.5。本文前面有完整的規格對照表與各項說明。
Claude Opus 5 跟 Claude Opus 4.8 差在哪?
規格升級,API 標準價不變,都是 $5/$25。Context 1M、最大輸出 128k 與 4.8 相同,但 thinking 預設開啟(4.8 預設關)、effort 權重提高(Opus 5 是歷代 Opus 中把額外 effort 轉成更好結果最可靠的一代),並新增 mid-conversation tool changes、default fallbacks、cache 最小值降到 512 tokens、Fast mode 等功能。效能上對 4.8 是全面勝出,Frontier-Bench v0.1 達到 4.8 兩倍以上表現、ARC-AGI 3 是次佳模型三倍。遷移要注意 thinking 預設開會吃 max_tokens 預算,以及關閉 thinking 又用 xhigh/max effort 會回 400。
Claude Opus 5 真的比 Fable 5 強嗎?
不。Anthropic 在 System Card 裡明說 Opus 5 整體能力並未超過 Fable 5。CursorBench 3.2 上 Opus 5 在 Fable 5 巔峰分數的 0.5% 內,但單任務成本減半;進攻型 cyber 能力仍落後 Mythos 5。正確說法是「Opus 梯隊最強」「同成本下最強」「半價接近 Fable 5 智慧」,不是「整體最強」。
Claude Opus 5 一個月要花多少錢?
訂閱制與計量制結構不同。claude.ai Free 方案不提供 Opus 5;Pro 是固定月費、可手動選用 Opus 5 但用量較緊;Max 是固定月費、Opus 5 是預設模型。API 計量制是 $5/$25(每百萬 tokens),實際花費取決於 token 用量。例如每天 1,000 次呼叫、每次約 8,000 tokens 輸入與 2,000 tokens 輸出,一天約 $90,一個月(22 個工作天)約 $1,980。把 Prompt caching(cache min 512 tokens)與 Batch API 設起來可以把這數字再壓一大塊。Fast mode 是 $10/$50,2 倍價格換 2.5 倍速度,且僅 Claude API 提供。
Claude Opus 5 台灣能用嗎?
Opus 5 是 ASL-3、非 Mythos-class,沒有受到像 Fable 5 那樣的美國出口管制。Opus 5 專屬的台灣可用性目前沒有直接的第三方報導,與同系列模型相同,使用前建議再確認一次 Anthropic 官方支援區域,區域政策會調整。要完全控制 API,可直接用 model ID claude-opus-5 呼叫 Anthropic API,或透過 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry(三個都已 GA)。在企業雲端上跑工作流程的,走自家雲端叫 Opus 5 不必另開 Anthropic 帳號。
Claude Opus 5 適合寫程式嗎?
適合,而且是它的主力場景,官方定位就是「complex agentic coding and enterprise work」。Frontier-Bench v0.1 達到 Opus 4.8 兩倍以上表現、CursorBench 3.2 在 Fable 5 巔峰的 0.5% 內但成本減半、ARC-AGI 3 是次佳模型三倍。Claude Code 把它設成 Max 訂閱的預設模型,Devin 與 Cursor 都把它列為主力選項。一般中型開發 Sonnet 5 也夠,但最難的大型 repo 重構與複雜除錯,Opus 5 是 Opus 梯隊裡最合理的選擇。
Claude Opus 5 何時會被取代?
官方沒有公布下一代發表時程。Opus 4.x 這條線在六個月內換了四代(4.5 到 4.8),4.8 才上線兩個月就被 Opus 5 接替,但這不是固定週期,不能直接外推。Opus 5 是否沿用類似的支援週期,官方還沒說;要追最新時程,以 Anthropic 官方公告與 Models overview 為準。對企業部署來說,假設主力模型一年內可能被接替、API 支援至少再維持一年以上,是比較穩的規劃假設。
