GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

Gemini 3.8 Flash 是什麼?功能、價格與怎麼用一次看懂

Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日發布的 AI 模型,官方給它的定位是「最聰明的工作馬」。它擅長三類工作:拉得長的軟體工程、自己跑完整串步驟的代理任務、多步推理。它的 API 免費層從發布當天就開放,寫程式的人今天就能在 Google AI Stu…

Gemini 3.8 Flash 功能與價格指南,包含程式工作、代理流程與成本評估

Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日發布的 AI 模型,官方給它的定位是「最聰明的工作馬」。它擅長三類工作:拉得長的軟體工程、自己跑完整串步驟的代理任務、多步推理。它的 API 免費層從發布當天就開放,寫程式的人今天就能在 Google AI Studio 試用。

你要判斷的是三件事:功能接不接得上你的工作、一個月要花多少錢、第一步怎麼踏出去。三件事都有具體答案。擅長的工作類型有第三方榜單可以對照,價格有級距可以自己算,起步的路現成,寫程式的人走 API 免費層,不寫程式的人走訂閱。

Google 在 2026 年 9 月 2 日於官方部落格的發布公告裡同場推出兩個變體:3.8 Flash,以及資安專用的 3.8 Flash Cyber。兩者共用同一個模型核心,公告把增益歸給含資安領域在內的嚴格訓練。這是六週內的第三個 Flash。Ars Technica 的觀察是,Google 自 2026 年初之後沒有再發布前沿等級的 Gemini Pro,力氣都壓在 Flash 這條線上。

重點先看

3.8 Flash 是 2026 年 9 月 2 日發布的推理與寫程式模型,官方定位「最聰明的工作馬」,六週內第三個 Flash。

強項是長鏈軟體工程、代理任務與多步推理。終端機與電腦操作是弱項,兩項都落後 Claude Opus 5 一大段。

API 端有免費層,Google AI Studio 今天就能用。AI Mode 端的模型選單要 AI Pro 或 Ultra 訂閱。

API 介紹價到 2026 年 12 月 31 日是每百萬輸入 0.75 美元、輸出 3.75 美元,2027 年 1 月 1 日起回到 1.50 與 7.50 美元。價目跟 3.7 同額、規格也幾乎相同,第三方實測每任務總成本卻約多四成,二十筆對照法可以自己測。

現在就能做的一件事:打開 Google AI Studio,選 gemini-3.8-flash,丟一件手上的真實工作給它,10 分鐘內看得出合不合。

它能幫你做什麼

官方對 3.8 Flash 的定位原文是 our most intelligent workhorse model,最聰明的工作馬。工作馬三個字直白:每天上工、耐操、成本可控。

長鏈講白了,就是一件工作從頭做到尾。讀懂需求,讀完相關程式碼,規劃,動手改,自己驗收,中間不用人接手。鏈拉得越長,出錯的機會越多,它就是為這種工作形狀設計的。

幾個官方頁面用不同的話講同一個模型。公告說它是最聰明的工作馬,API 定價頁說它為長鏈軟體工程、自主代理與複雜的企業工作流程而生,Vertex 的模型總覽說它為長鏈寫程式與自主代理而生。三句話指向同一件事:工作拉得長、步驟多、要自己撐完全場。

工作馬跟旗艦的差別在帳單。前沿模型顧最難的題目,賣最高的單價,工作馬顧每天的產能,賣 Flash 的價錢。3.8 的位置,是用工作馬的價格做到接近前沿的表現,官方總評的「往往接近」四個字就是在講這件事。

什麼時候感覺得到差別?短工作評不出它的價值。超過十步、中間要自己回頭檢查的工作,長鏈設計才派上用場。評它的時候挑長的工作,短工作評不出所以然,量少又單純的任務,市場另有更省的選擇。

讀懂需求、規劃步驟、執行工具與檢查結果的長鏈工作流程
長鏈任務會在規劃、執行與檢查之間反覆修正;驗收時仍需確認關鍵結果。

跨檔案重構:長鏈軟體工程長什麼樣

舉個情境。你接手一個專案,一個功能散在十幾個檔案裡,牽一髮動全身。模型要做的事是讀完所有相關檔案,找出確實要改的位置,改,改完檢查有沒有弄壞別的地方。這種工作一步錯,後面全部重來,人工的時間都花在這裡。改壞別的地方的風險,靠它自己跑檢查壓下來,你抽查的角度從每一行變成關鍵幾處。

模型端的規格對得上。輸入上限 1,048,576 個 token,輸出上限 65,536 個 token,兩個數字在現有模型裡都給得寬,長任務的空間夠,一次餵十幾個檔案靠的就是這個空間。輸入同時吃文字、圖片、影片、音訊與 PDF,輸出只有文字。

文件列了 URL context 與檔案搜尋,它可以自己讀網頁、自己翻你給的檔案,不必你先摘好再給。驗收方式很單純,讓它自己跑檢查、自己回報改了哪些檔案,你抽查關鍵的那幾個。

推理強度有三檔:low、medium、high。模型專頁寫得清楚,minimal 不支援,設了會直接回錯。難的工作調 high,它多想幾步再動手。這三檔同時是帳單的變因。

文字、圖片、影片、音訊與 PDF 匯入 Gemini 3.8 Flash,結果為文字輸出
支援多模態輸入不等於能生成影音;Gemini 3.8 Flash 的輸出類型是文字。

代理任務:讓它自己跑完一串步驟

代理任務的白話版本:你給目標,它自己拆步驟、挑工具、看回覆、決定下一步,跑完再自己檢查。公告把這一代的進步歸給 long-running agentic loops,長時間跑的代理迴圈,反覆評估跟修正自己。公告同一段寫明,兩個變體都被同一種迴圈加速,Cyber 拿同一套機制去做資安工作。

API 端它能用的工具包含函式呼叫、搜尋 grounding、程式碼執行、檔案搜尋與結構化輸出,電腦操作是預覽功能。實際的工作畫面:讓它讀網頁查規格,跑一段程式驗證想法,把結果整理成固定欄位的 JSON 交給你的系統,欄位名與型別先講好,系統端就不必再解析自然語言。每一輪它自己決定下一個工具,跑完自己檢查,這就是迴圈。

迴圈的價值在接力。查到的資料餵回下一輪的判斷,錯了在下一輪修正,人只看收尾那一步。風險也在接力,中途走偏,後面每一步都帶著偏。

成本要看好。迴圈每多跑一輪,輸入與輸出都再多一次,帳單跟著長,估算方法很直觀,一輪的 token 乘上輪數就是這件工作的成本。3.8 肯多跑幾輪把事情做完,這在品質上是優點,在成本上是變數。

多步推理:專業領域的難題

多步推理指的是答案沒辦法一步算出來的題目。要讀多份資料、交叉比對,每一步引用上一步的結論。工作上的形狀像這樣:把三家競品的定價頁讀完,標出每個數字的適用條件,整理成一張比較表。讀、比、接,三個動作串成一條鏈。

人工做這類工作的時間花在比對與標注,模型值錢的地方在把條件接對。

另一個形狀:讀一份長合約,挑出風險條款,逐條接回原文。這類工作的重點在它有沒有把每一條結論釘回原始文件,釘得回去才算過關。

公告用 HLE-Verified 當 3.8 的招牌測驗。範圍涵蓋 STEM、人文與專業領域,題目經兩階段人工驗證,留下來的都是公認不好答的。54.9% 的意思是,這批驗證過的難題裡它答對了一半多。

語言模型這幾年的推移脈絡,LLM 的入門介紹有整張模型地圖。

怎麼判斷你的工作屬於哪一類

四個問題問完,答案會自己浮出來。

  • 你的工作要連續很多步、中間自己檢查嗎?是的話,3.8 就是為這種工作設計的,直接試。試法很單純,丟一件你最近真的卡過的任務,看它第一輪的規劃像不像內行。
  • 你的工作量大、單純、講吞吐嗎?效率優先有另一套挑法,小型模型的效率取捨講過這個邏輯。大量而單純的分類、摘要、轉檔,用高階推理模型跑,錢花在用不上的地方。
  • 你的工作要模型下終端機指令、操作電腦嗎?這兩項是它的弱項,市場領先者是 Claude Opus 5。需要這兩項的工作,這一代先選領先者。
  • 你的工作要生成音訊、圖片、即時語音對話嗎?這條 Flash 線不做:音訊生成、圖片生成、Live API 都不支援。影音與全模態的需求,Google 另有 Omni 產品線。要開放權重、自己部署的寫程式模型,GLM 5.3 是另一個方向。這些屬於產品線分工,不算缺陷。

價格全貌:免費層、API 與台灣訂閱

價格分三層看:API 按 token 計費,消費端按月訂閱,企業端走合約。定價頁的數字以 2026 年 9 月 5 日查到的頁面為準,最近的更新標記是 9 月 4 日 UTC,價格沒有變動。訂閱頁的數字以 9 月 3 日查到的頁面為準。

兩個免費的差別

第一次接觸的人最容易把兩個免費搞混,一個在 API 端,一個在 AI Mode 端。API 的免費層是真的零元,輸入、輸出與快取在定價頁上都寫 Free of charge,AI Studio 登入就能用,模型就是 gemini-3.8-flash。代價寫在資料政策,你送的內容會被用來改進 Google 產品,付費層沒有這一條。

AI Mode 的免費是另一回事。免費使用者沒有模型選單,拿到的是預設模型,公告當天也沒有改變這件事。要指名用 3.8 Flash,起點是 AI Pro 訂閱,台灣每月 650 元。搜尋 grounding 也要留意,免費層用不了這個功能,付費層才有每月 5,000 次免費額度。

API 定價:介紹價與 2027 年的標準價

Gemini API 定價頁上的數字分兩段。到 2026 年 12 月 31 日,輸入每百萬 token 0.75 美元,輸出 3.75 美元,輸出計價含思考 token。這個細節常被漏掉,你付的不只看得到的文字,連它腦裡的推導一起付。2027 年 1 月 1 日起,回到 1.50 與 7.50 美元。

這個標準價正好是Gemini 3.6 Flash 的標準價,這條產品線的價格史在那一篇有整理。介紹價的錨點也在動。上一代的介紹價掛 3.6 標準價的一半,這一代掛的是與上一代同額。同樣的數字,兩代不同的故事,前一次是半價促銷,這一次是同價續掛。

不急的工作走 Batch 是半價,要速度走 Priority 貴八成。

計價模式到 2026 年 12 月 31 日2027 年 1 月 1 日起
標準輸入/輸出(每百萬 token)0.75/3.75 美元1.50/7.50 美元
Batch 批次輸入/輸出0.375/1.875 美元0.75/3.75 美元
Flex與 Batch 同額與 Batch 同額
快取 context caching(每百萬 token)0.075 美元0.15 美元
Priority 輸入/輸出1.35/6.75 美元2.70/13.50 美元

快取另有儲存費,每百萬 token 每小時 0.50 美元,2027 年起 1.00 美元,免費層的條件就是資料政策那一條。Flex 與 Batch 同額,走另一種非即時的執行模式。

加購的 grounding 另計。付費層的搜尋 grounding 每月有 5,000 次免費額度,Gemini 3 全系列共用,之後每 1,000 次 14 美元。Google Maps grounding 每月 5,000 個 prompt 免費,超過每 1,000 次 14 美元。兩個加購的額度都是 Gemini 3 全系列共用,多模型並用的人,同名加購的額度一起算。

速率限制的講法也改了。逐模型的 RPM 與 TPM 數字移進 AI Studio 的登入檢視,公開頁改成按消費分層,滾動 10 分鐘計算,Tier 1 是 10 美元,Tier 2 是 50 美元,Tier 3 是 200 美元。Priority 的預設速率是標準版的 0.3 倍。

API 成本分為輸入 token、包含思考的輸出 token,以及工具與儲存費
估算成本時,需分別套用輸入與輸出單價;思考 token、工具呼叫與快取儲存也可能影響帳單。

Batch 另有排隊 token 上限,Tier 1 是 300 萬,Tier 2 是 4 億,Tier 3 是 10 億。免費層的速率數字要登入 AI Studio 才查得到。

走 Google Cloud 的人看Vertex 的定價頁。同樣的介紹金額靠帳單 50% credit 回饋做到,非全球區域加 10%,輸入 0.825、輸出 4.125 美元,全球區 2027 年起回到 1.50 與 7.50 美元。Vertex 端的 3.8 Flash 是正式版,2026 年 9 月 2 日上線,區域有全球與美、歐多區域。同系列的 Flash 模型在 Provisioned Throughput 也有 50% 帳單 credit,期間自 2026 年 8 月 13 日起到 12 月 31 日。

一天與一個月大概多少錢

用介紹價算一組示意數字。假設你一天送 50 萬輸入 token、收回 15 萬輸出 token,0.5 乘 0.75 加 0.15 乘 3.75,一天約 0.94 美元,一個月約 28 美元。標準價生效後,同一個用量一天約 1.9 美元。輸出計價含思考 token,推理越用力,帳單越往輸出那邊傾斜。

同一組用量走 Batch 排隊跑,輸入單價 0.375、輸出 1.875,一天約 0.47 美元、一個月約 14 美元,代價是結果不會即時回來。不急的批次工作放 Batch,是最沒有副作用的一個省法。量大的團隊看另一組數字:一天 200 萬輸入、60 萬輸出,一天約 3.75 美元、一個月約 113 美元,介紹價下這個量級的帳單仍算輕。兩組數字都只算模型費,加購另計。

effort 檔位是另一個變因。Artificial Analysis 的發布頁摘述,low 檔每任務 0.24 美元,是同模型三檔裡最低的,三檔之間每任務價差最高 2.4 倍。省錢的第一個動作,把不需要用力的工作調到低檔。

台灣訂閱方案:五個價位

不寫程式的人碰 3.8 Flash 的位置在訂閱。台灣版的訂閱頁列了五個價位。

方案月費重點
免費0 元訂閱頁文案寫使用 3.6 Flash,AI Mode 沒有模型選單
Google AI Plus165 元免費方案的 2 倍用量,400 GB 儲存空間
Google AI Pro650 元免費方案的 4 倍用量,5 TB,YouTube Premium Lite
Google AI Ultra3,300 元用量上限是 AI Pro 的 5 倍
Google AI Ultra6,500 元用量上限是 AI Pro 的 20 倍

公告把 3.8 Flash 開放給 AI Pro 與 Ultra 訂閱者,範圍是 Gemini app、Google 搜尋的 AI Mode,以及 Sheets 裡的 Gemini。AI Plus 不在這份清單。幾個讀得到的小字:AI Pro 已在 150 多個國家與地區推出,免費方案的文案另標注 3.1 Pro 的存取權限可能變動。

Ultra 的兩檔差別只有倍率,5 倍與 20 倍,訂閱頁寫得直白,3,300 元那檔在頁面上標的就是最低價。要哪一檔,看你的用量是不是早就頂到 AI Pro 的上限。

台灣在支援 Google AI Pro 的國家清單裡,方案可月繳可年繳。Gemini 網頁應用程式在超過 230 個國家與地區推出,支援 40 多種語言,服務範圍頁的清單含台灣。行動應用程式另有語言與地區條件。

訂閱與 API 的帳本分開算,訂閱買入口與用量,API 買每一個 token。兩邊用量都大的人,拿自己的數字算一遍,才知道哪邊划算。

怎麼開始用:兩條起步路徑

依你寫不寫程式分兩條,兩條今天都走得通。兩條路的模型是同一個,差別在介面與計費方式。兩條路也不互斥,寫程式的人照樣會想在手機上用訂閱版,不寫程式的人哪天要接 API,遇到的是同一個模型。先走今天能走的那條。

開發者透過 AI Studio 與 API,一般使用者透過 AI Pro 或 Ultra 使用 Gemini 3.8 Flash
API 與消費端訂閱是兩條使用路徑,費用與額度分開計算。

寫程式的人:AI Studio 免費層,今天就能跑

操作順序三步。

  1. 打開 Google AI Studio,登入 Google 帳號。
  2. 開新的 prompt,模型選 gemini-3.8-flash。
  3. 貼上你手上的真實工作,執行。

跑完生回覆,試什麼最有鑑別度?每類各丟一題:一段你真的要改的程式,一份你要整理的資料,一個要查證再多步推理的問題。成功的標準很簡單,回覆你今天真的會用,或是它錯的地方你說得出為什麼錯。兩種都算收穫,第二種讓你看到邊界。

免費層的代價是資料政策,內容會被用於改進 Google 產品。介意的人把同一個模型接到付費的 API key,政策就不同。要接進自己的程式,模型代碼 gemini-3.8-flash 就是 API 的模型名,low、medium、high 三檔對應 API 的 thinking 設定。

Simon Willison 在發布當天的實測是個好例子。他用 API 跑了一句 prompt,make me a cool thing in html,13 秒生成一個網頁,花 1.8 美分。他對 Flash 線的既有評價是快、便宜、HTML 與 JavaScript 做得不錯。跑完覺得普通的話,先不要急著結案,挑一件更難的再試一次,長鏈模型的價值要難題才看得出來。

公告給開發者的入口還有 Antigravity、Android Studio 與 Stitch,企業端走 Gemini Enterprise。從免費層開始試,是目前最快的路。

Google 官方展示以 Gemini 3.8 Flash 在 AI Studio 建立的硬體拆解互動視覺化,示範程式生成成果。來源:Google 發布公告

不寫程式的人:Gemini app、AI Mode 與 Sheets

訂閱 AI Pro 或 Ultra 之後,3.8 Flash 出現在三個地方:Gemini app、搜尋的 AI Mode、Sheets 裡的 Gemini。AI Mode 是 Google 搜尋裡的對話模式,從搜尋的分頁進去,不用另裝 app,Sheets 的入口在試算表裡。三個入口共用同一個訂閱,不用分開買。值不值得為它訂 AI Pro,判斷跟 API 一樣看工作形狀,650 元買到的是三個入口的便利,模型本體就那一個。

AI Mode 端有一條明確的操作路徑,依據是公告與產品主管 Stein 的宣布,三家媒體的轉述字句一致。點「提出問題」列旁邊的「+」圖示,在 Gemini 3 models 區塊選 3.8 Flash,位置在 Auto 與 Pro 之間。

時間點記下來:3.8 是公告當天就進 AI Mode,上一個 Flash 版本是隔天。消費端功能跟得這麼快,在 Google 的模型發布裡還不算常態。

AI Mode 說明頁的繁中版把選單列譯成「提出問題」,把 Fast 譯成「快捷」,繁中介面用語以這頁為準。語言範圍官方只說 around the world,沒有指名,Search Engine Land 的報導指向首波英文。

免費使用者的 AI Mode 沒有模型選單,拿到的是預設模型。Search Engine Journal 的報導寫,公告當天沒有改變這件事。Stein 對免費開放的回覆經 Search Engine Roundtable 轉述,原句是 looking to bring these capabilities to more people as we can,會開放給更多人,沒有時間表。

AI Mode 本身的介紹與用法,站內有專文。繁中的部分,AI Mode 已經可以用繁體中文搜尋,I/O 2026 的整理記過語言與模型的時間軸,官方沒有給台灣特定的上台日。

選單裡的「Pro」是 Gemini 3 Pro

名字先分清楚。AI Mode 選單裡的「Pro」是 Gemini 3 Pro,支援頁寫它支援英文、有每日用量上限,限 18 歲以上的訂閱者使用,「快捷」是另一個模型,速度快、顧一般問題。API 定價頁上唯一的 Pro 條目叫 gemini-3.1-pro-preview,預覽版,每百萬 2 與 12 美元。Gemini 3 Pro 的文字模型在兩端定價頁都沒有條目,沒有可引用的 API 價。

Cyber 是第四個名字,公告與專頁都沒提它出現在任何消費者介面。四個名字對四種東西:系列名、一般模型、資安變體、選單裡的 Pro。Gemini 3.8 是系列名,3.8 Flash 是模型,兩個寫法在文件裡都出現,指的層級不同。對帳單與規格時先對名字,再對數字。

它有多強:六項測驗的誠實對照

官方的總評措辭值得原樣看,often approaching the performance of higher-cost frontier models,往往接近更高成本的前沿模型。接近,沒有說追平。

對照組的設定也影響讀法:Google 的評測預設拿 GPT-5.6 Terra 與 Claude Sonnet 5 當對照,思考強度開到最大,他牌分數用各廠自報數字。讀這類表的順序是先看測什麼,再看誰量的,第三才是差距大小。自報的意思是各家挑對自己有利的設定,第三方榜的價值就在繞過這一層。

六項測驗放在一起看,讀法比單看分數重要。三類強項各有對應的測驗可查:軟體工程看 DeepSWE,金融與法律代理看 Vals 的兩個榜,多步推理看 HLE-Verified。分數多為 9 月 3 日的快照,DeepSWE 與 Harvey 兩榜 9 月 5 日再查過一次。

閱讀模型榜單前確認任務類型、測試設定、資料來源與查榜日期
不同測驗的分數不能直接混比。先確認測試任務、設定、來源與日期,再判斷結果是否適用。
測驗測什麼3.8 Flash對照讀法
HLE-Verified多步推理,STEM、人文、專業領域54.9%Google 自算,1,811 題驗證集公告正文唯一的量化分數
DeepSWE v1.1軟體工程任務74%,誤差帶 1%Claude Opus 5 為 74%,誤差帶 4%誤差帶內同分
Vals Finance Agent v2金融代理任務61.4%,55 個模型排第 1第 2 名為 60.6%與第 2 名差不到 1 個百分點
Harvey 法律代理法律代理任務10.0%,第 9 名榜首 Meta 為 25.4%,Grok 4.6 為 15.8%贏 OpenAI 與 Anthropic 的對照組,輸 Meta 與 xAI
Terminal-bench 4.0終端機操作19.1%Claude Opus 5 為 51.8%落後 32.7 個百分點
OSWorld-2.0電腦操作59.0%Claude Opus 5 為 75.4%落後 16.4 個百分點

來源層級分三種。HLE 與公告出自 Google 自己,DeepSWE 與 Vals 兩個榜是第三方排行榜的快照,Terminal-bench 與 OSWorld 的他牌分數經繁中長文與媒體轉述,Google 內文只有圖表。

贏的項目:寫程式、金融、法律

Datacurve 的 DeepSWE 公榜上,3.8 Flash 用 high 檔思考跑出 74%,誤差帶 1%,9 月 5 日查的榜。同列的 Opus 5 也是 74%,誤差帶 4%。誤差帶內是同分,寫成打贏 Opus 5,就講得比榜上數字還多。

同為 74% 的還有 GPT-6 Astra,誤差帶 3%,在 9 月 5 日的榜上排在 3.8 前面。Ars Technica 的報導寫 3.8 站上 DeepSWE 榜首、成本更低,這句話現在引用要帶日期。跟 Opus 5 同分而價低一截,這才是 3.8 站得住的位置。

Meta 的事發生在同一天。Meta 自報 Muse Spark 1.3 在同一套 DeepSWE 跑出 75.4%,到 9 月 5 日仍未進公榜,榜上的 Muse Spark 停在 1.2 版的 55%,誤差帶 2%,鉅亨網轉載的報導把自報與公榜的分別寫了出來。前一個 Flash 版本在同榜是 65%。

金融代理在Vals 的 Finance Agent v2 榜:61.4%,55 個模型排第一,9 月 3 日的快照。第二名是 Meta 的 60.6%,Opus 5 是 58.6%,前一個 Flash 版本是 59.0%,卡在兩者之間。第一名與第二名差不到 1 個百分點,榜首位置隨榜單滾動,引用前看日期。

法律代理在Harvey 的法律代理榜:10.0%,9 月 3 日快照裡排第 9。榜首是 Meta 的 25.4%,9 月 5 日再查,第二名是 Muse Spark 1.1 的 20.0%,Grok 4.6 退到第三,15.8%。3.8 贏過榜上 OpenAI 與 Anthropic 的對照組:Opus 5 是 6.7%,Sonnet 5 是 5.0%,GPT-5.6 Sol 是 2.5%,前一個 Flash 版本的 8.75% 也在 3.8 後面。輸給 Meta 與 xAI 是事實,贏過兩家對照組也是事實,兩句都寫。

HLE-Verified 的 54.9% 有個前提。他牌在這個測驗的分數是 Google 自己算的,Sonnet 5 有一定比例的題目被內容政策過濾擋下。驗證集 1,811 題,由 668 題驗證題與 1,143 題修訂認證題組成,689 題不確定題被排除。分母會看,分數才有意義。

Google 自家的評測文件,註腳也該讀。文件自陳 DeepSWE 的數字引自 Datacurve 公榜,兩個 Vals 數字引自 Vals.AI,還留了一則勘誤:最初把 Opus 5 的分數寫成 74%,成因是榜單四捨五入。連官方都會抄錯榜,榜單要自己查,這句話不是客氣話。

另一條方向性的旁證。華爾街日報報導過 Google 內部工具的對比,工程師偏好 3.8 Flash 勝過 Anthropic 的 Opus。這條經 DataCamp 轉述才流傳,原始對比細節看不到,當方向參考,不當證據。

輸的項目:終端機與電腦操作

Terminal-bench 4.0:19.1% 對 Opus 5 的 51.8%。OSWorld-2.0:59.0% 對 75.4%。數字經兩個繁中來源一致轉述,OSWorld 的他牌分數還有來源細節,GPT-5.6 Terra 引自官方部落格,Opus 5 引自 Fable 5.1 的部落格,都是 Google 轉引。Ars Technica 的講法直接:電腦操作有進步,仍落後市場領先者一大段。

你的工作如果是讓模型下終端機指令、點選操作電腦,這一代先不要指望它。Opus 5 在這兩項的領先是榜單等級的,3.8 自己的電腦操作功能在 API 端還是預覽。價格放著對照看:Opus 5 每百萬輸入 5 美元、輸出 25 美元,3.8 介紹價是 0.75 與 3.75 美元,單價算下來 Opus 5 的輸入與輸出都是 3.8 的 6.7 倍左右。這個落差就是選擇本身,操作型工作付最高階的價,長鏈工程與推理工作用六分之一上下的錢。

跟 3.7 的差異與要不要換

3.7 Flash 是 2026 年 8 月 13 日發布的,兩代間隔三週。

兩代的關係,公告給了兩句話。公告寫 3.8 在軟體工程、代理任務與專業領域多步推理上,比 3.7 Flash 帶來顯著改進。Model Card 載明 3.8 蓋在前一代 Flash 的基礎上。

介紹價相同,0.75 與 3.75 美元,免費層兩代都有。輸入上限 1,048,576 個 token、輸出上限 65,536 個 token,跟前一代相同。規格表上兩代幾乎貼齊,差別藏在行為裡:同一個價格、同一個容量,跑起來花的 token 不同。

works harder 的帳:同價、不同用量

公告的關鍵段落原文是 3.8 Flash works harder,工作得更用力。複雜任務上它多跑推理步驟、反覆呼叫工具,有時為了把效能做好用更多 token,高 effort 檔位尤其如此。前一代當時的公告寫的是 thinks more diligently,思考更勤奮。works harder 這個說法是 3.8 才用的,effort levels 機制兩代都有。

第三方實測把這句話變成帳單。Artificial Analysis 的實測經 The Verge 的報導:每 token 單價不變,每任務總成本比 3.7 上升約 40%,主因是每任務輸出 token 增加 30%,代理類測驗的輪數也變多。同一篇的結論,這個智慧等級上它是測過最便宜的模型。

Artificial Analysis 對三檔還有一個講法。它的發布頁把 low、medium、high 三檔當成三個模型條目分開列,high 檔的智慧指數摘述是 59 分。同一個模型,三個價位、三個分數,看任何 3.8 的評測都要先問哪一檔。

這一代真正改變的環節不是分數,是計費行為。選型從比分數,變成比單位工作的總成本。帳單上兩個模型同價,單位工作的成本已經分開。

官方給的對策有兩條:把不需要用力的工作調到低 effort,或繼續用 3.7,公告寫它對效率優先的工作量維持完整支援。實務上可以再加一條,同一個帳號裡分流。難題開 high,例行工作開 low,一張帳單裡混合計價,品質與用量各自照顧。模型代碼同一個,差別只在每次呼叫的檔位。

low、medium、high 三種思考強度以不同複雜度的流程示意
流程節點僅示意思考投入,不代表固定步數。應以自己的任務品質與總成本選擇檔位。

二十筆對照法:用自己的工作測

不要用網路上的範例題做決定。從你上一季的真實工作裡挑二十筆,難的簡單的按平常比例放。兩個模型各跑一遍,同一組 prompt、同一檔 effort。每筆記三個欄位:結果能不能直接用、改了幾輪才可用、那次花多少 token。

測完看兩個數字。品質勝率,二十筆裡幾筆明顯比較好,差距集中在哪類任務,結論就只對那類成立。每筆平均成本,總帳單除以二十。品質贏兩成、成本貴四成,跟品質贏五成、成本貴一成,是不同的決定。

舉一個示意。二十筆跑完,3.8 在十二筆明顯較好,集中在重構與多檔修改,平均每筆貴三成,結論就寫成重構類搬 3.8、其餘照舊。數字是你的,適用範圍也由你畫。

幾個常見錯誤先避開。用網路上的範例題測,得到的結論只對範例題成立。只挑最難的二十筆,平均成本會高估,日常帳單不會長那樣。兩邊 effort 沒對齊,比出來的只是檔位差。

記錄用一張表就夠,欄位六個:任務編號、模型、檔位、品質評分一到五、修改輪數、當次成本。跑完二十筆,兩行彙總各模型的平均評分與平均成本。這張表跑一次的價值比讀十篇評測高,因為題目是你的。表建好之後,每一季重跑一次,結論就一直是新的。

門檻先訂再測,寫法例如:品質至少多兩成才算贏,成本差距在五成內都算可接受。事後憑印象挑,二十筆會替你本來就想選的那邊背書。

以同一組真實任務比較兩個模型的品質、修改輪數與總成本
以相同 prompt 與 effort 跑同一批二十筆真實工作,記錄品質、修改輪數與成本,再決定是否遷移。

什麼情況留在 3.7

效率優先的工作:高吞吐、單純、量大。定價頁對前一代的描述是高速、有效率,為日常寫程式與可靠的多次執行而生,價格與免費層跟 3.8 同額。官方建議這類工作量留在原地。

留下來沒有懲罰。兩代 API 並存,呼叫時差的不過是 model ID 與 thinking 參數,你的程式可以兩邊都養,二十筆對照法跑的就是這個結構。同一個價位帶,一個顧快,一個顧好。帳單一樣,差別在你的工作要哪一邊。

遷移本身輕。model ID 改成 gemini-3.8-flash,thinking_budget 的整數改用 thinking_level 的字串,改動集中在一次呼叫的兩個參數,程式其他部分不用動。

坑在參數:3.8 不接受 MINIMAL,設了直接回驗證錯誤,合法值是 LOW、MEDIUM 與 HIGH,Vertex 端的預設是 MEDIUM。temperature、top_k、top_p 這些舊取樣參數在 3.8 會被忽略,改用 thinking_level 控制決定性。頻率懲罰、存在懲罰與 candidate_count 傳了會報錯。

長鏈與代理的工作,3.8 的增益有感。量大與單純的工作,留在 3.7 省錢。

資安變體與 Fairwind:3.8 Flash Cyber

Fairwind 計畫是什麼、誰能申請

3.8 Flash Cyber 跟 3.8 Flash 同一個核心,訓練特別下了資安領域的功夫。它不走一般管道,走新的 Fairwind 計畫。公告寫優先開放給政府機關、關鍵基礎設施營運者與軟體維護者,Fairwind 專頁列的清單是政府、醫療與電信,全球已有超過 650 個夥伴。專頁給這個計畫的定位,是讓受信任的夥伴在用 AI 發動的資安威脅前面先跑一步。

規則寫得嚴。限防禦與研究用途,申請組織要過背景審查,存取權禁止分享或轉售。在 Gemini Enterprise Agent Platform 上以託管模型直接使用時,支援零資料保留,資安場景的資料通常不能外流,這個選項對應的就是那個約束。夥伴可以在 CodeMender 裡用它。

這套受限玩法有前例。3.5 Flash Cyber 那一代就走同樣的路,初期只限政府與可信夥伴有限試用,搭配 CodeMender。3.8 Flash Cyber 是同一個模式的第二代,差別在這次有了正式的計畫名字與專頁。

一般使用者碰不到。公告、專頁與媒體報導都沒有把它放進任何消費者介面,這是發布後的狀態。對一般公司而言,Cyber 的意義在市場訊號:Google 連兩代把資安工作拉成獨立變體與獨立計畫,資安在模型版圖裡的分量在上升。

一般 Flash 與需要 Fairwind 審查的 Flash Cyber 具有不同使用入口
Flash Cyber 透過 Fairwind 計畫向受信任組織提供防禦與研究用途,與一般 Flash 的使用入口不同。

Cyber 的成績單

公告給的數字,來源都是 Google 自家或客戶端。CyberGym 上它做到前沿等級的自主漏洞挖掘,超過 3.5 Flash Cyber 與更大的前沿模型。內部的 20 種程式語言基準,成功率超過 70%。Collinear 主辦的 CWE-Bench,pass@1 是 47.2%,對照一個領先前沿模型的 47.8%,成本低很多,pass@1 指一次嘗試就通過的比例。

Chrome Security 的測試裡,它產出的正確修補是最佳商業模型的 2.6 倍。Wiz 的內部滲透測試基準,召回率高 7.5 到 9.7 個百分點,成本低 2.3 到 5.2 倍。Google Cloud 的 VR 團隊用它不到 2 小時找到一個基礎級的重大漏洞,這種漏洞的研究與發現通常要數個月。

讀這些數字前要知道的四件事

榜會動。DeepSWE 的榜首位置發布隔天就有挑戰者出現,Meta 自報 75.4% 那筆就是現成的例子。Vals 兩榜與 Datacurve 的分數都帶查榜日期。任何榜單數字都要看日期,隔週再看一次是常態。

公告只給一個數字。3.8 的公告正文,量化分數只有 HLE-Verified 54.9%,其他測驗是定性敘述,分數放在圖裡,前一代當時的公告文字版給了五個數字。把細節推給會動的榜單,好處是數字永遠新,代價是任何轉述隔天就可能過期。第二個後果是轉述鏈:公告給一個數字,媒體再抄一個,讀者看到時離榜單已經兩層。查數字盡量回到榜或定價頁,只隔一層。

介紹價有期限。2026 年 12 月 31 日是分界,之後標準價加倍。拿介紹價做的成本評估,年底前重算一次,把試算裡的單價代換成標準價再跑一遍就是新評估。

支援頁會滯後。截至 2026 年 9 月 5 日,Google 官方 AI Mode 說明頁的模型說明仍只有「快捷」與 Pro(Gemini 3 Pro)兩級,未列出任何 Flash 型號。訂閱頁在 9 月 3 日查閱時,免費方案文案還寫 3.6 Flash,AI Mode 欄位也還掛著 Gemini 3 Pro。模型現況要看公告與定價頁,行銷頁不算數,這種滯後在每次模型發布都會出現,等幾天再查支援頁是常態。

常見問題

Gemini 3.8 Flash 免費用得到嗎?

API 端可以,AI Mode 端不行。AI Studio 的免費層有 3.8 Flash,輸入、輸出與快取都免費,Priority 欄位同樣寫 Free of charge,代價是內容會被用來改進 Google 產品。搜尋 grounding 是唯一例外,免費層不能用,付費層才有每月 5,000 次免費額度。AI Mode 的免費使用者沒有模型選單,要選 3.8 Flash 得訂 AI Pro 或 Ultra。

我在用 3.7,該不該換到 3.8?

看工作形狀。長鏈軟體工程與代理任務搬到 3.8 有感,效率優先的大吞吐留在原地省錢,價格本身不用猶豫,兩代介紹價同額。帳要記兩筆:每任務總成本比前一代約多四成,這是 Artificial Analysis 經 The Verge 轉述的實測數字。公告沒提、Model Card 才有的細節也要計入,多語安全評估比前一代退步 5.4 個百分點,屬於安全側的變化,能力側要分開看。

AI Mode 怎麼選到 3.8 Flash?

先訂 AI Pro 或 Ultra。點「提出問題」列旁邊的「+」圖示,在 Gemini 3 models 區塊選 3.8 Flash,位置在 Auto 與 Pro 之間。這條路徑的依據是公告與產品主管的宣布,官方支援頁到 9 月 5 日還沒列出任何 Flash 型號,介面上找不到時以公告為準。繁中選單沒有時間表,官方只說全球,報導指向首波英文。

知識截止到什麼時候?

2026 年 3 月,部分領域只到 2025 年 1 月,與 Gemini 3 家族一致。Model Card 是唯一列這個欄位的官方頁面,API 模型頁與 Vertex 頁都沒寫。要查比這更晚的事,配搜尋 grounding 用,那是查資料的路,跟知識截止無關。

輸入輸出的上限是多少?

輸入上限 1,048,576 個 token,輸出上限 65,536 個 token。輸入支援文字、圖片、影片、音訊與 PDF。Vertex 端的預設取樣參數是 temperature 1.0、topP 0.95、topK 64。Batch 與 Flex 都支援,批次價對半,Live API 與微調則不支援。

Gemini 3.8 Flash Cyber 一般人用得到嗎?

用不到。它走 Fairwind 計畫,開放給政府、醫療與電信這類受信任組織,要背景審查,限防禦與研究用途,入口是 CodeMender。公告寫的開放清單跟專頁不一樣,公告多了關鍵基礎設施營運者與軟體維護者,申請前以專頁為準。Gemini app 與 AI Mode 都沒有它,公告與專頁也沒提任何消費端計畫。

跟 Claude Opus 5 比呢?

看項目。終端機與電腦操作 Opus 5 領先一大段,寫程式的 DeepSWE 兩者在誤差帶內同分,多步推理官方措辭是往往接近。價差固定,Opus 5 每百萬輸入 5 美元、輸出 25 美元,約是 3.8 介紹價的 6.7 倍,Harvey 榜的附帶數字是每次測驗 3.66 美元對 23.67 美元。Opus 5 顧最難的操作型工作,3.8 用價格買涵蓋面。

2027 年漲價後還划算嗎?

標準價 1.50 與 7.50 美元,放在同價位帶仍在下緣。同帶的 Claude Sonnet 5 是 2 與 10 美元、原定的 9 月漲價已取消,GPT-5.6 Terra 是 2 與 12 美元,GPT-5.6 家族的價格結構站內有整理。grok-4.6 是 2 與 6 美元,更便宜的 GPT-5.6 Luna 是 0.20 與 1.20 美元屬輕量帶,GPT-5.6 Sol 的促銷價 4 與 20 美元官方寫至少到 2026 年 11 月 21 日。3.5 Flash 沒有介紹價,輸出每百萬 9 美元,比 3.8 的標準價還貴。

下一步

打開 Google AI Studio,選 gemini-3.8-flash,把今天手上的一件真實工作丟給它,10 分鐘。寫程式與推理類的工作,你會直接看到差距在哪。結果平平,你也省下後面的評估時間。

要對照組的話,同一件工作用 low 檔再跑一次,兩個結果與兩個數字並排放。用力與不用力的價差有了體感,後續所有成本決策都有基礎。晚一點做第二輪,同一件工作丟給你現在用的模型跑一遍,結果放一起比。從那一刻起,你用的是自己的資料,別人的評測只是參考。

走訂閱的人,AI Pro 月費 650 元,Gemini app、AI Mode 與 Sheets 都用得到 3.8 Flash,先用一個月再決定留不留。

介紹價到 2026 年 12 月 31 日為止,年底前把成本評估重算一次,這件事放進行事曆。二十筆對照法的表也一起建起來,下一季重跑時有得比。

留下你的問題或補充

你的電子郵件不會被公開。