GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

Gemini 3.6 Flash 是什麼?Google 最新主力 AI 模型完整解析

Gemini 3.6 Flash 是 Google 於 2026 年 7 月 21 日 GA 的 Gemini 3.x 世代 Flash 主力模型,主打 token 效率。內容拆解它與 3.5 Flash 的差異、每百萬 token 定價、1M context 與 computer use 能力,…

Gemini 3.6 Flash 主力 AI 模型完整解析,涵蓋 Token 效率、1M Context 與 Agent 工具

Gemini 3.6 Flash 是 Google 在 2026 年 7 月 21 日正式發布的 Gemini 3.x 世代 Flash 級穩定版模型,模型代號 gemini-3.6-flash,狀態是 General availability(GA),不是預覽。Google 給它的定位是主力工作模型(workhorse),最適合 coding、知識工作與多模態任務,主打的賣點是 token 效率,用更少的輸出 token、更少的推理步驟與工具呼叫完成同樣的工作,把成本與延遲一起壓下來。如果你過去依賴 Gemini 3.5 Flash 處理日常開發與內容流程,3.6 Flash 就是它最直接的升級選擇。

先記住這五件事

  • 它是 GA 穩定版,不是 preview,可以放進正式產品。
  • 主打 token 效率:依 Artificial Analysis Index,輸出 token 用量比 3.5 Flash 少 17%;在 Datacurve 的 DeepSWE 上觀察到最高少 65%。
  • 每百萬輸入 token US$1.50、每百萬輸出 token US$7.50,輸出單價比 3.5 Flash 便宜。
  • 知識截止日期從 2025 年 1 月推進到 2026 年 3 月。
  • computer use(電腦操作)已成為 Gemini API 與 Gemini Enterprise 的內建客戶端工具,但狀態仍是預覽。

Gemini 3.6 Flash 是什麼:先把家族位置講清楚

很多介紹一進來就丟 benchmark,讀完還是不知道 3.6 Flash 跟其他 Gemini 差在哪。先把這層講清楚。

Google 的 Gemini 模型矩陣大致分三個等級。Pro 是頂規推理,最難的題目交給它;Flash 是主力工作模型,扛 coding、知識工作、多模態日常任務,要品質也要控制成本;Flash-Lite 最快最省,服務量大、低延遲、對推理深度要求不高的場景。3.6 Flash 就是 Flash 這一層目前最新的穩定版本,不是 Pro 的替代品,也不是 Flash-Lite 的替代品。

Gemini 模型家族定位圖,3.6 Flash 位於 Pro 與 Flash-Lite 之間,兼顧品質、速度與成本
Gemini 3.6 Flash 是主力工作模型:比 Flash-Lite 更能處理複雜任務,又比 Pro 更重視速度與成本。

這個發布由 Google Gemini 團隊的 Senior Director, Product Management Tulsee Doshi 在 Google 官方的模型發布頁面 公開,同一天還發布了其他兩個模型(後面會講)。Google 對 3.6 Flash 的官方描述是:它建立在 Gemini 3.5 Flash 之上,coding 與推理品質接近 Gemini Pro,同時保有 Flash 等級的速度與成本。這句話是理解它整個產品定位的關鍵。它不是要把 Pro 打掉,而是把「接近 Pro 的品質」往下拉到 Flash 的價格帶。

把時間軸拉出來看,整個 Gemini 3 世代到 3.6 Flash 的路徑是這樣的:

  • 2025-11-18:Gemini 3 發表(含 Gemini 3 Pro 與 Deep Think)。
  • 2025-12-17:Gemini 3 Flash 推出,成為 Gemini app 的預設模型。
  • 2026-03-03:Gemini 3.1 Flash-Lite。
  • 2026-05-19(Google I/O):Gemini 3.5 Flash。
  • 2026-06-24:Gemini 3.5 Flash 內建 Computer Use。
  • 2026-06-30:Gemini Omni Flash 預覽(影片生成)。
  • 2026-07-21:3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三模型同日發布。

把 3.6 Flash 放在這條線上看,它就是「Flash 主力線走到 2026 年中」的最新一站,延續的是 3.5 Flash 的定位,而不是開新路線。

跟前一代 3.5 Flash 差在哪

3.6 Flash 的賣點不是「變得更強大」這種空泛說法,而是三件可以量化的事:token 用得更少、輸出更便宜、coding 與 agent 任務的評測數字更高。

第一是 token 效率。依 Artificial Analysis Index 的測量,3.6 Flash 完成同等工作所需的輸出 token,平均比 3.5 Flash 少 17%。在第三方 DeepSWE 評測的場景裡,這個差距最高來到 65%。這個數字的意義不只是省錢。推理模型每多輸出一段 token,就多花時間,也多一次出錯的機會。完成多步工作流程所需的推理步驟與工具呼叫變少,代表它在 agentic 場景下更不容易拖慢節奏。

這個效率優勢在多步工作流程裡會複利累積。一個 agent 任務如果需要十次工具呼叫,每次的輸出都少一點,整個流程的 token 用量與延遲下降幅度會比單次看到的 17% 大得多。這也解釋了為什麼 DeepSWE 那種深度多步工程評測能觀察到最高 65% 的降幅,而一般單輪對話的降幅會收斂在接近 17% 的平均。判斷的方式很直接:任務越長、步驟越多、工具呼叫越頻繁,3.6 Flash 的效率紅利領得越完整。如果你的場景是大量短問答,跟前一代的差距會比較收斂;如果是會反覆呼叫工具、跑很多輪的 agent pipeline,這代的進步才會完整兌現。

Google 官方圖表比較 Gemini 3.6 Flash 與 3.5 Flash 在 DeepSWE 和 Artificial Analysis 任務的平均輸出 token
Google 官方圖表:3.6 Flash 在 DeepSWE 與 Artificial Analysis 測試中使用較少的平均輸出 token。

第二是價格。3.6 Flash 每百萬輸入 token 收 US$1.50,每百萬輸出 token 收 US$7.50。前一版的 3.5 Flash 是 US$1.50 / US$9.00。輸入單價相同,輸出單價降了 17%。把 token 效率與單價下降疊起來,完成同一件工作的總成本下降幅度會比單看單價更明顯。

第三是官方自報的效能數字。Google 在 DeepMind 的 Gemini Flash 模型頁 公布的比較裡,3.6 Flash 對 3.5 Flash 的幾個關鍵評測提升是這樣的:

  • DeepSWE:49% vs 37%。
  • MLE-Bench:63.9% vs 49.7%。
  • OSWorld-Verified(電腦操作):83.0% vs 78.4%。
  • GDPval-AA v2(知識工作):1421 vs 1349。

這些評測各有各的範圍:DeepSWE 與 MLE-Bench 看的是軟體工程與機器學習工程任務,OSWorld-Verified 看的是真實電腦操作,GDPval-AA 看的是知識工作產出。要說實話,這些都是 Google 自己公布、在自家選的評測上跑出來的數字,把它們當「相對進步幅度」參考是合理的,但不要直接當成「跨模型絕對強弱」的判決。第三方評測的排名常常是另一個樣子,後面競品段落會講。

Google 官方圖表比較 Gemini 3.6 Flash、3.5 Flash 與 3.1 Pro 在軟體工程、機器學習、知識工作與電腦操作評測
Google 官方評測顯示 3.6 Flash 在 DeepSWE、MLE-Bench、GDPval-AA v2 與 OSWorld-Verified 高於前代;仍應視為廠商自報結果。

三個面向都進步了,但有些東西是刻意沒變的,這對遷移決策一樣重要。context window 上限維持 1M 輸入、64K 輸出,跟 3.5 Flash 同一個規模,不會因為換代要重設長文處理流程。輸入支援的多模態類型(文字、圖片、影片、音訊、PDF)與輸出只有文字這個限制,也跟 3.5 Flash 一致,原本不能做的生成式視覺與音訊,3.6 Flash 同樣不做。不支援的能力清單(音訊生成、圖片生成、Live API)也延續。3.6 Flash 是在能力邊界大致不變的前提下,把邊界內的品質、效率、成本往更好的方向推,而不是開新的能力領域。這代表遷移風險主要落在 API 參數(thinking_level)與 caching 策略這兩點,而不是整個能力組合要重新設計。

同日發布的三個模型怎麼分

7 月 21 日其實一次發了三個模型,名字又都帶 Flash,很容易搞混。把它們的分工講清楚,才不會選錯。

第一個是 Gemini 3.6 Flash 本身,主力工作模型,負責 coding、知識工作、多模態任務。第二個是 Gemini 3.5 Flash-Lite,定位是 3.5 等級裡最快、最省成本的選項,依 Artificial Analysis 的測量約每秒 350 個輸出 token,每百萬輸入 US$0.30、每百萬輸出 US$2.50,目前正進入 Google Search。Google 還提到,在某些代理任務評測上,3.5 Flash-Lite 的表現甚至超過前一世的 Gemini 3 Flash。第三個是 Gemini 3.5 Flash Cyber,搭配 CodeMender 的資安專用模型,在 3.5 Flash 上做微調,初期只限政府與可信夥伴有限試用,一般開發者與企業暫時碰不到。

把這三個加上預期中的 Pro 放一張表,分工看得很清楚:

模型定位價格(每百萬 token)什麼情況選它不適合
Gemini 3.6 Flash主力工作模型輸入 US$1.50 / 輸出 US$7.50coding、知識工作、多模態、要品質也要控制成本要極致便宜、極致頂規,或要生成圖片音訊
Gemini 3.5 Flash-Lite最快最省輸入 US$0.30 / 輸出 US$2.50量大、低延遲、成本優先的分類、摘要、輕量代理複雜推理與高難度 coding
Gemini 3.5 Flash Cyber資安專用初期限政府與可信夥伴,未公開計費資安場景、程式碼安全掃描(搭配 CodeMender)一般開發者與企業目前拿不到
Gemini 3.5 Pro(預期)頂規推理尚未公布最難的推理、最高品質需求還沒 GA,沒有時間表

一次發三個模型,背後的邏輯不是堆產品線,而是把不同價格帶與不同場景一次補齊。3.6 Flash 補的是中間主力的品質升級,Flash-Lite 補的是極致成本與速度的下緣,Flash Cyber 補的是資安這個特殊垂直領域。對使用者來說,這代表選擇更分明:你要的不是「最強的 Gemini」,而是在你這個工作量與預算下最對的那一階。把這個分工想清楚,比記住任何一個 benchmark 數字都實用。

Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 的用途分工圖
同日發布的三個 Flash 各有任務:3.6 Flash 扛主力工作、Flash-Lite 衝量與速度、Flash Cyber 專注資安。

這條產品線還沒走完。Gemini 3.5 Pro 仍在與合作夥伴測試,原訂六月推出已經延後,Google 的說法是「準備好就廣泛推出」。再往後,Gemini 4 已經開始預訓練,Google 稱之為「最有企圖心的預訓練」,但那只是預告,還沒有時間表。所以對「現在要不要等下一代」這個問題,老實說沒有保證可以給。3.5 Pro 何時 GA、Gemini 4 何時亮相,都沒有公開日期。

規格、context window 與能力清單

3.6 Flash 的模型規格文件裡寫得很清楚,這裡直接整理。

輸入 token 上限 1,048,576(1M),輸出 token 上限 65,536(64K)。1M 的 context window 大概可以吃下一整本中長篇書的全文,或一份大型程式碼庫的主要檔案。要注意 context window 是「上限」不是「免費」,吃到接近上限時輸入成本會疊上去,延遲也會變長,實務上還是會搭配 caching 與檢索策略把相關段落拉進來。

1M context 聽起來很大,實務上要分清楚「放得進去」與「用得好」是兩件事。把一整份大型 codebase 或一整本書塞進 context,模型確實能引用到深處的內容,但 long context 的檢索準確度會隨長度下降,越靠近 context 中段的資訊越容易被忽略,這是業界常稱為 lost in the middle 的現象。實務工作裡,與其把一百份文件全部塞進去賭模型找得到,更穩的做法是先用 file search 或自己的檢索層挑出最相關的幾份,再放進 context 要模型深度處理,搭配 caching 把常用前文的成本壓下來。把 1M context 當成「全部丟進去就好」的免費能力,成本與品質都會打折。

輸入支援文字、圖片、影片、音訊、PDF,輸出只有文字。這代表 3.6 Flash 可以看與聽,但不會自己生成圖片、音訊或影片。需要視覺或音訊生成,要找其他模型,例如 Gemini Omni Flash 處理影片生成。

模型能力清單包含:thinking(思考)、code execution(程式碼執行)、computer use(預覽)、function calling(函式呼叫)、search grounding(搜尋接地)、URL context、structured outputs(結構化輸出)、caching(隱含+明確)、file search、Grounding with Google Maps。這份清單的重點是它把 agent 會用到的幾個核心能力都整合進來了。function calling、search grounding、computer use、code execution 這四項組合起來,就是讓模型可以讀資料、查網路、寫程式碼跑、操作瀏覽器的一整套能力。

Gemini 3.6 Flash 的 1M context、64K 輸出、多模態輸入與內建工具能力圖
1M context 與多模態輸入讓模型能讀大量資料;搜尋、函式、程式執行與 Computer Use 則把理解接到行動。

光看這份清單,會以為這些只是十個各自獨立的功能。3.6 Flash 真正的價值,在於這些能力可以串成一個能完成實際工作的 agent 迴圈

一個典型的 agent 工作流程會長這樣:模型先用 search grounding 查最新資料,補自己知識截止之後的事件;用 URL context 讀指定網頁;用 function calling 呼叫你的內部 API 或資料庫查詢;用 code execution 跑一段計算或資料處理把結果算出來;需要操作外部介面時,用 computer use 操控瀏覽器或桌面應用完成點擊、填表、截圖;每一步的產出再用 structured outputs 包成你系統能直接解析的 JSON。整個流程裡,模型自己決定下一步該呼叫哪個工具、什麼時候停下來給最終答案,這就是 thinking 模型加上工具使用的組合。

Gemini 3.6 Flash 從搜尋、讀網頁、呼叫 API、執行程式到操作介面的 Agent 工作流程
3.6 Flash 的價值不是單一工具,而是能把搜尋、資料讀取、API、程式執行與介面操作串成可監控的工作迴圈。

這套組合的意義在於,過去要寫一大段流程控制程式碼才能做到的事,現在可以交給模型在單一呼叫鏈裡完成。代價也藏在這裡。agent 每多走一步,就多一次不確定性:模型可能選錯工具、可能讀錯網頁、可能在中間步驟就把方向帶偏。token 效率的提升(完成同樣工作用的步驟更少)直接降低了這個風險,這也是 3.6 Flash 把 token 效率當主打賣點的深層原因。它不只是省錢,是在提升 agent 穩定性。

要評估 3.6 Flash 適不適合你的 agent 場景,看三件事:你的任務平均要走幾步、每一步的容錯空間多大、出錯時能不能 fallback。步驟多、容錯低、又沒有 fallback 的高風險流程(例如自動化資金操作、不可逆的系統變更),不該把一個 Flash 等級模型直接押全押;步驟多但可重來、可監控的流程(研究整理、資料採集、文件起草、批次測試),才是它發揮的地方。

安全部分,3.6 Flash 強化了 Frontier Safety 防護,針對 CBRN(化生放核)與網路攻擊兩類濫用做了加固,訓練上更抗 jailbreak,Google 同時表示把它訓練成盡量減少對正當用途的拒答。後面那句很實際。過去幾代模型常被詬病太愛拒答,3.6 Flash 在這點上有刻意調整。詳細的安全評估方法與結果,可以在 DeepMind 的模型卡 查到。

對開發者來說,Frontier Safety 強化與減少拒答訓練,最直接的影響是兩件事。第一,把 3.6 Flash 放進正式產品時,觸發安全過濾的邊界案例比前幾代少,正當用途被誤擋的情況改善,使用者體驗會順一些。第二,這不代表可以放掉自己的輸入輸出過濾責任。模型級的安全防護是底線,不是全部,尤其用在企業內部或對外服務時,自己的 prompt 邊界檢查、輸出審核、使用政策這些層次還是要做。把模型安全升級當成免責理由,是誤解了它的範圍。

適合做什麼:寫程式、知識工作、電腦操作

有了能力清單,接下來的問題是:3.6 Flash 到底適合拿來做什麼?

寫程式是它最主打的場景。Google 自己公布的 DeepSWE 與 MLE-Bench 數字就是衝著軟體工程任務來的,加上 function calling、code execution、long context,它特別適合那種需要讀一大段 codebase、跨多個檔案改、還要呼叫工具驗證的開發工作。Android Studio 與 Google Antigravity 都已經把它列為可用模型,等於 Google 自己的開發者工具鏈直接背書。JetBrains 旗下的 Junie(負責人 Nick Frolov)在 Google 公開的客戶回饋裡提到,3.6 Flash 的 coding 與推理品質接近 Gemini Pro,低推理強度的 coding 任務提升約 10 到 20%。這類廠商引述要當「Google 引述的客戶回饋」看,不是獨立證據,但方向跟官方定位一致。

細分來看,3.6 Flash 在 coding 場景的甜區是這幾類:跨檔案的重構與理解(靠 long context 一次讀多個相關檔案)、需要反覆呼叫工具驗證的 debug 流程(靠 function calling 與 code execution 形成迴圈)、從需求生成草稿與測試案例(輸出長,正是效率紅利能兌現的方向)。它比較不擅長的是需要極致推理深度的演算法設計與數學密集型題目,那要往 Pro 等級找。把 coding 工作拆成這幾類來判斷,比籠統問「會不會寫程式」更能預測實際表現。

知識工作是第二個場景。GDPval-AA v2 從 1349 提升到 1421,看的正是知識工作產出。1M context 加上 PDF 與多模態輸入,讓它可以一次吃下大量文件、合約、研究資料做整理與分析。Harvey(負責人 Niko Grupen)的引述指出,在資本市場與併購的文件起草與審查上平均快了 12%。同樣,這是廠商引述不是獨立測試。如果你的工作跟 SEO、內容、研究整理有關,3.6 Flash 這類長脈絡多模態模型在「讀一堆資料然後給結構化產出」的環節上是有位置的,可以把它想成知識工作流程裡的一個環節,而不是把整個 AI 在 SEO 的應用 都押在單一模型上。

第三是電腦操作(computer use)。OSWorld-Verified 從 78.4% 提升到 83.0%,現在 computer use 已是 Gemini API 與 Gemini Enterprise 的內建客戶端工具,模型可以透過它操作瀏覽器與桌面介面完成任務。這對自動化測試、資料採集、跨系統工作流程整合是明顯利多。但它仍是預覽狀態,穩定度與 edge case 處理還不夠成熟,放進正式產品前要自己評估容錯。

換成不同身分來看,3.6 Flash 的價值落點不太一樣。

獨立開發者與小團隊,受惠於它在 coding 與 agent 任務上的品質提升,加上單價下降,可以用同一個模型同時跑 IDE 內的程式碼輔助與後台的 agent 工作流,不必為了省錢在多個模型之間切換。企業開發團隊,受惠於 computer use、search grounding、file search 整合進 Gemini Enterprise Agent Platform,可以把受管的 agent 部署給內部使用者,重點在於治理與可觀測性,不在模型本身強不強。內容與知識工作者,受惠於 1M context 加 PDF 與多模態輸入,可以把大量文件、合約、研究資料一次餵進去要它整理、摘要、比對,產出結構化草稿讓人類把關。研究與分析工作者,受惠於 code execution 與 function calling,可以讓模型直接讀資料、跑統計、呼叫外部 API 拉數字,把模型講講升級成模型真的算給你看。

不是每個人都需要 3.6 Flash。如果你做的是大量、單純、低推理強度的分類或摘要(客服對話分類、長文一句話摘要、內容標籤推薦),3.5 Flash-Lite 單價低更多,硬上 3.6 Flash 是成本浪費。如果你要的是最高難度的推理(數學競賽級、複雜法律推理、高難度演算法設計),那要等 3.5 Pro 或找 Pro 等級的模型。3.6 Flash 的甜區,是中間那一大塊:要品質夠好、量要大、成本要可控的多數日常工作。

Gemini 3.6 Flash 適合程式開發、知識工作與可監控電腦操作,不適合極致便宜或最高難度任務
3.6 Flash 的甜區是品質要好、工作量要大、成本仍要可控的 coding、知識工作與可監控 Agent 任務。

回頭看,3.6 Flash 適合的,是「需要品質接近 Pro、但量很大、對成本與速度敏感」的那類工作。它不適合的,是要極致便宜(用 Flash-Lite)、要極致頂規推理(等 3.5 Pro 或找 Pro 等級模型)、或要生成圖片音訊影片(找專門模型)。

價格與計費,跟競品比劃不劃算

把價格單獨拉出來看,3.6 Flash 的計費結構是:每百萬輸入 token US$1.50、每百萬輸出 token US$7.50。

這個數字單獨看不夠,要跟競品放一起。Google 自己在 CNBC 的報導裡稱,3.6 Flash 的每任務成本低於 GPT-5.6 Terra Max、Kimi K3、Qwen 3.7 Max。要記得這是 Google 自稱、透過媒體放的比較,比較口徑與任務定義沒有公開細節,當參考方向可以,不要當鐵律。

更穩的比法是看第三方。Artificial Analysis 的模型評測頁 給 3.6 Flash 的 Intelligence Index 是 50,輸出速度約每秒 303.6 個 token,TTFT(time to first token,第一個 token 回傳時間)在高推理強度設定下約 11.54 秒。這個 TTFT 在推理級模型裡偏高,代表它在開始輸出之前會先想一段時間;把 thinking level 調低,這段等待會跟著縮短。對需要即時回應的場景(即時客服、邊講邊回)這個延遲要算進去,對批次處理或非即時工作流影響不大。

實際估算一個工作流的成本,把這幾個數字串起來算:每日任務次數、每次任務的平均輸入 token、平均輸出 token、呼叫工具的輪數。輸入部分用每百萬 US$1.50 算,輸出用每百萬 US$7.50 算,再依 agent 多步特性把輸出量打折(3.6 Flash 的效率紅利就體現在這裡)。這個算法算出來的會是上界,實際成本通常更低,因為還有 caching 能把重複前文的成本壓掉。把這個估算跟 3.5 Flash 跑一遍對比,你會看到效率紅利在你的具體工作量上到底值多少。

Gemini 3.6 Flash 輸入每百萬 token 1.50 美元、輸出 7.50 美元,並以較少輸出 token 降低任務成本
3.6 Flash 的成本優勢來自兩層:輸出單價下降,加上完成同一任務需要的輸出 token 與工具步驟更少。

價格隨時會調,模型市場的計費結構變動很快,寫死任何一個數字當「最新」很快就過期。實際要採購或估算成本時,以 Google AI Studio 的官方模型文件或定價頁為準,不要把上面這些數字當合約。

跟 GPT-5.6、Claude、Grok 放在一起看

跨模型比較永遠是最難寫的一段,因為第三方評測排名會依評測項目變動。給幾個相對穩定的判斷。

DeepMind 官方的評測表把 3.6 Flash 與 Gemini 3.5 Flash、Gemini 3.1 Pro、GPT-5.6 Luna、Grok 4.5Claude Sonnet 5 並列比較。這個並列本身沒有錯,但會漏掉一件事:3.6 Flash 是 Flash 等級,拿它跟 Pro 等級或對手旗艦比絕對分數,本來就不公平。它的賣點不是全面最強,而是在這個價格帶上,品質夠接近更貴的模型。

讀跨廠商的模型比較,有幾個實用的懷疑點。一看評測是誰選的、誰跑的:廠商自己挑的評測通常剛好是自家模型強項,第三方獨立評測(像 Artificial Analysis)比較中性,但也有自己的評測設計偏見。二看比較的模型等級是否對等:拿 Flash 等級去比對手旗艦,輸了不代表那個 Flash 沒價值,只代表它本來就不是為那個量級設計的。三看單位與口徑:每百萬 token 的價格要看輸入與輸出分開,速度要看是輸出 token 速率還是首 token 延遲,智慧指數要看是哪一家的指數。把這三個變數都標清楚,跨模型比較才有意義,不然很容易被一張漂亮圖表帶著走。

把 Artificial Analysis 那三個數字放在一起看,3.6 Flash 在「智慧 vs 速度 vs 成本」這個三角上的位置是「中等偏上的智慧、中上的速度、偏低的成本」。要衝最高智慧,去找 Pro 等級或對手旗艦;要衝最低延遲,去找 Flash-Lite;要在兩者之間找平衡,3.6 Flash 就是為這個位置做的。

依智慧、速度與成本三個面向評估 Gemini 3.6 Flash 與其他模型的選用圖
跨廠商比較要先對齊模型等級與評測口徑;3.6 Flash 的位置是中上智慧、中上速度、偏低成本的平衡點。

資安是另一條值得點出的競爭線。Anthropic 在資安領域有 Mythos,Google 用 3.5 Flash Cyber 縮小差距,但初期只限政府與可信夥伴。一般開發者要找資安場景的 AI 工具,3.6 Flash 本身不是答案,3.5 Flash Cyber 才是,但目前拿不到。

發布時間點的背景也值得提。3.6 Flash 發布在 Alphabet 財報公布的前一天,背景是中國實驗室(DeepSeek、Kimi、Qwen)競爭升溫。這個脈絡解釋了為什麼 Google 這幾代 Flash 把成本與 token 效率講得這麼重。它要在回應速度與單價上不被低價競爭者拉近,同時靠整合的產品線(AI Studio、Gemini API、Enterprise、Android Studio)黏住開發者。

中國實驗室這波競爭的實際意義,對一般使用者與開發者不是要不要改用 DeepSeek 或 Kimi,而是它逼著 Google 與 OpenAI 把定價往下壓、把效率往上拉。3.6 Flash 的輸出單價從 US$9.00 降到 US$7.50,token 用量再少 17%,這個組合就是在回應那個競爭壓力。對採購方來說,這代表模型市場進入買方更有利的位置,定期重新比價與比效能,比押單一供應商更划算。

怎麼開始用:一般使用者與開發者兩條路

實際要用 3.6 Flash,路徑分成兩條。

一般使用者走 Gemini app(gemini.google.com)。打開網頁或 app,確認當前模型是 3.6 Flash,可以直接用對話、上傳圖片或 PDF、要求整理資料。這條路最簡單,不用設定 API key,也不碰程式碼,但能控制的能力有限,你拿不到 function calling、computer use 這類 agent 功能的完整控制權。

開發者走 Google AI Studio、Gemini API、Android Studio 或 Google Antigravity。這幾個入口的定位不太一樣:Google AI Studio 是實驗與原型的地方,Gemini API 是正式產品整合的介面,Android Studio 與 Antigravity 是綁在開發環境裡直接用。多數人會在 AI Studio 先試,確定能用再走 API 整合到自己的系統。流程大致是:

  1. 在 Google AI Studio 開啟 3.6 Flash 模型頁面,確認規格、定價與能力清單與你的需求對得上。
  2. 拿到 Gemini API key,在你的程式裡把模型代號設成 gemini-3.6-flash
  3. 視任務啟用對應能力:要模型推理就用 thinking,要它跑程式碼就用 code execution,要它操作瀏覽器就用 computer use,要它查網路就用 search grounding。
  4. 用 structured outputs 或 function calling 把產出綁成你系統能吃的格式。
  5. 量大或重複性高的情境,搭配 caching 把共用前文的成本壓下來。

企業要部署內部 agent 或知識工作流程,走 Gemini Enterprise Agent Platform 或 Gemini Enterprise app,可以把 computer use、search grounding、file search 包進受管的環境。企業方案的計費與功能細節以 Google 官方公布的企業方案為準,這裡不寫死數字。

開發者要特別注意一個最近的重大調整。Google 在 Gemini API 的 changelog 公告,最新的 Gemini 模型已棄用 temperaturetop_ptop_k 這三個取樣參數,改用 thinking_level 控制推理深度。如果你的現有程式碼還在傳 temperature,搬到 3.6 Flash 時要把這段改掉,不然參數會被忽略,行為跟你預期的不一樣。Flash 在 Interactions API 還有一個潛在的 breaking change,當輸入陣列位於末端的物件 type 是 model_output 時要留意行為差異。

棄用取樣參數的決定背後,是更大的典範轉變。3.6 Flash 是 thinking 模型,會在給出答案之前先做一段內部推理,再把推理過程濃縮成最終輸出,這跟早期那種問一句、直接吐一句的非推理模型是不同路線。前面提到的 TTFT 偏高(約 11.54 秒),就是這個內部推理的代價:模型不是慢,是它在開口前先想了一段。

Google 用 thinking_level 取代 temperature、top_p、top_k,邏輯在於推理模型的輸出品質,主要不是靠取樣參數調出來的,而是靠推理深度決定的。thinking_level 讓你控制模型要想多深,而不是控制它在字元層級的隨機性。對開發者來說,這個改動要重新建立直覺:以前用 temperature 調創意與穩定的那套經驗,在 3.6 Flash 上不適用,要改成用 thinking_level 控制推理強度,低 thinking 對應快速輕量回應,高 thinking 對應深度分析與複雜推理。簡單分類、摘要、格式轉換這類不需要深度推理的任務,用低 thinking 省時間省成本;寫複雜程式碼、多步規劃、困難分析,用高 thinking 把品質換出來。把所有任務都開到最高 thinking,等於把推理模型的代價全部吃下來,簡單任務卻換不到對應的品質回報。

從 3.5 Flash 遷移到 3.6 Flash,最務實的評估方法不是看 benchmark,而是拿你自己真實工作流做 A/B 對比。挑幾個有代表性的任務(一個 coding 任務、一個文件整理、一個 agent 工作流),同一份輸入分別跑 3.5 Flash 與 3.6 Flash 各幾十次,把四個數字量出來:完成品質(用你自己的評分標準或下游驗收)、總 token 用量、端到端完成時間、每任務成本。這四個數字會告訴你 3.6 Flash 在你的具體場景上到底值不值得換,比任何官方或第三方評測都準。

遷移過程有兩個常見雷點。一個是前面講的取樣參數棄用,現有程式碼若還在傳 temperature、top_p、top_k,搬過來要改成 thinking_level,不然行為會跟預期不一致。另一個是 long context 與 caching 的用法可能要重新校準:3.6 Flash 的 token 效率特性改變了前文重複使用與重新生成之間的成本平衡,原本為 3.5 Flash 調好的 caching 策略不一定是最划算的,值得重新跑一輪成本對比。

從 Gemini 3.5 Flash 升級 3.6 Flash 時檢查模型代號、thinking level、取樣參數、快取與 A/B 測試
遷移不只換模型代號:還要移除舊取樣參數、重新設定 thinking level、校準 caching,並用真實工作流做 A/B 測試。

容易被忽略的事:預覽、知識截止、benchmark 口徑

講了這麼多好話,這段要把多數介紹文章輕輕帶過、但其實很關鍵的幾件事講清楚。

第一,computer use 還是預覽。預覽的意思是它可用、但不保證穩定,API 行為可能在後續版本調整,正式產品裡要有 fallback 與監控,不要把它當成已經定型的功能直接押全押。

第二,知識截止推進到 2026 年 3 月,不等於模型知道現在發生的事。知識截止是訓練資料的時間邊界,過了那個時間點的資訊模型本身不知道,要靠 search grounding 或 URL context 即時補。把「知識截止 2026 年 3 月」理解成「模型即時掌握到三月之後的事件」是誤解。

第三,前面那些漂亮的 benchmark 數字,全部是 Google 自己在自家選的評測上跑出來的。DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA 都是特定範圍的任務評測,在這些評測上贏前一版,不代表在你的實際工作上也一定贏。第三方評測(像 Artificial Analysis)的排名常常跟官方自報不一樣。把 benchmark 當方向參考,不要當絕對判決。

第四,同日三個模型很容易搞混。Flash-Lite 是往便宜走、Cyber 是資安專用、3.6 Flash 才是主力。看到「Google 新 Flash」幾個字就直接套到 3.6 Flash 上,常常是錯的,要先確認講的是哪一個。

第五,TTFT 偏高是推理模型的代價。3.6 Flash 每秒輸出約 303.6 個 token,速度不慢,但 TTFT 約 11.54 秒代表它開口前要先想。對即時對話、即時客服這類馬上要回應的場景,這個延遲要算進體驗成本。

第六,模型本身 GA,不等於它內建的所有功能都 GA。3.6 Flash 的電腦操作是預覽,Interactions API 有潛在 breaking change,這些夾在一個 GA 模型裡的預覽或未穩定組件,很容易被當成「既然模型穩定了,這些也跟著穩定」。實際上它們的穩定度與 API 契約保證是另一套,放進正式產品前要逐一查狀態,不要把整個模型當成一個同質的穩定黑箱。

限制與不適用的情境

把 3.6 Flash 放在什麼情況不該用,講清楚。

它不適合要生成圖片、音訊或影片的場景。輸入支援多模態,但輸出只有文字,需要生成式視覺或音訊要找專門模型。它也不適合要極致便宜的批次場景,那種量大、任務簡單、對推理深度要求低的工作,3.5 Flash-Lite 單價低更多,硬用 3.6 Flash 是浪費。它不適合要極致頂規推理的最難題目,那要等 3.5 Pro 或找 Pro 等級的模型。它也不適合即時低延遲對話場景,TTFT 偏高會讓使用者等。

還有幾個「規格上寫支援、實務要打折」的點。1M context 是上限,實際用到接近上限時成本與延遲都會疊上去,long context 的檢索準確度也會隨長度下降,實務上還是要靠檢索與分段策略。computer use 是預覽,穩定度要自己驗。第三方 benchmark 數字(Intelligence Index、速度、TTFT)會隨評測版本更新而變動,上面這些是撰文當下(2026 年 7 月)的狀態。

還有一個容易被忽略的成本結構問題。3.6 Flash 的長處在輸出 token 效率,但輸入 token 單價跟 3.5 Flash 一樣是每百萬 US$1.50。如果你的工作流程是「餵大量前文、要求少量輸出」(例如把一大份文件塞進去要一句話結論),輸入成本會主導總開銷,token 效率紅利在這種流程上領得有限。反之,「輸入短、輸出長」的工作流程(例如從簡短需求生出一大段程式碼或長文),才是 3.6 Flash 效率紅利最能兌現的地方。算成本時把輸入與輸出的比例一起看,才知道這代對你到底省在哪裡。

再講一次最常被過度延伸的一點。採用 3.6 Flash 不等於你的內容就會被 AI 搜尋或答案引擎引用,也不等於排名會提升。模型選擇與搜尋能見度是兩件事,答案引擎怎麼挑選與引用來源是另一整套機制。如果你關心的是怎麼讓自己的內容在生成式搜尋裡被看見,方向要擺在 AEO 答案引擎最佳化AI 搜尋最佳化策略 那一側,而不是換哪個模型寫稿。把工具當排名秘方,方向就錯了。

常見問題

Gemini 3.6 Flash 是預覽還是正式版?

是 General availability(GA)穩定版,不是預覽,可以放進正式產品。但它內建的 computer use 功能本身仍是預覽狀態。模型本身 GA 與功能預覽是兩件事,不要混為一談。

知識截止日期到什麼時候?

3.6 Flash 的知識截止日期是 2026 年 3 月,比 3.5 Flash 的 2025 年 1 月推進了一年多。知識截止是訓練資料的時間邊界,超過這個時間點的事件模型本身不知道,要靠 search grounding 或 URL context 補。判斷某個資訊模型會不會知道,一個粗略的方式是看事件發生時間是否在截止日之後;如果你問的是近幾個月才發生的事,預設它不知道,直接在 prompt 附上來源或開啟搜尋接地比較可靠。

可以生成圖片、音訊或影片嗎?

不行。3.6 Flash 輸入支援文字、圖片、影片、音訊、PDF,但輸出只有文字。它不支援音訊生成、圖片生成,也不支援 Live API。需要視覺或音訊生成要找專門的模型。Google 自己的產品線裡,影片生成走 Gemini Omni Flash,圖片與音訊生成走對應的專門模型。3.6 Flash 的角色是讀懂與整理多模態輸入、產出文字判斷與結構,不是做生成式媒體。

開發者還能用 temperature、top_p 控制輸出嗎?

不能。Google 在 2026 年 7 月 21 日的 changelog 公告,最新 Gemini 模型已棄用 temperaturetop_ptop_k 三個取樣參數,改用 thinking_level 控制推理深度。現有程式碼搬到 3.6 Flash 時要把這段一起改。

context window 1M token 實際能讀多少內容?

輸入 token 上限是 1,048,576(1M),輸出上限 65,536(64K)。1M 大概可以吃下一整本中長篇書的全文,或一份大型程式碼庫的主要檔案。實際用到接近上限時輸入成本會疊上去、延遲會變長,long context 的檢索準確度也會隨長度下降,建議搭配 caching 與檢索策略使用。

現在還在用 3.5 Flash,要馬上換到 3.6 Flash 嗎?

如果你的工作集中在 coding、知識工作或多步 agent 任務,3.6 Flash 在 token 效率、輸出單價與多個評測上都比 3.5 Flash 進步,換過來的總成本下降會比單看單價更明顯,值得評估遷移。如果你的工作量大、任務簡單、對推理深度要求低,反而可以往下看 3.5 Flash-Lite,單價更低。要不要馬上換,取決於你對推理品質與成本結構的權衡,不是一句「新版一定比較好」可以回答。

接下來可以做的事

要實際評估 3.6 Flash 適不適合你,最直接的方式是開 Google AI Studio,拿一個你真實工作裡的任務(一段 codebase、一份文件、一個多步工作流程)跑跑看,把 token 用量、輸出單價、完成時間量出來,再跟現在用的模型比。這比看任何 benchmark 都準。

另一個務實建議是建立追蹤官方變動的習慣。模型市場這半年變動極快,3.6 Flash 距離 3.5 Flash 發布只隔了兩個月,價格、能力、API 參數隨時可能再調(thinking_level 取代 temperature 就是無預警在 changelog 出現的)。與其每次依賴第三方整理,不如把 Google AI Studio 的 changelog 與 DeepMind 模型頁放進定期查看的清單,模型一旦更新,先看官方說明再決定要不要跟。

如果你關心的不是模型本身,而是 AI 模型這幾年的快速更替對搜尋與內容能見度意味著什麼,可以往 GEO 生成式搜尋最佳化 這個方向讀,把模型更替與搜尋環境的變化串起來看。模型會一代一代換,背後那套人怎麼找資訊、怎麼被找到的問題,才是相對穩定的那層。

留下你的問題或補充

你的電子郵件不會被公開。