GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

Imagine Image 2.0 是什麼?xAI Grok 最新 AI 圖片生成模型完整解析

Imagine Image 2.0 是 xAI 於 2026 年 8 月 7 日發布的 Grok Imagine 新一代圖片模型,主打生成後的精準編輯:Magic Wand 局部修改、5 張多參考融合、Smart Resize 九種比例。本文拆解完整功能、Arena 第二名的誠實解讀、跟 GPT-…

Imagine Image 2.0 精準編輯功能完整解析精選圖片

Imagine Image 2.0 是 xAI 於 2026 年 8 月 7 日發布的新一代 AI 圖片生成模型,屬於 Grok Imagine 產品線,主軸不是「再抽一張」,而是生成完還能精準改。官方把它定位為「做出真正能用在工作裡的圖」,把攝影、設計、插畫的擬真度與編輯能力綁在一起。截至發布日,xAI 引述公開的 Arena 排行榜,稱它在文字生圖與圖片編輯兩類都站上全球第二,第一名是 OpenAI 的 GPT-Image-2。

Imagine Image 2.0 才上線一天,很多規格隨時會變,任何判斷都得先回到 2026 年 8 月 7 日的官方公告;其中哪些是官方原文、哪些是品牌自引的排行、哪些根本還沒公布,三者分清楚,才不會被外電快訊帶著誤判。

重點先看

Imagine Image 2.0 是 Grok Imagine 產品線的新一代圖片模型,2026 年 8 月 7 日正式上線,主打「生成後能精準編輯」,而不是只能重抽。

核心能力放在 Magic Wand 局部修改、多參考圖融合(單次最多 5 張)、Smart Resize 自動重構 9 種長寬比,以及接近設計師等級的文字渲染。

xAI 引述公開 Arena 排行榜自稱全球第二(low 變體),這是品牌自引、不是獨立評測,而且會變動;兩個榜的第一名都是 OpenAI 的 GPT-Image-2。

一般使用者目前透過 grok.com/imagine 與 Grok App 的 Quality Mode 使用;API 官方只說「即將推出」,沒給日期與計價。

免費方案是否含圖片生成、每日張數上限、點數制、水印政策,官方都還沒公布,看到「200/100 張」這類數字要警覺。

Imagine Image 2.0 是什麼?先把名字、定位與前代分清楚

先把名字拆清楚,因為 xAI 這條產品線的命名很容易讓人搞混。全名是 Grok Imagine Image 2.0,官方頁面簡稱 Imagine Image 2.0 或 Image 2.0;它不是一條全新的產品線,而是 Grok Imagine 這條圖片生成產品線裡的新一代模型。這個區別不只是命名潔癖,它會直接影響你讀外電時會不會把能力歸錯地方。

Grok Imagine 產品、Imagine Image 2.0 模型與 Quality Mode 使用入口的三層定位圖
先分清楚產品、模型與使用模式:Grok Imagine 是產品線,Imagine Image 2.0 是模型,Quality Mode 是目前的使用入口。

Grok Imagine 是產品品牌,對應 grok.com/imagine 這個入口與整套功能;Imagine Image 2.0 是這條線在 2026 年 8 月 7 日正式上線的新一代圖片模型,以 Quality Mode(高品質模式)提供。要理解 xAI 整套 Grok 產品的全貌,可以先把 Grok 的整體功能與方案 看過一遍,會更知道 Imagine Image 2.0 在哪一層、跟 Grok 的文字、語音、影片能力怎麼並排。

幾個容易踩錯的地方先講。現行 API 上的 grok-imagine-imagegrok-imagine-image-quality 是前代模型,不是 Imagine Image 2.0;2.0 在官方 API 定價頁上還沒出現,xAI 在 Imagine Image 2.0 發布公告 裡只說「即將推出(coming soon)」,沒給日期也沒給計價。這代表一件很實際的事:如果你在第三方網站看到「Imagine Image 2.0 API 每張多少錢」,那幾乎可以確定是把前代 API 的計價挪過來講,不是 2.0 的真實價格。

再看定位,那份公告裡兩句話很值得記下來。一是 make images you can use in real work,二是把編輯當成一等能力(first-class capability),不是附加功能。這兩句不只是行銷話術,它們幾乎可以解釋 Imagine Image 2.0 全部功能設計為什麼長這樣:範本、去背、多參考、智慧縮放,全部都是「為了把圖用進實際工作」而存在,而不是為了讓你玩。這也是它跟很多「玩具型」生圖工具最根本的差別。

你可以把它想成:前一代 Grok 圖片模型把「生得出來」做好,這一代把「生成完還能精準改」做進來。這個差別看起來小,實際用起來決定了你是「不斷重抽碰運氣」還是「朝一個方向改到對」。前者是在跟模型賭運氣,後者是在跟模型協作,這是兩種完全不同的工作節奏。

核心功能白話講:從生成到精準編輯

Imagine Image 2.0 的功能設計有一條清楚的主軸:生成只是起點,編輯才是它想贏的地方。把官方列出的能力拆開來看,多數都在解決「生成完不能改、只能重抽」這個老問題。下面逐項白話講,並補上什麼時候用哪一個的判斷。

xAI 官方 Imagine Image 2.0 產品更新影片,展示生成後編輯與工作流程。來源:xAI 官方公告。 查看官方公告
從生成、局部修改、多圖融合、智慧縮放到匯出的 Imagine Image 2.0 工作流程圖
這代的核心不是反覆重抽,而是沿著生成、精準修改、重構尺寸與匯出的流程,把同一張圖逐步改到可用。

Magic Wand(魔術棒):局部修改的入口

你指到哪裡,它只改那個區域,其餘不動。這聽起來像修圖軟體裡的局部筆刷,但關鍵差別是它理解整張圖的語境,所以改一個杯子不會把旁邊的人臉弄糊,改一段文字不會把整個版面打掉重練。判斷上,Magic Wand 適合「畫面九成都對、只差一個細節」的情況;如果整體方向都不對,與其局部修,不如整張重新生成還比較快。

Segmentation(分割選取):先框出範圍再改

配合 Magic Wand,讓你選出更精確的範圍再改。簡單講,Magic Wand 偏「點了就改」,Segmentation 偏「先框出範圍、再決定怎麼改」,兩個一起用能在複雜畫面裡做更細的手術,例如只改一張海報裡的某一行文案而不動到周邊圖樣。

Background Removal(去背):透明背景匯出

把主體以透明背景匯出,直接拿到別的軟體用,不用再開額外的修圖工具。這對電商與社群素材特別實用,因為去背之後的透明 PNG 可以直接丟進 Canva、簡報、商品頁,省掉往返修圖軟體的步驟。這三個能力串起來,就是一條「選起來、改掉、匯出」的最短編輯路徑。

Multi-ref Editing(多參考編輯):融合最多 5 張圖

這一代比較有想像力的設計:單次生成最多結合 5 張輸入圖。要做「把 A 的構圖、B 的配色、C 的角色融合成一張」,這個能力比單純文生圖更貼近實際工作流程。以前的痛點是「腦海裡有畫面、但一張圖講不清楚」;多參考編輯讓你直接拿圖說話。要注意的是,參考圖越多,模型要平衡的條件也越多,結果有時反而更難預測;實務上建議從兩到三張開始,再逐步加。

Smart Resize(智慧縮放):9 種長寬比自動重構

解決的是平台規格問題。一張圖要餵給不同平台,往往得重新構圖;Smart Resize 把一張圖重新構圖成 9 種長寬比,從 1:2、9:16、2:3、3:4、1:1,到 4:3、3:2、16:9、2:1,由模型自動補滿新畫面,而不是機械式裁切。對同時要發社群限動(直式)、網站橫幅(橫式)、EDM(接近正方)的人,這個能力直接省掉好幾次手動重構圖。要提醒的是,自動補滿代表模型在「猜」畫面外有什麼,複雜場景偶爾會補出不太合理的內容,建議每次縮放後都檢查邊緣。

xAI 官方 Imagine Image 2.0 Smart Resize 介面,提供九種長寬比重構選項
xAI 官方 Smart Resize 示範:同一場景可切換 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 與 2:1。來源:xAI 官方公告。

文字渲染與排版:跟 GPT-Image-2 較量的戰場

這是 xAI 特別強調的一塊。它號稱能像設計師一樣規劃 typography 與 layout,密集、多元素的視覺保持整齊,連小字都銳利。AI 圖片模型過去最容易翻車的就是文字:多一筆、少一畫、歪掉、糊掉。這一項是 Imagine Image 2.0 要跟 GPT-Image-2 直接較量的戰場,也是第三方比較目前普遍認定 GPT-Image-2 仍佔上風的項目。如果你的工作大量依賴中英文排版(海報、社群圖卡、簡報封面),這一項要先自己測一輪再決定要不要把產線搬過來。

功能這麼多,第一個實務問題是:拿到一張不滿意的圖,到底該用哪一個?這裡給一個判斷優先序。畫面大致正確、只差一個小物件或一段文字,用 Magic Wand 做局部修改,這是最省成本的做法。畫面對、但範圍複雜、需要先精確框選(例如海報裡的某個區塊),先 Segmentation 再改。畫面的主體或背景要分開處理、或要拿到透明背景給別的軟體用,走 Background removal。方向根本不對,或想融合多個來源的元素,用 Multi-ref 重新生成,比硬改更有效率。尺寸要換平台,交給 Smart Resize,不要手動裁切。這個優先序的核心原則是:能局部改就不要整張重來,因為每一次整張重生成都會把前面建立好的細節全部丟掉。

Build a World:一致視覺世界

比較進階、也容易被快訊略過的一項。它的概念是:角色、場景、道具可以分開生成,但彼此風格一致,串起來就像同一個世界裡的元素。xAI 把它定位成影片製作前製的起點,也就是先把視覺資產(asset)做齊,再交給影片模型去動起來。對做短影音、廣告影片、遊戲前導的人,這個能力的價值不在單張圖有多美,而在它解決「分鏡之間角色長得不一樣」這個老問題。要提醒的是,這項能力要搭配 xAI 自己的影片模型才走得完整,單獨看圖片側只能算前半段。

官方在這些功能背後反覆強調兩件事:指令遵循要細緻,以及跨「生成與編輯」要能保持一致。換句話說,你改了三次之後,那還是同一張圖,不會每次都重新擲骰子。這個一致性聽起來基本,卻是很多模型沒做好的地方;一致性一旦破掉,局部編輯就會退化成「等於重抽一張」,整個編輯流程的價值就消失了。

Templates 範本:把常見工作流打包成起點

範本(Templates)解決的是「空白頁焦慮」。多數人不是不會下 prompt,而是不知道這套工具到底能做到哪些事。Imagine Image 2.0 把常見工作流打包成現成起點,使用者只要給輸入,範本負責把後面的流程串好。

將 Imagine Image 2.0 範本分成電商、人物、設計與內容四類的視覺分類圖
官方範本很多,但可先按工作目的分成電商、人物、設計與內容四群,再挑離任務最近的起點。

官方列出的範本包括:Photo Edit(照片編輯)、Product Color Change(商品換色)、Editorial Product Poster(編輯型商品海報)、Reimagine(重新想像)、Photo Collage(照片拼貼)、Mascot Maker(吉祥物製作)、BG Removal & Change(去背與換背景)、E-Commerce Photos(電商照)、UGC Photos(使用者生成內容照)、Professional Headshot(專業大頭照)、Icon Maker(圖示製作)、Character Sprite(角色 sprite)、Props & UI Kit(道具與 UI 套件)、Emoji Creator(表情符號製作)、Merch Maker(周邊商品製作)。

這份清單本身就透露了 xAI 的目標客群。把它依用途分四群會更清楚:電商商品類(商品換色、電商照、去背與換背景、編輯型商品海報),人物肖像類(專業大頭照、UGC 照),設計與品牌素材類(吉祥物、圖示、道具與 UI 套件、周邊商品、表情符號),以及內容組合類(照片拼貼、重新想像、照片編輯)。對這些人來說,要的不是「一張漂亮的圖」,而是「一條能重複走的工作流程」。商品換色、去背、電商照這幾個範本,幾乎就是小型電商與自媒體每週都在做的事。

範本不是萬靈丹。它降低的是起步門檻,不是取代判斷;同一個商品換色範本,給它一張打光乾淨的輸入圖,跟隨手拍一張逆光的照片,結果會差很遠。範本的價值在於它把「從零想 prompt」變成「填空」,但填進去的東西品質還是你自己要顧。一個務實的做法是:先用官方範本跑通一次,看它預設的 prompt 結構長怎樣,再把它改寫成符合自己品牌調性的版本,這會比每次都從空白開始更穩。

Imagine Image 2.0 怎麼用?grok.com/imagine 的 Quality Mode

操作路徑其實很單純。到 grok.com/imagine,或在 Grok 的 iOS/Android App 裡,選擇 Quality Mode(高品質模式),登入帳號就能開始用。這個 Quality Mode 就是 Imagine Image 2.0 對應的入口。在這裡先分清楚:Grok Imagine 這個產品入口底下會有不同模式,Quality Mode 對應的是新一代高品質模型,也就是 Imagine Image 2.0;其他模式可能還在跑前代模型,計價與生成品質不同,使用前要先確認自己切到哪一個。

登入 Grok Imagine、切換 Quality Mode、挑範本、局部編輯與尺寸重構的五步測試流程
第一次不必追求漂亮成品;先用五步流程測試它能否保留主體、精準改動,再把同一張圖重構成不同版型。

給一個常見情境的示意流程,方便你第一次進去知道要做什麼。第一步,登入 grok.com/imagine,確認能切換到 Quality Mode(若切不到,代表你的方案目前不支援,這時再回頭看計價)。第二步,先挑一個範本當起點,例如要做商品照就選 E-Commerce Photos,這比從空白開始下 prompt 更容易跑出可用結果。第三步,給它一張你自己拍的商品圖當參考,用 Magic Wand 改掉背景或某個細節,看它能不能只動你指的範圍;這一步是判斷 Imagine Image 2.0 對你有沒有價值的關鍵測試。第四步,用 Smart Resize 把同一張圖轉成直式與橫式兩個版本,檢查邊緣有沒有補出奇怪的東西。整個流程跑完,你大概就能知道這套工具適不適合你的產線,而不必等到買單後才發現。這個流程是示意,不是唯一路徑,但它涵蓋了生成、編輯、縮放三個核心能力,是最短的有效驗證。

計價這裡要講清楚,因為網路上流傳的數字大多不可靠。依照 xAI 官方計價頁,Free 方案($0/月)的功能清單沒有列出圖片生成,SuperGrok($30/月)則明確列有 Image and video generation。但官方沒有用白紙黑字寫「Quality Mode 一定要 SuperGrok」,這是從頁面結構推論出來的,仍有一層不確定。也就是說,免費帳號能不能用到 Imagine Image 2.0,目前沒有官方確認的答案。

更關鍵的是,官方完全沒有公布任何每日張數上限、點數制或速率限制的具體數字;SuperGrok 那張卡片只寫「Higher rate limits」。網路上流傳的「每天 200 張/100 張/50 張」全來自 Reddit 與內容農場,而且互相矛盾,不要拿來當決策依據。SuperGrok 的細節方案與訂閱判斷,可以看 SuperGrok 方案與價格解析,這裡不重複展開。

浮水印政策、訓練資料來源與授權、2.0 專屬的安全政策,官方也都還沒公布。所以在你實際掏錢之前,能確定的只有「SuperGrok 月費 $30、且它列了圖片與影片生成」這一件事;其他都得等官方補上。對只想試水溫的人,建議的做法是:先用最低門檻登入 grok.com/imagine,看自己帳號能不能切到 Quality Mode,再決定要不要升級;不要根據流傳的張數數字先買單。

Arena 第二名代表什麼?跟 GPT-Image-2 比到底差在哪

講到排名,先把話講清楚:Imagine Image 2.0 的「全球第二」是 xAI 自己引述公開的 Arena 排行榜,不是獨立第三方做的評測,而且排行榜會變動。截至 2026 年 8 月 7 日,xAI 模型在 Arena 上以 SpaceXAI 名義列出。Arena 的運作方式是讓人在兩張匿名生成的圖之間盲測投票,再用這些勝負累積出 Elo 分數,所以它測的是「人多覺得哪張好看」,不是「哪張技術上更正確」。

用盲測偏好、文字生圖與圖片編輯三個面向解讀 Arena 排名的資訊圖
Arena 反映的是匿名對戰下的群體偏好,不等同於每個工作任務的技術正確性;排名要和實際用途一起看。

精確的 Elo 數字長這樣(來源是 The Decoder 引述 Arena,並不是 xAI 公告正文):

排行榜模型(變體)Elo名次
Image Edit ArenaImagine Image 2.0(low/較快變體)14392
Image Edit ArenaOpenAI GPT-Image-214631
Text-to-Image ArenaImagine Image 2.0(low)1320(±12)2
Text-to-Image ArenaGPT-Image-21380(±5)1

兩個榜都是 GPT-Image-2 第一、Imagine Image 2.0 第二,而且 Imagine Image 2.0 是用 low(較快)變體測出的成績,明顯超越前一代的 Quality 變體。這一點對開發者有意義:代表 xAI 在「更快又更強」這個方向上有實質推進,不是只靠堆品質。low 變體能跑到第二,也暗示正式的 Quality 變體上架後還有往上走的空間,不過這仍是推測,不是官方承諾。

但 Elo 數字有它先天的限制,直接講結論會誤導人。Arena 是盲測人群投票投出來的,測的是「主觀偏好」不是「客觀技術品質」;排名會隨票數累積變動;票數少的模型誤差很大,Imagine Image 2.0 在 T2I 那個榜上大約只有 2,722 票、±12 的誤差區間,這個間距夠不夠穩,要看你信不信區間估計。把「第二名」講成「世界第二好」是過度延伸。一個才上線一天的模型,票數還在快速累積,未來幾週名次跳動是完全正常的事。

對手的背景也要交代。GPT-Image-2 是 OpenAI 在 2026 年 4 月 21 日發布的模型,消費端叫 ChatGPT Images 2.0,底層模型 id 是 gpt-image-2,是繼 gpt-image-1(2025 年 4 月)與 gpt-image-1.5(2025 年 12 月)之後的第三代旗艦圖片模型,發布時曾在 Arena 圖片榜以約 +242 Elo 的差距橫掃。它目前仍是這兩個榜的第一名。+242 Elo 在這類排行榜上是相當大的差距,這也是為什麼短時間內 GPT-Image-2 的榜首位置很難被撼動。至於常聽到的「GPT-Image-2 取代 DALL-E」,這是產業解讀,不是 OpenAI 官方原話,引用時要標為推論。

講完排行,更實際的問題是:你要怎麼自己判斷 Imagine Image 2.0 好不好,而不是只看榜?建議用四個自己測得出來的指標,這些不靠 Arena 也能驗證。第一是文字正確率:給它一段中英文夾雜的文案當 prompt,看生成的文字是不是每個字都對、有沒有多筆少畫,這是最容易翻車也最容易驗的。第二是局部編輯的一致性:用 Magic Wand 改一個細節,再把改前改後兩張圖擺在一起,看沒改的區域是不是真的沒動。第三是多參考融合的可預測性:給兩到三張參考圖,看它能不能照你指定的比重融合,而不是只抓其中一張。第四是你的領域特有需求:電商就測商品質感與去背邊緣、社群就測直式構圖、設計就測文字排版。這四個指標比任何排行榜都貼近你會不會真的用它,因為排行榜測的是大眾偏好,你要的是「在你自己的工作裡能不能用」。

如果你對 OpenAI 那一側的 ChatGPT 全家功能有興趣,可以搭配 ChatGPT 完整教學 一起看,會更清楚 GPT-Image-2 在 ChatGPT 裡的位置,以及為什麼它在文字渲染那一塊一直被認為領先。

跟 Midjourney、Gemini、其他 AI 繪圖比的選擇判斷

Arena 上 Imagine Image 2.0 與 GPT-Image-2 之後,還有一排模型排在更後面。The Decoder 定性提及的有 Reve 2.1、Muse-Image、Alibaba Qwen-Image-3.0-Pro、Google Gemini、ByteDance SeedDream。這裡要特別提醒:Muse-Image 不是 Meta 在 2026 年 8 月發布的那個寫程式代理,兩者只是名字相近,不要混為一談。這些模型查不到可靠的 Elo,所以我不給數字,只用定性判斷。

依精準編輯、文字排版、風格探索與工作整合選擇 AI 圖片模型的任務矩陣
沒有一個模型適合所有任務;先判斷你更在意精準編輯、文字排版、風格探索還是工作整合。

依「實際選擇會問的問題」來比,會比堆規格表更實用:

比較面向Imagine Image 2.0GPT-Image-2MidjourneyGoogle Gemini 生圖
編輯力(局部/多圖融合)強,Magic Wand 加 5 張多參考強,但融合以 ChatGPT 流程為主偏弱,以重抽與變體為主一般
文字渲染官方強調銳利、排版整齊公認領先偏弱一般
接入方式grok.com/imagine、Grok AppChatGPT、APIDiscord、網頁Gemini App、Google 產品組合
計價確定性低,僅 SuperGrok 確定含圖片生成相對清楚訂閱方案明確綁 Google One
商用判斷條款官方未公布原文有商用條款可循有商用條款有商用條款
什麼情況選它生成後要不斷精修、已在 Grok 流程裡要文字密集的商業稿、追當下榜一要藝術感與風格表現已在 Google 工作流程裡

這張表不是要選出一個「最好的 AI 繪圖工具」,而是讓你對照自己的工作流程。說穿了就一件事:選哪一套,取決於你的圖「生成之後還要被誰改、改成什麼」。如果你的產線是「生成一張就交付」,美感取向會選 Midjourney;如果是要反覆局部修改、又離不開 Grok,Imagine Image 2.0 的編輯力就是它的賣點。

再細分一點。做電商商品照、需要頻繁換色與去背的人,Imagine Image 2.0 的範本與編輯力很對胃;做品牌主視覺、海報、包裝這種文字與排版密集的工作,GPT-Image-2 的文字渲染目前仍領先,是這類工作首選;做插畫、概念藝術、氛圍感強的視覺,Midjourney 的風格表現多年來是這一塊的標竿;已經把工作流程綁在 Google 產品上的人,Gemini 生圖的優勢在「不用再換工具」,而不是它一定比誰強。

還有一個容易被忽略的維度:切換成本。已經在某一個產品裡累積了大量素材、範本與工作流程的人,換工具的代價不只是每個月的訂閱費,而是要把整套產線重學一次。所以選 AI 繪圖工具,有時候不是選「最強」,而是選「最不會讓你白學」的那一個;Imagine Image 2.0 對已經在 Grok 裡的人切換成本最低,對完全沒用過 Grok 的人則要從頭評估。

要補一句限制:上面 Gemini 那欄指的是 Google 那套多模態生圖能力的大方向,跟「Gemini Omni」這類特定產品定位不是同一回事;想理解 Google 這一側多模態的佈局,可以看 Gemini Omni 的整理,避免把產品名搞混。

生成圖能商用嗎?版權、水印與使用限制的務實判斷

商用這題沒有乾淨的答案,因為官方該講的都還沒講。商用條款的原文,官方還沒公布;網路上能找到的「可商用/不可商用」說明,多半是第三方指南整理,不是 xAI 原文,引用時要分清楚。水印政策也是官方未公布,訓練資料來源與授權同樣未公開。

檢查來源、授權、商標、肖像與人工覆核的 AI 生成圖片商用清單
能下載不代表能直接商用;來源、授權、商標、肖像與人工覆核,缺一項都可能留下風險。

在不確定裡做判斷,有幾條實務原則相對安全。把每一次生成留紀錄,包括 prompt、生成時間、使用的帳號、範本與參考圖,這是任何 AI 生成素材上線前都該做的事;一旦未來被質疑來源,至少有跡可循。避開用受版權保護的參考圖當 Multi-ref 輸入,也避開把指名道姓的人物、品牌、商標拿來生成;這兩類不論哪一家 AI 圖片工具,都是爭議熱區。

真正的風險不在「工具能不能商用」,而在「你這張圖會不會侵權」。AI 模型生成出近似某個受保護角色或商標的圖,責任還是落在使用者身上。有幾個高風險類別要特別小心:知名 IP 角色(動漫、電影、遊戲)、明星與公眾人物肖像、品牌 logo 與具識別性的產品外觀、受設計專利保護的造型。這些類別即使 prompt 沒有明寫,模型也有可能生成出近似物,事後被主張權利時,「是 AI 自己畫的」並不是免責理由。

如果你要做正式商用稿(例如品牌主視覺、廣告素材、包裝),建議把官方商用條款原文調出來比對,再決定要不要上線;在官方條款未明朗之前,拿 Imagine Image 2.0 的產出做高風險商用,要自己承擔這層不確定性。相對安全的做法是先用在內部溝通、提案草圖、社群素材這類容錯率高的場景,等條款清楚再往高風險用途推進。給自己一個上架前的檢查清單:確認這張圖沒有近似知名 IP 或品牌、沒有可辨識的真人臉、prompt 紀錄留底、用途落在容錯率高的場景、官方商用條款已經比對過。這五項只要有一項不確定,就先別放在會被大量曝光的位置;AI 生成素材的爭議通常不是出在「工具」,而是出在「你沒有先確認就上線」。

xAI 圖片模型的演進:從 Aurora 到 Imagine Image 2.0

看演進時間軸,比較容易理解 Imagine Image 2.0 在 xAI 產品線裡的位置。很多人看到「xAI 出圖片模型」會直覺以為它剛起步,其實不然:從 2024 年底的 Aurora 算起,xAI 在圖片這條線已經累積將近兩年,中間歷經產品化、API 開放、高品質模式、影片模型、再到這一代 Image 2.0,節奏在加快。把這條線看清楚,你才不會把 Imagine Image 2.0 誤判成「實驗性質的新嘗試」,而會把它看成一家已經改版多次的公司,把賭注押在「生成加編輯」這個方向上的最新一步。

Aurora、Grok Imagine 與 Imagine Image 2.0 的模型演進時間線及 API 待公告狀態
模型名稱、產品入口與 API 型號不一定同步;看到計價時,先核對到底指的是哪一代模型。

2024 年 12 月 9 日,xAI 公開 Aurora,這是它自研的 autoregressive(自迴歸)圖片模型,負責驅動 Grok 的圖片生成。自迴歸路線在圖片模型上是一個有點爭議的選擇,因為主流的高品質生圖多走 diffusion(擴散)路線;xAI 選擇自迴歸,背後的邏輯是讓圖片生成與語言模型共用同一套架構,方便統一調度。2025 年 8 月,Grok Imagine 1.0 上線,這是「Grok Imagine」作為產品品牌的起點,把底層模型包成消費者能用的產品。

2026 年 1 月,Grok Imagine 開出 API,影片生成計價每秒 $0.05,讓開發者能程式化呼叫。2026 年 5 月 6 日,Grok Imagine 推出 Quality Mode(高品質模式),也就是 Imagine Image 2.0 的直接前代。2026 年 6 月 3 日,Grok Imagine Video 1.5 以 image-to-video、720p 上線,把圖片與影片串成一條產線;同年 7 月 31 日的 with References 更新,再補上 1080p 與多參考場景控制。2026 年 8 月 7 日,Imagine Image 2.0 正式發布。

把這條線整理一下:Aurora 是底層模型,Grok Imagine 是產品品牌,Imagine Image 2.0 是這條產品線的新一代圖片模型。三個層次不要混在一起,很多外電快訊把這三者講成同一件事,這是常見的誤解。從時間軸也可以看到一個趨勢:xAI 的更新節奏在加快,從 Aurora 到 Grok Imagine 1.0 隔了約八個月,2026 年下半年幾乎每個月都有新東西,這代表現在看到的規格很可能幾週後又會變。

一個要保守描述的地方:Imagine Image 2.0 是否仍延續 Aurora 架構,xAI 公告沒有明說,所以這裡只講「Imagine 產品線的新一代圖片模型」,不斷言它的架構細節。想看 xAI 模型更廣的評測脈絡,可以搭配 Grok 4.5 評測,會更知道這條模型線整體走到哪裡。

2026 年初,Grok 圖片生成曾因審查寬鬆引發爭議,外部研究報告與多州檢察長致函先後點名,xAI 其後加強了內容限制。這類爭議通常會牽動後續的安全政策與過濾強度,而安全政策正好也是官方還沒對 Imagine Image 2.0 公開說明的項目之一。

API 開發者須知:現在能用到 Imagine Image 2.0 嗎

對開發者,答案很直接:現在還不能用。Imagine Image 2.0 的 API,官方只說「即將推出(coming soon)」,沒給日期、沒給計價,也還沒出現在官方 API 定價頁。

現行 API 上能用到的是前代模型,計價如下(來源是 xAI 官方開發者定價頁,這些不是 2.0):

模型計價說明
grok-imagine-image$0.02/image前代標準圖片模型
grok-imagine-image-quality$0.05/image前一代高品質模型,是 Imagine Image 2.0 的直接前代
grok-imagine-video-1.5$0.080/sec影片生成
grok-imagine-video$0.050/sec影片生成(前代)

一個容易踩的雷:不要把現行 API 上的長寬比、解析度、批次規格,當成 Imagine Image 2.0 的規格。那些是前代 grok-imagine-image-quality 的參數,2.0 還沒進 API,規格也沒公布。看到「Imagine Image 2.0 支援某某解析度」這種寫法,要先確認它講的到底是不是前代 API。

開發者現在能做的事其實有限,但也不是完全沒事做。第一件,用前代 API 把工作流程串好:上傳、生成、呼叫編輯、取回結果、儲存,這條流程不管底層模型怎麼換都適用,等 2.0 一開放就能無縫切換。第二件,用前代的計價做成本估算的「下限」:例如 grok-imagine-image-quality 每張 $0.05,想像一條「生成一張、編輯三次、智慧縮放兩個尺寸」的流程,成本大概是 $0.05 加上三次編輯與兩次縮放;2.0 的實際計價可能更高或更低,但這個估算讓你心裡有個底。

第三件,關注官方 API 定價頁與公告,而不是第三方流傳的計價。老實說,在官方沒給 2.0 計價之前,任何「每張多少錢」的數字都是猜的;要跟客戶報價或做產品定價的開發者,這段時間最好保守估計,或直接把「等 2.0 API 開放」列為專案里程碑,不要硬押日期。

用前代計價做一個保守的成本估算範例(示意)。假設你要做一個商品照批次產線:每個商品生成一張高品質圖(前代 $0.05)、做兩次局部編輯(假設編輯與生成同價,約 $0.10)、智慧縮放成三個尺寸(假設與生成同價,約 $0.15),單個商品大約落在 $0.30 上下的物料成本。一百個商品就是 $30 級別。這個數字只是用前代計價推估的下限,2.0 實際計價可能不同,但它給你一個量級感:這類批次產線的成本結構,主要瓶頸通常不在單張生成費,而在你需要多少次編輯與縮放。把編輯次數壓低,比壓低單價更能省錢。

適合誰用、不適合誰用

Imagine Image 2.0 現在的定位,決定了它適合哪些人,也決定了哪些人可以先跳過。

以適合與不適合兩側卡片呈現 Imagine Image 2.0 的使用情境與限制
它更適合需要反覆改圖、延伸版型與維持視覺一致的人;對 API 已上線、授權完全明確或零覆核需求則仍不合適。

適合的有三種人。第一種是「圖生成完要不斷精修」的創作者與行銷人,Magic Wand、多參考編輯、Smart Resize 這幾個能力直接打中電商照、社群素材、品牌視覺的反覆修改流程;對這種人來說,能局部改、不用每次整張重來,就是最直接的省時。第二種是已經在 Grok 工作流程裡的人,Imagine Image 2.0 對你而言是「同一個入口多了一個強模型」,學習成本最低,不用再換一套工具與帳號。第三種是想提前卡位的開發者,趁 API 還沒開放,先用前代把流程串好,等 2.0 一上線就能切換。

反過來說,幾種人現在可以先跳過。只用免費方案的人要保守期待,因為 Free 方案的功能清單沒有列出圖片生成,能不能用到 Quality Mode 還是問號,在官方確認之前別把工作流程賭在「免費就能用到 2.0」上。追求 Midjourney 那種風格美感的人也要留意,Imagine Image 2.0 的強項在編輯與擬真,藝術氛圍不是它的主戰場。至於馬上要把 API 接進產品的開發者,現階段只能排隊等 coming soon,沒有日期能承諾給客戶,產品時程用週計的人,選已經有 API 的方案更穩。

判斷的標準其實只有一條:你的工作流程是「生成一張就要改很多次」,還是「生成一張就交付」。用三個更具體的情境把這條判斷講清楚。情境一:你經營小型電商,每週上十幾個新品,每個都要白底圖、社群圖、EDM 橫幅三個尺寸,痛點是去背與換尺寸,Imagine Image 2.0 的範本加 Smart Resize 幾乎是為這個情境設計的。情境二:你是品牌設計師,做的是主視覺、包裝、海報,文字排版與字型選擇是成品的核心,這時 GPT-Image-2 的文字渲染目前仍領先,是這類工作首選,Imagine Image 2.0 可以當備案,還不宜當主力。情境三:你是自媒體或內容創作者,要的是直式限動與社群圖卡的快速產出,Imagine Image 2.0 的直式構圖與範本能加快產出,但品牌風格的一致性要靠你自己用多參考編輯去維持。這三種情境對應三種答案,沒有一個統一的「最好」。前者,Imagine Image 2.0 值得認真試;後者,美感取向的工具可能更順手。把這條標準放在前面,就不會被「全球第二」這種排行話術牽著走。排名、功能、計價這些短期內都還會變,反而是你的工作流程相對穩定,用它當判斷基準最不容易錯。

限制與不確定性:下結論前先知道

寫到這裡,把目前不確定的東西一次列清楚,免得讀者拿著過樂觀的判斷去做決策。

API 還沒開放,日期與計價都未定,這是最大的硬限制。免費方案能否用到圖片生成、每日張數上限、點數制或速率限制的具體數字,官方都沒公布,流傳數字不要採信。浮水印政策、訓練資料來源與授權、2.0 專屬的安全政策,也都未公布。這些空白意味著:任何關於「2.0 可以做到什麼、不能做什麼」的確定結論,目前都還太早。

Arena 排名是 xAI 自引、不是獨立評測,會變動,測的是主觀偏好;Imagine Image 2.0 是用 low 變體測的,票數偏少、誤差區間不小。把它當「客觀世界第二」是誤讀。Imagine Image 2.0 才剛上線一天,還沒有針對它的獨立實測;前代 Grok Imagine 模型曾被第三方比較點過的弱項,像手部結構、物體空間關係這類物理一致性,在 2.0 上是否改善,官方沒給數字、也還沒有可靠第三方驗證,只能當參考、不該當定論。

時效是最現實的限制。Imagine Image 2.0 發布才一天,功能、計價、API、排名都可能在短期內變動;關鍵事實都以 2026 年 8 月 7 日官方公告為準,過一陣子要重新確認。具體做法是把關鍵數字(發布日、Arena Elo、SuperGrok 月費、現行 API 計價)當成此刻的快照,兩到四週後回頭比對官方頁面,看哪些變了;尤其 API 開放時程與 Quality Mode 的方案門檻,是最可能率先更新的兩項。要理解 xAI 整條產品線的廣度(不只圖片,還有語音等其他入口),可以看 Grok Voice Agent 的整理,會更知道 Imagine Image 2.0 在 xAI 產品陣容裡的位置,以及它跟其他入口怎麼串。

常見問題

Imagine Image 2.0 免費嗎?要多少錢?

依照官方計價頁,Free 方案($0/月)的功能清單沒有列出圖片生成,SuperGrok($30/月)則明確列有 Image and video generation。但官方沒有明文說「Quality Mode 一定要 SuperGrok」,這是頁面結構推論。每日張數、點數制、速率限制的具體數字,官方都沒公布,看到「200/100 張」這類說法不要採信。

Imagine Image 2.0 跟 GPT-Image-2 比哪個好?

截至 2026 年 8 月 7 日,在 xAI 引述的 Arena 排行榜上,GPT-Image-2 在 Image Edit 與 Text-to-Image 兩個榜都是第一,Imagine Image 2.0 都是第二(low 變體)。要記得 Arena 是人群盲測投票,測主觀偏好,會變動。粗略講,GPT-Image-2 在文字渲染這一項被多數第三方比較認為領先,Imagine Image 2.0 的差異化則在生成後的精準編輯力。

Imagine Image 2.0 生成的圖能商用嗎?會有水印嗎?

商用條款的官方原文還沒公布,網路上的「可商用」說明多為第三方整理。水印政策官方也未公布。實務上建議留生成紀錄、避開受版權參考圖與具名人物品牌,正式商用稿等官方條款明朗再上線。

Imagine Image 2.0 的 API 何時開放?

官方只說「即將推出(coming soon)」,沒給日期也沒給計價。現行 API 上的是前代模型,grok-imagine-image-quality 每張 $0.05 是 2.0 的直接前代,不要把它當成 2.0 的規格或計價。

Imagine Image 2.0 支援中文 prompt 嗎?中文文字渲染行不行?

官方公告沒有針對中文 prompt 與中文文字渲染做專門說明;它強調的文字渲染能力,指的是 typography 與 layout 的整齊與小字銳利,但中文實際表現要等獨立實測或使用者回報才會比較清楚。中文使用建議保守看待,先用自己熟悉的測試圖試一輪再投入正式流程。

Imagine Image 2.0 怎麼用?第一次從哪裡開始?

到 grok.com/imagine 或打開 Grok App,把模式切到 Quality Mode,登入帳號就能開始。第一次建議先挑一個範本當起點,例如要做商品照就選 E-Commerce Photos,給它一張你自己的圖當參考,用 Magic Wand 改掉背景或某個細節,看它能不能只動你指的範圍;接著用 Smart Resize 把同一張圖轉成直式與橫式兩個版本,檢查邊緣有沒有補出奇怪的東西。這條最短路徑跑完,你大概就知道它適不適合你的產線。如果切不到 Quality Mode,代表你目前的方案可能不支援,這時再回頭看計價。

Magic Wand 怎麼用?

Magic Wand 是 Imagine Image 2.0 的局部編輯入口,邏輯是「你指到哪裡,它只改那個區域,其餘不動」。常見情境(示意):在一張已生成的圖上,點選要改的物件或區域,下指令描述想要的變化,模型只動那個範圍。它配合 Segmentation 能做更精確的選取,是 Imagine Image 2.0 跟一般「重抽型」工具拉開差距的關鍵功能。

Imagine Image 2.0 是什麼時候發布的?

2026 年 8 月 7 日由 xAI 發布,已正式上線(generally available),透過 grok.com/imagine 與 Grok iOS/Android App 的 Quality Mode 提供。API 則尚未開放。

Imagine Image 2.0 的判斷,繞回開頭那句:生成只是起點,能不能精準改才是它想贏的地方。如果你的工作流程是反覆修改、也願意承擔一個才一天新的產品必然帶來的不確定性,那就到 grok.com/imagine 開 Quality Mode,拿一張你手邊真的要改的圖去試 Magic Wand。

留下你的問題或補充

你的電子郵件不會被公開。