
它像設計師那樣先規劃版面
xAI 在 2.0 裡改得最明顯的是排版。模型不再把文字撒在畫面上,而是先把層級理出來——大標題、副標題、圖說、標籤——然後再算圖。所以資訊圖、海報、包裝樣稿這類資訊密集的東西能立得住,不會在小字級上散架。獨立對比認為它在富有表現力的編輯腔調上略遜於 GPT Image 2,但在乾淨的資訊層級上更強:如果需求是「把這個做得清楚、有條理」,它是更好的選擇。
Grok Imagine Image 2.0 一個模型幹兩件事——給文字就生成,附參考圖就編輯。不用切換模式,也不用訂閱 X。
Grok Imagine Image 2.0 是 xAI 的圖像模型,2026 年 8 月 7 日發布,就是 Grok Imagine 裡的 Quality Mode。獨立測試認為它的強項在寫實、身分保持和資訊層級——文字是排進一個真實版面裡的,不是浮在畫面上的。它在這裡按張計費,瀏覽器裡就能跑,不用 X 訂閱,也沒有八小時的額度視窗。
短板很具體。沒有 4K 這一檔,印刷尺寸的活得去別處做。獨立測試發現它在編輯可靠性上落後 GPT Image 2——一次編輯更可能要再跑第二遍——在非拉丁文字上也落後,這一塊遠不如它的英文排版會讓你預期的那麼可靠。真正把一張照片重新詮釋成另一種媒介的風格轉換,也不是它的長處。
2026 年 8 月作為 Grok 裡的 Quality Mode 發布,在文生圖和影像編輯兩個競技場上都排第 2,只輸給 GPT Image 2。在這裡它按張計費、在瀏覽器裡跑,不需要 X 訂閱,也沒有每八小時重置的額度。

xAI 在 2.0 裡改得最明顯的是排版。模型不再把文字撒在畫面上,而是先把層級理出來——大標題、副標題、圖說、標籤——然後再算圖。所以資訊圖、海報、包裝樣稿這類資訊密集的東西能立得住,不會在小字級上散架。獨立對比認為它在富有表現力的編輯腔調上略遜於 GPT Image 2,但在乾淨的資訊層級上更強:如果需求是「把這個做得清楚、有條理」,它是更好的選擇。

在多家獨立的同題對比裡,反覆出現的結論是:Grok 在寫實度、以及在一次生成中保住人物身分這兩件事上領先——而這正是 AI 圖片平時最容易露餡的地方。它在 Arena 文生圖榜上排第 2(Elo 1320),編輯榜上也排第 2(1439),兩項都在 GPT Image 2 之後。這就是差距的準確描述:接近,但不平手。

大多數圖像模型一個方向停在 21:9,另一個方向停在 9:16。這個模型給了十三種畫面比例,兩頭都還往外走:2:1、19.5:9 和 20:9 做電影感的畫幅,以及它們的直式孿生比例做滿版手機畫面。下面這張是 20:9;再往下那張松嶺桌布是 9:19.5。兩張都不是裁出來的——構圖就是照這個畫幅做的,這就是「一張成立的橫幅」和「一張被切掉天空的風景照」之間的差別。如果你寧願讓模型自己選,也有 auto。
全部七張圖都是 2026 年 8 月 15 日在這裡生成的,每張都是一次出圖,提示詞與參數原樣展示——沒有修圖,也沒有從更大一批裡挑好的。耗時是實測值,不是引用:2K 中檔 74–118 秒,1K 低檔 27 秒。

A clean modern infographic poster titled 'HOW A HEAT PUMP WORKS' with four numbered stages — ABSORB, COMPRESS, RELEASE, EXPAND — each stage with a simple flat-design icon, a bold stage label and one short caption line of body copy underneath, plus a small footnote line at the bottom, warm neutral palette with terracotta accents, strict grid layout, legible sans-serif typography at every size.

Magazine cover for a design magazine called 'GRAIN': masthead 'GRAIN' in a heavy serif across the top, a ceramicist's hands shaping clay on a wheel in warm window light, cover lines reading 'The Slow Materials Issue', 'Kilns of Northern Japan' and 'What Hands Know', each with a smaller supporting deck line in light type, issue number and date in the corner, genuinely typeset editorial hierarchy.

Available-light portrait of a man in his fifties in a workshop doorway, weathered skin with visible pores and sun lines, grey stubble, soft overcast key light from the left with a warm bounce from the wood interior, honest unretouched photographic texture, shallow depth of field, 85mm lens.

Studio packaging photograph of a matte kraft coffee bag standing on pale concrete, front label reading 'NORTHBOUND' in confident sans-serif with a smaller line beneath: 'Ethiopia · Washed · Roasted 04.08', a small circular roaster's stamp in the corner, soft directional light, shallow depth of field, all text crisp and correctly spelled.

Ultra-wide cinematic frame of a coastal highway at blue hour, a single car's tail lights streaking along the curve, wet asphalt reflecting the last band of orange on the horizon, distant headland silhouettes, anamorphic flare, moody teal-and-amber grade.

Vertical full-screen phone wallpaper: a misty pine ridge at dawn seen from above the cloud layer, layered blue-grey depth planes receding into distance, a thin band of warm sunrise light along the top ridge, minimal and calm, no text.

Overhead flat-lay of a weekend breakfast on a linen tablecloth: soft-boiled eggs, sourdough toast, a small bowl of berries and a stovetop espresso pot, warm morning window light, natural food photography.
下面每一條都對應這一頁上面已經演示過的東西,不是一張願望清單。
一個標題、編號的步驟、每一步一行說明、一條註腳,全部排成真正的層級,而不是浮在一張圖上面。這正是 2.0 的排版改進所針對的活,而這一頁的第一張圖就是這樣一份需求。
正面標籤、輔助文案、烘豆商的印章——這些短字串必須拼寫正確,而且要待在你要求的位置上。文案保持簡短;這個模型在短文案上才準。
毛孔、曬紋、花白鬍碴和現場自然光,而不是修過圖的那層光澤。照片級真實感和身分保持,是獨立測試一直算在它頭上的兩項。
先用提示詞出一版草圖,再把它當參考圖掛回去,說清楚要改什麼——同一個模型、同一個頁面,不用換工具,也不用重新上傳到編輯器裡。
這裡沒有 4K 這一檔,編輯比在 GPT Image 2 上更容易需要重跑第二遍,而非拉丁文字是它文字渲染裡最弱的一環。這三類活請換模型——所有模型都在同一個工作區裡,換一次只要點一下。
在這個工作區裡,每一個模型各收多少點數、各給你什麼——讀自我們自己的註冊表,不是廠商頁面。
| Grok Imagine Image 2.0 | GPT Image 2 | Seedream 5 Pro | |
|---|---|---|---|
| 每張輸出圖的點數 | 1K 低畫質 40 · 1K 中畫質 60 · 2K 低畫質 60 · 2K 中畫質 80 | 5 到 560,取決於解析度 × 畫質 | 1K 50 點數 · 2K 100 點數 |
| 解析度檔位 | 1K, 2K | 1K, 2K, 4K | 1K, 2K |
| 品質分級 | 低、中——與解析度分開設定 | 低、中、高——與解析度分開設定 | 沒有——價格只跟著解析度走 |
| 每次請求的參考圖數量 | 最多 3 張 | 最多 16 張 | 最多 5 張 |
| 參考圖怎麼計費 | 每張 5 點數,每次請求只收一次 | 每張 10 點數,再乘上批次張數 | 不加收費用 |
| 每次出圖數量 | 最多 10 張 | 最多 10 張 | 一張——Pro 檔不做批次 |
| 長寬比 | 7 種預設,從 1:1 到 16:9 | 15 種預設,最外到 3:1 和 1:3 | 10 種預設外加 auto,最外到 21:9 |
| 我們實測的生成時間 | 1K 低畫質 27s · 2K 中畫質 74–118s(7 次) | 2K 下低畫質 32s · 中畫質 68s · 高畫質 166s(各一次) | 1K 約 87s · 2K 約 107s(15 次) |
點數、檔位、參考圖上限和比例數量,都是 2026 年 8 月 20 日從這個工作區自己的模型註冊表裡讀出來的——它們描述的是你在這裡能拿到什麼,不是廠商公布了什麼。比例數量不含「auto」,那是一個設定項,不是一個比例。時間是我們自己的實測,取自各模型頁面上已發布的那些生成,並註明了樣本量;我們沒有讓這三個模型跑同一條基準提示詞,所以請把它們讀作量級參考,而不是正面對比。
把 Grok Imagine Image 2.0 和其他影像模型放在一起比——同一個工作台,一鍵切換。
| 模型 | grok-imagine-image-2.0,來自 xAI——2026 年 8 月 7 日作為 Grok Imagine 的 Quality Mode 發布 |
|---|---|
| 模式 | 文生圖和圖生圖在同一個模型裡——附上參考圖就是切換的方式 |
| 解析度檔位 | 1K 和 2K。沒有 4K 這一檔。 |
| 品質分級 | 低和中,與解析度各自獨立選擇——所以四種組合都能用 |
| 長寬比 | 7 種預設——1:1、4:3、3:4、16:9、9:16、3:2、2:3——外加 auto |
| 每次出圖數量 | 最多 10 張 |
| 參考圖片 | 每次請求最多 3 張 |
| 參考圖如何計費 | 每張附上的圖 5 點數,按整次請求收一次,而不是每張輸出圖收一次——所以批次能把這筆成本攤薄 |
| 每張輸出圖的點數 | 1K 低畫質 40 · 1K 中畫質 60 · 2K 低畫質 60 · 2K 中畫質 80 |
| 應用程式內建的編輯工具 | 沒有——魔術棒、分割和去背是 xAI 自家應用程式的功能,不是模型的功能。這裡的編輯靠提示詞驅動。 |
| 實測速度 | 1K 低畫質 27s;2K 中畫質 74–118s——我們在 2026 年 8 月 15 日的 7 次生成 |
從空白的提示詞欄位到一張成品圖,只要三個步驟。
打開模型選擇器,選中 Grok Imagine Image 2.0。在你花掉任何積分之前,面板就會顯示它的積分費用、解析度選項與畫面比例。
寫清楚主體、場景、光線與質感。若模型支援,可附上參考圖。
下載成品,或繼續加工——編輯、換風格、放大,或讓它動起來變成影片。每次生成都會保留提示詞與參數。
一個帳號,完整的圖像與影片生成工作流程。
用免費方案的每日積分跑 Grok Imagine Image 2.0,或升級以解鎖進階模型、更快的生成速度和 4K 產出。
年繳 · $240/year
xAI 的影像模型,2026 年 8 月 7 日作為 Grok Imagine 裡的 Quality Mode 發布。同一個模型同時涵蓋文生圖與影像編輯——你拿到的是哪一種,只取決於你有沒有附參考圖。
在文生圖和影像編輯兩個競技場上都排第 2,兩項都在 GPT Image 2 之後(生成 Elo 1320 對 1380,編輯 1439 對 1463)。獨立的同題對比認為它的強項是寫實度、身分保持和乾淨的資訊層級,弱項是編輯可靠性、多語言文字和風格遷移。
在這裡不需要。在 xAI 自家平台上,影像生成和編輯都在付費訂閱之後,而且有使用者反映額度被大幅削減。在 CreateVision AI 上按張付費、40 積分起,不強制訂閱、不需要 API Key,也沒有每八小時重置一次的額度視窗。
每張圖 40 積分起。1K 低品質檔 40 積分、中檔 60;2K 分別是 60 和 80。每張參考圖加 5 積分,按請求收一次而不是按產出圖收,所以批次做參考圖編輯的單張成本比反覆做要低。按你目前參數算出的總額,會在生成前顯示在按鈕上。
不包含——那些是 xAI 自家應用裡的互動工具,不屬於模型 API。這裡的編輯靠提示詞:最多附 3 張參考圖,用文字描述要改什麼。想點選式去背,請改用專門的 AI 背景移除工具。
在這個工作台上最多 3 張。xAI 自家應用能收更多,但這個模型跑的那套 API 上限就是 3——我們寧可寫真實數字,也不寫行銷數字。
兩檔解析度,1K 和 2K——沒有 4K。七種畫面比例:1:1、4:3、3:4、3:2、2:3、16:9 和 9:16。這個模型沒有自動模式,所以開跑前先把畫幅選好。
低檔是快速檔,約十秒,用來打草稿、試提示詞的措辭。中檔更久——xAI 給的區間是十到七十五秒——細節更多。兩個檔位與解析度互不綁定,都能和 1K 或 2K 組合。
生成前後的工作都有一鍵工具——修飾、換風格、直接分享。
Grok Imagine Image 2.0 (xAI) integrated — text-to-image and image editing share one model, 1K/2K at two speed tiers, up to 3 reference images and batch up to 10. No API key or X Premium subscription needed.