
它像设计师那样先规划版面
xAI 在 2.0 里改得最明显的是排版。模型不再把文字撒在画面上,而是先把层级理出来——大标题、副标题、图注、标签——然后再渲染。所以信息图、海报、包装样稿这类信息密集的东西能立得住,不会在小字号上散架。独立对比认为它在富有表现力的编辑腔调上略逊于 GPT Image 2,但在干净的信息层级上更强:如果需求是「把这个做得清楚、有条理」,它是更好的选择。
Grok Imagine Image 2.0 一个模型干两件事——给文字就生成,附参考图就编辑。不用切换模式,也不用订阅 X。
Grok Imagine Image 2.0 是 xAI 的图像模型,2026 年 8 月 7 日发布,就是 Grok Imagine 里的 Quality Mode。独立测试认为它的强项在写实、身份保持和信息层级——文字是排进一个真实版式里的,不是浮在画面上的。它在这里按张计费,浏览器里就能跑,不用 X 订阅,也没有八小时的额度窗口。
短板很具体。没有 4K 这一档,印刷尺寸的活儿得去别处做。独立测试发现它在编辑可靠性上落后于 GPT Image 2——一次编辑更可能要再跑第二遍——在非拉丁文字上也落后,这一块远不如它的英文排版会让你预期的那么可靠。真正把一张照片重新诠释成另一种媒介的风格迁移,也不是它的长处。
2026 年 8 月作为 Grok 里的 Quality Mode 发布,在文生图和图像编辑两个竞技场上都排第 2,只输给 GPT Image 2。在这里它按张计费、在浏览器里跑,不需要 X 订阅,也没有每八小时重置的额度。

xAI 在 2.0 里改得最明显的是排版。模型不再把文字撒在画面上,而是先把层级理出来——大标题、副标题、图注、标签——然后再渲染。所以信息图、海报、包装样稿这类信息密集的东西能立得住,不会在小字号上散架。独立对比认为它在富有表现力的编辑腔调上略逊于 GPT Image 2,但在干净的信息层级上更强:如果需求是「把这个做得清楚、有条理」,它是更好的选择。

在多家独立的同题对比里,反复出现的结论是:Grok 在写实度、以及在一次生成中保住人物身份这两件事上领先——而这正是 AI 图片平时最容易露馅的地方。它在 Arena 文生图榜上排第 2(Elo 1320),编辑榜上也排第 2(1439),两项都在 GPT Image 2 之后。这就是差距的准确描述:接近,但不平手。

大多数图像模型一个方向上停在 21:9,另一个方向上停在 9:16。这个模型给了十三种画面比例,两头都还往外走:2:1、19.5:9 和 20:9 做电影感的画幅,以及它们的竖版孪生比例做满屏手机画面。下面这张是 20:9;再往下那张松岭壁纸是 9:19.5。两张都不是裁出来的——构图就是按这个画幅做的,这就是「一张成立的横幅」和「一张被切掉天空的风景照」之间的区别。如果你宁愿让模型自己选,也有 auto。
全部七张图都是 2026 年 8 月 15 日在这里生成的,每张都是一次出图,提示词与参数原样展示——没有修图,也没有从更大一批里挑好的。耗时是实测值,不是引用:2K 中档 74–118 秒,1K 低档 27 秒。

A clean modern infographic poster titled 'HOW A HEAT PUMP WORKS' with four numbered stages — ABSORB, COMPRESS, RELEASE, EXPAND — each stage with a simple flat-design icon, a bold stage label and one short caption line of body copy underneath, plus a small footnote line at the bottom, warm neutral palette with terracotta accents, strict grid layout, legible sans-serif typography at every size.

Magazine cover for a design magazine called 'GRAIN': masthead 'GRAIN' in a heavy serif across the top, a ceramicist's hands shaping clay on a wheel in warm window light, cover lines reading 'The Slow Materials Issue', 'Kilns of Northern Japan' and 'What Hands Know', each with a smaller supporting deck line in light type, issue number and date in the corner, genuinely typeset editorial hierarchy.

Available-light portrait of a man in his fifties in a workshop doorway, weathered skin with visible pores and sun lines, grey stubble, soft overcast key light from the left with a warm bounce from the wood interior, honest unretouched photographic texture, shallow depth of field, 85mm lens.

Studio packaging photograph of a matte kraft coffee bag standing on pale concrete, front label reading 'NORTHBOUND' in confident sans-serif with a smaller line beneath: 'Ethiopia · Washed · Roasted 04.08', a small circular roaster's stamp in the corner, soft directional light, shallow depth of field, all text crisp and correctly spelled.

Ultra-wide cinematic frame of a coastal highway at blue hour, a single car's tail lights streaking along the curve, wet asphalt reflecting the last band of orange on the horizon, distant headland silhouettes, anamorphic flare, moody teal-and-amber grade.

Vertical full-screen phone wallpaper: a misty pine ridge at dawn seen from above the cloud layer, layered blue-grey depth planes receding into distance, a thin band of warm sunrise light along the top ridge, minimal and calm, no text.

Overhead flat-lay of a weekend breakfast on a linen tablecloth: soft-boiled eggs, sourdough toast, a small bowl of berries and a stovetop espresso pot, warm morning window light, natural food photography.
下面每一条都对应这一页上面已经演示过的东西,不是一张愿望清单。
一个标题、编号的步骤、每一步一行说明、一条脚注,全部排成真正的层级,而不是浮在一张图上面。这正是 2.0 的排版改进所针对的活儿,而这一页的第一张图就是这样一份需求单。
正面标签、辅助文案、烘焙商的印章——这些短字符串必须拼写正确,而且要待在你要求的位置上。文案保持简短;这个模型在短文案上才准。
毛孔、晒纹、花白胡茬和现场自然光,而不是修过图的那层光泽。照片级真实感和身份保持,是独立测试一直算在它头上的两项。
先用提示词出一版草图,再把它当参考图挂回去,说清要改什么——同一个模型,同一个页面,不用换工具,也不用重新传进编辑器。
这里没有 4K 这一档,编辑比在 GPT Image 2 上更容易需要重跑第二遍,而非拉丁文字是它文字渲染里最弱的一环。这三类活儿请换模型——所有模型都在同一个工作区里,换一次只要点一下。
在这个工作区里,每一个模型各收多少积分、各给你什么——读自我们自己的注册表,不是厂商页面。
| Grok Imagine Image 2.0 | GPT Image 2 | Seedream 5 Pro | |
|---|---|---|---|
| 每张输出图的积分 | 1K 低档 40 · 1K 中档 60 · 2K 低档 60 · 2K 中档 80 | 5 到 560,取决于 分辨率 × 质量 | 1K 50 积分 · 2K 100 积分 |
| 分辨率档位 | 1K、2K | 1K、2K、4K | 1K、2K |
| 画质档位 | 低、中——与分辨率分开设置 | 低、中、高——与分辨率分开设置 | 没有——价格只跟随分辨率 |
| 每次请求的参考图数量 | 最多 3 张 | 最多 16 张 | 最多 5 张 |
| 参考图怎么计费 | 每张 5 积分,每次请求只收一次 | 每张 10 积分,再乘以批量数量 | 不额外收费 |
| 每次出图数量 | 最多 10 张 | 最多 10 张 | 一张——Pro 档不做批量 |
| 宽高比 | 7 个预设,从 1:1 到 16:9 | 15 个预设,最外到 3:1 和 1:3 | 10 个预设外加 auto,最外到 21:9 |
| 我们实测的生成时间 | 1K 低档 27 秒 · 2K 中档 74–118 秒(7 次) | 2K 下低档 32 秒 · 中档 68 秒 · 高档 166 秒(各一次) | 1K 约 87 秒 · 2K 约 107 秒(15 次) |
积分、档位、参考图上限和比例数量,都是 2026 年 8 月 20 日从这个工作区自己的模型注册表里读出来的——它们描述的是你在这里能拿到什么,不是厂商公布了什么。比例数量不含「auto」,那是一个设置项,不是一个比例。时间是我们自己的实测,取自各模型页面上已发布的那些生成,并注明了样本量;我们没有让这三个模型跑同一条基准提示词,所以请把它们读作量级参考,而不是正面对比。
把 Grok Imagine Image 2.0 和其他图像模型放在一起比——同一个工作台,一键切换。
| 模型 | grok-imagine-image-2.0,来自 xAI——2026 年 8 月 7 日作为 Grok Imagine 的 Quality Mode 发布 |
|---|---|
| 模式 | 文生图和图生图在同一个模型里——附上参考图就是切换的方式 |
| 分辨率档位 | 1K 和 2K。没有 4K 这一档。 |
| 画质档位 | 低和中,与分辨率各自独立选择——所以四种组合都能用 |
| 宽高比 | 7 个预设——1:1、4:3、3:4、16:9、9:16、3:2、2:3——外加 auto |
| 每次出图数量 | 最多 10 张 |
| 参考图 | 每次请求最多 3 张 |
| 参考图怎么计费 | 每张附上的图 5 积分,按整次请求收一次,而不是每张输出图收一次——所以批量能把这笔成本摊薄 |
| 每张输出图的积分 | 1K 低档 40 · 1K 中档 60 · 2K 低档 60 · 2K 中档 80 |
| 应用内编辑工具 | 没有——魔棒、分割和抠背景是 xAI 自家应用的功能,不是模型的功能。这里的编辑靠提示词驱动。 |
| 实测速度 | 1K 低档 27 秒;2K 中档 74–118 秒——我们在 2026 年 8 月 15 日的 7 次生成 |
从空白提示词框到一张成品图,只要三步。
打开模型选择器,选中 Grok Imagine Image 2.0。在你花掉任何积分之前,面板就会显示它的积分费用、分辨率选项与画面比例。
写清主体、场景、光线与质感。如果模型支持,可以附上参考图。
下载结果,或继续加工——编辑、换风格、放大,或让它动起来变成视频。每次生成都会保留提示词与参数。
一个账户,打通图像与视频生成全流程。
用免费套餐的每日积分跑 Grok Imagine Image 2.0,或升级以解锁高级模型、更快的生成速度和 4K 产出。
按年计费 · $240/year
xAI 的图像模型,2026 年 8 月 7 日作为 Grok Imagine 里的 Quality Mode 发布。同一个模型同时覆盖文生图与图像编辑——你拿到的是哪一种,只取决于你有没有附参考图。
在文生图和图像编辑两个竞技场上都排第 2,两项都在 GPT Image 2 之后(生成 Elo 1320 对 1380,编辑 1439 对 1463)。独立的同题对比认为它的强项是写实度、身份保持和干净的信息层级,弱项是编辑可靠性、多语言文字和风格迁移。
在这里不需要。在 xAI 自家平台上,图像生成和编辑都在付费订阅之后,而且有用户反映额度被大幅削减。在 CreateVision AI 上按张付费、40 积分起,不强制订阅、不需要 API Key,也没有每八小时重置一次的额度窗口。
每张图 40 积分起。1K 低质量档 40 积分、中档 60;2K 分别是 60 和 80。每张参考图加 5 积分,按请求收一次而不是按产出图收,所以批量做参考图编辑的单张成本比反复做要低。按你当前参数算出的总额,会在生成前显示在按钮上。
不包含——那些是 xAI 自家应用里的交互工具,不属于模型 API。这里的编辑靠提示词:最多附 3 张参考图,用文字描述要改什么。想点选式去背景,请改用专门的 AI 背景移除工具。
在这个工作台上最多 3 张。xAI 自家应用能收更多,但这个模型跑的那套 API 上限就是 3——我们宁可写真实数字,也不写营销数字。
两档分辨率,1K 和 2K——没有 4K。七种画面比例:1:1、4:3、3:4、3:2、2:3、16:9 和 9:16。这个模型没有自动模式,所以开跑前先把画幅选好。
低档是快速档,约十秒,用来打草稿、试提示词的措辞。中档更久——xAI 给的区间是十到七十五秒——细节更多。两个档位与分辨率互不绑定,都能和 1K 或 2K 组合。
生成前后的活儿都有一键工具——修饰、换风格、直接分享。
Grok Imagine Image 2.0 (xAI) integrated — text-to-image and image editing share one model, 1K/2K at two speed tiers, up to 3 reference images and batch up to 10. No API key or X Premium subscription needed.