01
Grok Imagine Image 2.0 API:精准遵循复杂提示词,清晰呈现文字排版
不再只做大致匹配。Grok Imagine Image 2.0 面向多元素构图、精细视觉要求和可读文字设计,可用于布局与排版本身就是创作目标的内容。
- 保留指定物体、光线与材质细节
- 生成结构清晰的海报、广告与信息图
- 提升标题与画面内标签的可读性

透明定价,无隐藏费用。按量付费,用多少付多少。
| 型号 | 规格 | PoYo价格 | 官方价格 | 为你节省 |
|---|---|---|---|---|
Low quality - 1K | $0.040/张 8 积分 /张 | - | - | |
Medium quality - 1K | $0.060/张 12 积分 /张 | - | - | |
Low quality - 2K | $0.060/张 12 积分 /张 | - | - | |
Medium quality - 2K | $0.080/张 16 积分 /张 | - | - | |
Input image surcharge | $0.010/张 2 积分 /张 | - | - |
* 实际费用以最终输出为准。
使用 快速且高性价比的 Grok Imagine Image 2.0 API 的完整指南
Grok Imagine Image 2.0 是 xAI 的高保真图像生成与原生编辑模型,支持复杂提示词、清晰文字和精准局部编辑。
PoYo API 现已开放,支持最多 3 张输入图、5 种固定宽高比、1K 或 2K 输出、low 或 medium 质量,以及单次最多 4 张输出图。
通过四组能力示例了解图像生成、局部编辑、多参考融合与灵活构图。
01
不再只做大致匹配。Grok Imagine Image 2.0 面向多元素构图、精细视觉要求和可读文字设计,可用于布局与排版本身就是创作目标的内容。

02
Magic Wand 与分割工具让局部编辑成为原生工作流。选择主体、商品、背景或某个细节,用自然语言说明改动,同时尽量保持其余构图稳定。

03
把不同主体、商品、风格和场景参考放入同一条提示词。多参考图输入旨在减少手工合成,让团队更高效地制作一致的广告系列、角色和视觉系统。

04
Smart Resize 可为方形、竖版和横版画幅重新构图并扩展内容。一个确认后的创意方向可以更快适配商品图、社交素材、UI 资产、海报和广告变体。

制作商品图、包装概念、颜色变体、透明抠图与生活方式场景,同时保持核心商品清晰可辨。
通过更强的构图和更快的创意迭代,制作广告视觉、社交帖子、缩略图与多尺寸素材。
将结构化需求转化为标题清晰、标签可读的海报、标牌、解说图与信息密集型版式。
在概念帧、故事板、游戏资产和插画序列中保持角色身份、重复细节和整体视觉风格。
把结构化需求转化为界面概念、图标、道具和设计探索,并保持清晰的视觉层级。
精准调整局部细节、更换背景、组合参考图,并在不重做整张图片的情况下延展已确认的方向。
从生成质量、编辑深度、参考图能力、输出控制与视频工作流对比三款 xAI 图像模型。Grok Imagine Image 2.0 专注可交付图像生成与原生精准编辑,Grok Imagine Image Quality 侧重精细的 1K 和 2K 输出,Grok Imagine 则支持快速创意模式、参考图变体与图生视频。
| 能力 | Grok Imagine Image 2.0 | Grok Imagine Image Quality | Grok Imagine |
|---|---|---|---|
| 适合场景 | 可交付图像生成、原生局部编辑与多参考图构图 | 高保真 1K 或 2K 生成与参考图引导编辑 | 快速创意探索、图像变体与图生视频 |
| 提示词遵循与文字表现 | 精准理解复杂提示词,清晰呈现画面文字与结构化排版 | 稳定遵循提示词,呈现精细细节与可靠的视觉保真度 | 通过 Fun、Normal 与 Spicy 创意模式快速理解提示词 |
| 图像生成与编辑方式 | 文生图、Magic Wand、分割、背景工具与迭代式局部编辑 | 文生图与结合参考图的提示词引导编辑 | 快速文生图、创意模式、参考图变体与图生视频 |
| 局部编辑精度 | 通过 Magic Wand 与分割工具修改选中区域并保持其余构图 | 通过提示词与参考图引导更大范围的画面编辑 | 生成参考图变体,不采用选区式局部编辑 |
| 参考图能力 | 单次工作流最多使用 3 张参考图 | 支持可选输入图进行参考图引导编辑 | 支持可选参考图 |
| 输出尺寸、画幅与格式控制 | 5 种宽高比,支持 Smart Resize 与智能扩图 | 1K 或 2K 输出,以及 low 或 medium 质量 | 支持 2:3、3:2 或 1:1 图像输出 |
| 视频工作流 | 仅生成静态图片;动态内容可使用 Grok Imagine Video 1.5 | 仅支持图像生成与编辑 | 内置支持同步音频的图生视频工作流 |
使用同一 PoYo 账户和认证方式连接图像、视频、音频及其他 AI 模型。
在 PoYo 生成模型之间复用任务提交、task ID、状态查询与结果获取流程。
主动查询任务状态或接收 Webhook 回调,将完成的图像接入自动化生产流程。
无需切换平台,即可将确认后的静态图继续交给 Grok Imagine Video 1.5 或其他 PoYo 视频模型。