
Qwen Image 3.0 是 Qwen 团队推出的第三代图像基础模型。该模型于 2026 年 7 月 21 日公布,旨在推动 AI 图像生成从制作具有吸引力的独立图片,进一步发展到能够承载有用信息的视觉内容:报纸、教育图形、分镜、界面概念、带注释图像,以及其他信息密集型设计内容。
其核心升级包括 4.5K-token 指令长度限制、最小 10 像素文本渲染能力、跨 12 种语言的原生渲染能力、支持 20+ 种字体和 100+ 种视觉风格,以及更强的视觉与世界知识运用能力。该模型支持文本和图像输入,并可同时执行图像生成和图像编辑任务。
这些能力很有潜力,但部分上游信息仍未公开:Qwen 尚未公布参数量、详细架构、原生或最大分辨率、许可证、本地硬件要求和开放权重计划。另一方面,PoYo 现已提供生产 API,包含两个模型 ID、可选的 1K/2K 输出和公开的按图计费标准。
Qwen Image 3.0 一览
| 功能 | 已确认信息 |
|---|---|
| 官方名称 | Qwen-Image-3.0 |
| 公布时间 | July 21, 2026 |
| 模型类型 | 图像生成与编辑基础模型 |
| 输入 | 文本和图像 |
| 输出 | 图像 |
| 最大指令长度 | 4.5K tokens |
| 小文本渲染 | 最小约 10px 的文本 |
| 语言 | 跨 12 种语言原生渲染 |
| 字体 | 超过 20 种 |
| 视觉风格 | 超过 100 种 |
| QwenCloud 上游模型 ID | qwen-image-3.0-pro |
| PoYo 模型 ID | qwen-image-3, qwen-image-3-pro |
| PoYo API 状态 | 现已可用 |
| PoYo 输出选项 | 1K, 2K |
| 参数量 | 未披露 |
| 最大分辨率 | 未披露 |
| 开放权重和许可证 | 未披露 |
官方发布内容通过三个理念介绍该模型:Rich Content(丰富内容)、Authentic Details(真实细节)和 Deep Knowledge(深度知识)。Qwen 用一个更广泛的主题“Real”概括这些能力——不仅是照片级真实感,还包括足够充实且具有实际用途的内容。
Qwen Image 3.0 有哪些新变化?
早期 Qwen Image 版本建立了该模型系列在文字排版和精准图像编辑方面的声誉。随后推出的 Qwen Image 2.0 将生成和编辑能力统一到一个模型中,支持原生 2K 输出,并可接受最长 1K tokens 的指令。
Qwen Image 3.0 扩展了一次请求中可处理的信息量和复杂程度。指令长度从 1K tokens 提升至 4.5K tokens,同时官方示例更加关注密集布局、嵌套界面、小文本、公式、多语言内容和知识丰富型图形。
| 领域 | Qwen Image 2.0 | Qwen Image 3.0 |
|---|---|---|
| 指令长度 | 最多 1K tokens | 最多 4.5K tokens |
| 生成与编辑 | 在一个模型中统一支持 | 两者均支持 |
| 原生分辨率 | 已披露 2K | 尚未披露 |
| 主要侧重点 | 字体排版、语义遵循、照片级真实感 | 丰富内容、精细细节、深度知识 |
| 密集小文本 | 改进文本渲染 | 官方展示约 10px 渲染能力 |
| 复杂布局 | 海报、幻灯片、漫画、信息图 | 报纸、试卷、分镜、嵌套界面、多面板图形 |
此对比不应被理解为 Qwen Image 3.0 的每一次输出都会自动更加准确。它描述的是 Qwen 已公布的能力和定位。仍需通过独立、可重复的测试评估模型在不同提示词下的一致性。
丰富内容:更长提示词与更密集布局
4.5K-token 输入限制是 Qwen Image 3.0 最明显的变化之一。它允许提示词描述更多区域、标签、关系和视觉规则,而无需将完整需求压缩成几句话。
这并不意味着图像会包含 4,500 tokens 的完美渲染文本。它表示模型可以接受这一长度的指令,其中包括内容、布局、风格、排版和空间关系描述。
单次生成多面板视觉内容
在一个官方示例中,Qwen Image 3.0 一次生成完整的 3×3 教育网格图。其约 3.7K-token 提示词描述了九个不同主题,包括几何、物理、生物、医学、文学、银行和抽象代数。每个面板都包含插图、公式、图表、中英文文本,以及独立的视觉层级。
该示例测试的不只是提示词长度。模型需要保持多个概念相互独立,将内容放置在指定区域,并防止一个面板中的内容泄漏到另一个面板。
这种能力可能适用于:
- 教育海报和课程材料
- 编辑版面和报纸风格页面
- 产品对比网格
- 短剧和广告分镜
- 试卷和练习册
- 菜单、目录和视觉报告
嵌套图像与界面
Qwen 还展示了垂直或嵌套复杂度。其中一个提示词要求模型将 VS Code 界面放置在 Qwen Chat 界面周围,而 Qwen Chat 界面中又包含一个微信界面,微信界面中进一步包含一张咖啡海报。
这种图像中的图像任务会测试语义嵌套、相对比例、界面知识,以及模型保持多层内容结构的能力。它尤其适用于 UI 概念、软件插图、屏幕广告和编辑图形。
真实细节:小文本与真实纹理
Qwen 使用“Authentic Details”描述字体排版和物理细节。该模型旨在渲染密集文本内容,同时提升让人物、物体和材质更加可信的小型视觉特征。
最小 10 像素文本
Qwen 表示 Qwen Image 3.0 可以渲染约 10px 大小的可读文本。官方示例包括:
- 高文本密度的鲸鲨信息图
- 多栏报纸页面
- 包含代数几何内容的学术论文
- 上标、下标、希腊字符、大括号、分数和多行公式
- 添加到拍摄书页上的手写注释
这对于海报、界面、幻灯片、文档和技术图表可能具有价值。但可读性和准确性并不相同。一行文字即使看起来排版合理,也可能包含拼写错误、错误数字或错误公式。发布前始终应检查生成文本和事实内容。
精细摄影细节
官方示例还关注皮肤毛孔、单根发丝、微表情、纸张、织物、笔触以及其他细微纹理。目标是减少通常暴露 AI 生成人像或产品图的平滑和合成感。
精细细节不仅适用于照片级人像,还可以改善:
- 玻璃、金属、皮革和织物等产品材质
- 食品和饮料摄影
- 编辑和生活方式图像
- 历史艺术品和文档修复
- 特写自然图像和科学插图
注重细节的编辑
Qwen Image 3.0 不仅限于文生图生成。在 Qwen 的编辑演示中,该模型会为书页添加真实的手写学习笔记,并修复受损传统绘画,同时尝试保留原始墨色渐变、羽毛纹理、构图和笔触。
这些示例表明,该模型可以将高级指令与已有图像的外观结合。与任何生成式编辑工具一样,实际生产使用时仍应检查请求编辑区域之外是否发生变化。
深度知识:语言、风格、界面与事实
Qwen Image 3.0 的第三个核心理念是“Deep Knowledge”。它描述了模型不仅生成可识别物体,还能生成依赖语言、界面规范、艺术风格和领域知识的视觉内容。
跨 12 种语言原生渲染
Qwen 表示该模型可以跨 12 种语言进行原生渲染。发布材料明确展示了中文、英文、日文、韩文和西班牙文,但没有提供完整的 12 种语言官方列表。
这一点很重要。直接发布未经确认的语言列表,或假设所有支持语言都具有相同准确度,都为时过早。多语言活动内容应由熟练使用相关语言的人员审核拼写、标点、换行和符合文化习惯的排版。
超过 20 种字体和 100 种视觉风格
QwenCloud 列出了超过 20 种字体支持,而发布文章描述了超过 100 种艺术风格。这些能力可以帮助提示词定义更具体的视觉系统,而不是只要求一个通用的“海报”或“插图”。
为了获得更好的控制,提示词应从功能角度描述排版:
- 必须出现的确切文本
- 语言和文字系统
- 标题、副标题、正文、标签或说明文字
- 衬线、无衬线、手写、展示或技术风格
- 字重、对齐方式、颜色、间距和层级
支持多种风格并不意味着可以精确复刻某个商业字体或在世艺术家的风格。品牌和授权检查仍由用户负责。
真实界面生成
Qwen Image 3.0 可以模拟熟悉的视觉结构,例如:
- 网页
- 软件应用
- 游戏
- 直播间
- 聊天界面
- 移动端风格屏幕
这使其适用于视觉概念和分镜设计。但它不会自动将输出转换为可用于生产的 UI 代码,也不保证界面符合无障碍和交互标准。
世界知识与网络检索
官方示例利用主题知识生成科学信息图和带注释的研究图。其中一个案例中,模型保留昆虫照片,同时添加分类信息、形态标签、放大细节和比例尺。
Qwen 还展示了通过在线检索生成当前天气图。这应被理解为模型加工具的工作流:网络访问提供最新信息,图像模型将其转换为视觉内容。这并不证明基础模型始终包含最新事实。
任何知识密集型输出都应通过可靠来源验证。图像生成可以用高度可信的视觉效果呈现错误信息。
Qwen Image 3.0 可以创建什么?
该模型最适合的应用场景,是视觉质量和信息结构需要同时存在的任务。
信息图和教育材料
长提示词可以定义多个部分、图表、公式、标注和解释文本。这使 Qwen Image 3.0 成为课程海报、时间线、科学解释图和演示图形的潜在选择。
报纸和编辑版式
小文本、栏目、图片说明和纸张纹理可以同时生成。结果可能适合作为概念图、插图或草稿,但当准确性关键时,精确文字仍应手动排版。
分镜和漫画
扩展后的指令长度可以在一个提示词中描述多个镜头、地点、动作、摄影角度和字幕。不同面板之间的人物一致性仍需测试,而不能默认存在。
UI 和游戏概念
对常见界面模式的理解可以加速应用、仪表盘、游戏界面和直播图形的早期构思。设计师应将结果视为视觉参考,而非最终界面规范。
电商和营销创意
详细材质、结构化布局、产品信息和多语言文本的结合,可以支持活动概念图、目录页面、菜单和产品说明图。
文档标注和修复
图像编辑可以为已有图像添加笔记、标签、图表和其他上下文元素。展示的艺术修复案例也指向创意修复和重建工作流,但具有历史价值的材料不应在没有专家审核和明确披露的情况下被修改。
如何访问 Qwen Image 3.0
Qwen 在发布公告中链接了 Qwen Chat,其 QwenCloud 页面列出的上游模型 ID 是:
qwen-image-3.0-pro
该标识符属于 QwenCloud。在 PoYo 上,生产请求使用以下模型 ID:
qwen-image-3
qwen-image-3-pro
两者都使用 PoYo 的异步生成端点,支持文生图和图生图、1K/2K 输出、八种宽高比、PNG/JPEG、提示词扩展、负面提示词和种子控制。例如,提示词扩展可通过以下参数启用:
{
"parameters": {
"prompt_extend": true
}
}
QwenCloud 的预览状态和限制不代表 PoYo 的可用性。生产集成应以 PoYo Qwen Image 3.0 文档中的当前请求结构和运行限制为准。
PoYo 标准版的 1K 或 2K 输出均为每张 4.8 credits($0.024);Qwen Image 3 Pro 的 1K 为 6.4 credits($0.032),2K 为 12 credits($0.06)。每张输入图片另收 0.5 credits($0.0025)。
如何编写更好的 Qwen Image 3.0 提示词
更长的指令窗口只有在提示词结构清晰时才能发挥最大作用。单纯增加更多形容词通常不会改善输出。
实用结构如下:
- 定义用途和画布,例如竖版教育海报或三栏报纸。
- 描述整体视觉层级和网格。
- 按空间顺序说明每个区域。
- 将必须显示的文本放入引号中。
- 定义字体、语言和相对文字大小。
- 描述图像、材质、光线和风格。
- 说明关系和限制条件,包括不可重叠部分。
- 仅在之后可以验证时要求生成事实标签。
对于复杂布局,“标题区”“左栏”“中心面板”“页脚”等区域标签,比一个无结构段落更有效。编辑图像时,应同时说明需要改变什么,以及需要保持什么不变。
当前限制与未知信息
Qwen Image 3.0 刚刚发布,发布材料重点展示了部分案例,而不是完整技术报告或独立评测。需要注意以下限制:
- QwenCloud 的上游访问策略与 PoYo 分开;PoYo 的两个文档化模型 ID 现已可用。
- Qwen 尚未披露参数量或详细模型架构。
- Qwen 尚未公布确认的原生或最大分辨率,但 PoYo 已提供 1K 和 2K 输出选项。
- PoYo 定价已经公布;平均延迟和生产速率限制应以当前服务文档为准。
- 开放权重可用性、许可证和本地部署要求未知。
- 约 10px 文本渲染能力并不保证完美拼写或事实准确性。
- 完整的 12 种支持语言列表尚未发布。
- 复杂公式、科学标签和检索事实仍需要人工验证。
- 类似 UI 的图像可能看起来可信,但并不一定是逻辑或技术有效的界面。
- 官方展示图片无法衡量模型在重复生成中的稳定表现。
不要将 Qwen Image 2.0 的规格直接转移到 Qwen Image 3.0。尤其是,Qwen 尚未确认新模型具有相同的参数量、架构、分辨率限制或部署方式。
Qwen Image 3.0 值得关注吗?
值得关注——尤其对于过去需要分别使用图像生成器、布局工具和人工排版流程的工作场景。
Qwen Image 3.0 最重要的升级并不是某一个图像质量评分,而是尝试让单张生成图像同时承载更多结构化信息、更小的可读文本、更丰富的视觉细节和更广泛的主题知识。
这使该模型尤其适用于教育工作者、出版商、设计师、电商团队和内容创作者。PoYo 现在提供可实际使用的托管 API;由于 Qwen 尚未发布权重、许可证和硬件要求,本地推理仍不明确。
合理的结论是:Qwen Image 3.0 是一次专注于生产力的重大更新,提出了很有野心的排版和布局能力。PoYo 的成本和支持输出尺寸已经明确,而一致性、速度、最大原生分辨率和本地部署方式仍需单独评估。
常见问题
什么是 Qwen Image 3.0?
Qwen Image 3.0 是 Qwen 的第三代图像生成与图像编辑基础模型。它专注于信息密集型布局、精细视觉细节、多语言文本、界面模拟和知识丰富型视觉内容。
Qwen Image 3.0 什么时候发布?
Qwen 团队于 2026 年 7 月 21 日公布了 Qwen Image 3.0。
Qwen Image 3.0 的提示词长度是多少?
Qwen 表示该模型支持最多 4.5K tokens 的指令输入。这是提示词长度限制,并不保证 4,500 tokens 的文本可以准确渲染在一张图像中。
Qwen Image 3.0 可以生成小文本吗?
Qwen 声称该模型可以生成最小约 10 像素大小的可读文本。具体拼写、公式、数字和事实内容仍应人工检查。
Qwen Image 3.0 支持哪些语言?
Qwen 表示其支持跨 12 种语言的原生渲染。发布材料展示了包括中文、英文、日文、韩文和西班牙文在内的多种语言,但没有公布完整的 12 种语言列表。
Qwen Image 3.0 可以编辑图像吗?
可以。官方示例展示了模型添加手写注释、为照片增加技术信息,以及修复传统艺术作品缺失或损坏部分的能力。
Qwen Image 3.0 是开源的吗?
Qwen 尚未公布 Qwen Image 3.0 的开放权重或许可证。PoYo 提供的是托管 API,这并不意味着本地权重或本地部署许可证已经可用。
Qwen Image 3.0 的 API 模型名称是什么?
PoYo 使用 qwen-image-3 和 qwen-image-3-pro。独立的 QwenCloud 页面使用 qwen-image-3.0-pro;在 API 请求中不要混用上游和 PoYo 标识符。
Qwen Image 3.0 支持什么分辨率?
PoYo 支持选择 1K 和 2K 输出。Qwen 尚未公布确认的原生或最大架构分辨率,因此 PoYo 输出选项不应被解读为对模型原生训练分辨率的声明。
你可以通过 Qwen Image 3.0 模型页面立即生成图像,或在集成前阅读 PoYo API 文档。