01
Omni-Reference 多模态参考:统一图片、音频、视频与文档
产品图可以定义核心物体,音频可以建立节奏,文档可以承载完整的创意简报。Wan 3.0 将这些不同信号整合成统一的创作方向。
- 支持文字、图片、音频、视频、文档与网页
- 为角色、产品、地点、运动和氛围提供更多信息
- 用一份完整简报替代彼此割裂的提示词片段
透明定价,无隐藏费用。按量付费,用多少付多少。
wan-3-0
wan-3-0
wan-3-0| 型号 | 规格 | PoYo价格 | 官方价格 | 为你节省 |
|---|---|---|---|---|
wan-3-0 | 480p · All workflows Text to Video · Image to Video · Reference to Video | $0.050/秒 10 积分 /秒 | - | - |
720p · All workflows Text to Video · Image to Video · Reference to Video | $0.100/秒 20 积分 /秒 | - | - | |
1080p · All workflows Text to Video · Image to Video · Reference to Video | $0.200/秒 40 积分 /秒 | - | - |
* 实际费用以最终输出为准。
使用 Wan 3.0 API:用多模态参考创作更长、更连贯的视频 的完整指南
Wan 3.0 在 PoYo 支持文生视频、首尾帧图生视频和多模态参考生视频工作流。
可生成 2–30 秒的 480p、720p 或 1080p 视频,支持同步音频,并可使用图片、视频、音频、文档和网页链接引导结果。
从多模态参考、30 秒连贯叙事到同步音频,探索 Wan 3.0 的核心视频创作能力。
01
产品图可以定义核心物体,音频可以建立节奏,文档可以承载完整的创意简报。Wan 3.0 将这些不同信号整合成统一的创作方向。
02
Wan 3.0 可原生生成最长 30 秒的视频,并增强主体在连续动作与镜头之间的一致性。
03
编辑与延展工具支持定向修改:继续已有画面、调整局部区域,或在保留主体、构图和运动的前提下改变场景中的一部分。
04
Wan 3.0 将原生声音、连续镜头和镜头控制结合起来,让对白、环境声、动作与构图共同服务同一段体验。
让可识别的产品、视觉语言和声音贯穿一条更完整的社交或广告视频。
结合产品图片与文字简报,在一个受控段落中展示功能、变化和使用情境。
在正式制作前探索连续镜头、节奏、镜头运动和声音设计。
调整局部、延长片段或制作变化版本,同时保留镜头中已经有效的部分。
两档模型支持相同的三种工作流与核心控制项,可按处理速度和每秒成本选择。
| 能力 | Wan 3.0 | Wan 3.0 Video Prime |
|---|---|---|
| 定位 | 兼顾成本的标准生成档 | 针对更快处理速度优化的 Prime 档 |
| 工作流 | Text to Video · Image to Video · Reference to Video | Text to Video · Image to Video · Reference to Video |
| 输出控制 | 480p、720p 或 1080p · 2–30 秒 · 可选音频 | 480p、720p 或 1080p · 2–30 秒 · 可选音频 |
| 参考输入 | 最多 10 张图片 · 5 个视频 · 5 个音频 · 1 个文档或链接 | 最多 10 张图片 · 5 个视频 · 5 个音频 · 1 个文档或链接 |
| PoYo 价格 | 480p 10 · 720p 20 · 1080p 40 积分/秒 | 480p 13.6 · 720p 28 · 1080p 56 积分/秒 |
| 模型 ID | wan3.0-text-to-video · wan3.0-image-to-video · wan3.0-reference-to-video | wan3.0-prime-text-to-video · wan3.0-prime-image-to-video · wan3.0-prime-reference-to-video |
两档模型的工作流和输入限制相同。重视成本可选 Wan 3.0,优先处理速度可选 Video Prime。
在同一工具内切换文生视频、首尾帧和多模态参考生成。
直接上传图片、视频、音频和文档,或在请求中添加公开链接。
提交生成前即可根据分辨率和时长估算所需积分。
查看对应 JSON 请求,复用相同模型 ID,并直接衔接生产集成。