01
从单个提示生成动作
当您想要快速概念剪辑而不准备源媒体时,请使用纯文本生成。在提示中描述场景物理、相机运动、材质行为和氛围,然后选择 720p 或 1080p 输出。
- 没有图像或视频输入的文本到视频
- 4s、6s、8s 或 10s 持续时间控制
- 宽屏、垂直、方形和纵向布局的宽高比
透明定价,无隐藏费用。按量付费,用多少付多少。
| 型号 | 规格 | PoYo价格 | 官方价格 | 为你节省 |
|---|---|---|---|---|
720p/1080p - no video input - 4s | $0.600/次 120 积分 /次 | - | - | |
720p/1080p - no video input - 6s | $0.750/次 150 积分 /次 | - | - | |
720p/1080p - no video input - 8s | $1.00/次 200 积分 /次 | - | - | |
720p/1080p - no video input - 10s | $1.10/次 220 积分 /次 | - | - | |
4K - no video input - 4s | $1.25/次 250 积分 /次 | - | - | |
4K - no video input - 6s | $1.50/次 300 积分 /次 | - | - | |
4K - no video input - 8s | $1.75/次 350 积分 /次 | - | - | |
4K - no video input - 10s | $2.25/次 450 积分 /次 | - | - | |
720p/1080p / 有视频输入 | $1.50/次 300 积分 /次 | - | - | |
4K / 有视频输入 | $2.00/次 400 积分 /次 | - | - |
* 实际费用以最终输出为准。
使用 用于多模态视频生成的 Omni Flash API 的完整指南
页面示例使用 PoYo 托管的 CDN 媒体,并与支持的 API 模式匹配:文本到视频、图像到视频和视频输入生成。
01
当您想要快速概念剪辑而不准备源媒体时,请使用纯文本生成。在提示中描述场景物理、相机运动、材质行为和氛围,然后选择 720p 或 1080p 输出。
02
对于图像到视频,上传一张源图像并解释它应该如何移动。这个官方的Google DeepMind鸟类绘画示例保留了简单的线条艺术作为视觉锚点,同时将其变成了一个简短的动画场景。
03
当提供源视频时,Omni Flash 切换到视频输入工作流程。使用它来传输运动提示、计时或场景结构,同时可以选择通过同一请求添加参考图像。
根据推介、故事板和创意方向测试的简单提示生成短片。
将产品照片、插图和静止图像制作成社交或活动短片。
当场景在一次生成请求中需要多个视觉参考时,请提交三个源图像。
使用视频参考来指导运动,同时调整最终外观和输出分辨率。
| 特点 | Omni Flash | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|
| 提供者 | Google Gemini Omni | Google DeepMind Veo | ByteDance Seedance |
| 最适合 | 对话式视频编辑、提示视频、图像到视频和参考引导迭代 | 电影生成、原生音频、图像引导镜头和制作预览 | 多镜头故事、原生音频视频生成、口型同步和复杂的多模式参考 |
| 官方定位 | 通过任何输入创建和编辑视频,具有对世界的理解和对话的改进 | 面向电影制作者和故事讲述者的领先视频生成模型,具有真实性、即时依从性和音频 | 用于文本、图像、音频和视频输入的本机多模态音视频生成模型 |
| PoYo 上的输入模式 | 仅提示、1 个图像、3 个图像或 1 个视频 URL | 提示、图像引导、第一帧/最后一帧、参考图像或视频扩展(取决于层) | 通过 Seedance 2 API 页面的文本、图像、视频和音频参考工作流程 |
| 输出和音频 | PoYo上的视频输出;官方模型卡描述了带有音频的高分辨率视频 | 具有本机音频或静音输出的视频,具体取决于型号设置 | 对话、SFX、音乐、氛围的原生音视频联合生成 |
| PoYo 决议 | 720p, 1080p | 720p 或 1080p 取决于等级 | 480p、720p、1080p 取决于型号 |
| PoYo 上的持续时间 | 4s、6s、8s、10s 适用于无视频输入作业;视频输入使用自己的模式 | 通常为4s、6s或8s一代;扩展支持源视频延续 | 4-15秒,按秒计费 |
| 已发布的评估状态 | Google 表示,当开发人员和企业 API 推出时,将共享详细的 T2VA、I2VA、R2VA、编辑和图像生成评估 | Google 发布 Veo 3.1 偏好、对齐、视觉质量、音视频对齐和物理声明 | Seedance 2.0 型号卡在专家和公众用户测试中报告了广泛的改进和领先水平的性能 |
| 选择此时间 | 您需要 Google Omni Flash 搜索覆盖范围、对话式编辑语言和紧凑的 PoYo API 控件 | 您需要一个成熟的电影模型,具有原生音频选项和更强大的公共基准证据 | 您需要更长的多镜头剪辑、音频/唇形同步工作流程以及更丰富的多模式参考 |
模型功能变化很快。该表结合了公开型号信息和截至2026年6月PoYo当前的API接口;在生产集成之前验证 PoYo 文档中的当前请求字段和定价。
model: "omni-flash" 有提示和可选image_urls或 video_urls,然后轮询状态端点或使用 Webhook 检索视频。通过相同的 PoYo 生成端点提交任务,并使用标准任务状态流程检索最终文件。
分辨率、持续时间、宽高比、图像计数和视频输入是显式请求字段。
模型卡和定价表在生成之前公开了基于持续时间和视频输入的信用等级。
任务输入记录仅保留面向用户的字段,这简化了调试和客户支持。