Model icon
omni-flash
Text to Video
Image to Video
Video to Video
模型:
Omni Flash API 支持文本到视频、图像到视频、三图像参考融合以及带有 720p、1080p、持续时间和宽高比控制的视频输入生成。
Input
168/20000
已添加 1/3

支持拖放文件、粘贴文件或添加链接。 Use no image for text-to-video, one image for image-to-video, or three images for reference fusion.

Image Urls 1

支持拖放文件、粘贴文件或添加链接。 video/mp4,video/quicktime,video/webm,video/x-matroska · 100 MiB

Output

示例输出

这是示例数据。生成新结果后可查看真实输出。

任务 ID:OMNIFLASHPREVIEW创建时间:2026-06-03T00:00:00
状态:finished进度:100%

Example video

定价详情

透明定价,无隐藏费用。按量付费,用多少付多少。

Googleomni-flash
720p/1080p - no video input - 4s
PoYo价格
$0.600/次
120 积分
官方价格
-
为你节省
-
Googleomni-flash
720p/1080p - no video input - 6s
PoYo价格
$0.750/次
150 积分
官方价格
-
为你节省
-
Googleomni-flash
720p/1080p - no video input - 8s
PoYo价格
$1.00/次
200 积分
官方价格
-
为你节省
-
Googleomni-flash
720p/1080p - no video input - 10s
PoYo价格
$1.10/次
220 积分
官方价格
-
为你节省
-
Googleomni-flash
4K - no video input - 4s
PoYo价格
$1.25/次
250 积分
官方价格
-
为你节省
-
Googleomni-flash
4K - no video input - 6s
PoYo价格
$1.50/次
300 积分
官方价格
-
为你节省
-
Googleomni-flash
4K - no video input - 8s
PoYo价格
$1.75/次
350 积分
官方价格
-
为你节省
-
Googleomni-flash
4K - no video input - 10s
PoYo价格
$2.25/次
450 积分
官方价格
-
为你节省
-
Googleomni-flash
720p/1080p / 有视频输入
PoYo价格
$1.50/次
300 积分
官方价格
-
为你节省
-
Googleomni-flash
4K / 有视频输入
PoYo价格
$2.00/次
400 积分
官方价格
-
为你节省
-

* 实际费用以最终输出为准。

介绍

使用 用于多模态视频生成的 Omni Flash API 的完整指南

用于多模态视频生成的 Omni Flash API

PoYo 上的 Omni Flash 接受单独的提示、包含一张源图像、三张参考图像或短视频参考的提示。它专为短视频工作流程而构建,团队需要对分辨率、宽高比和持续时间进行实际控制,同时保持公共 API 请求紧凑。

Omni Flash API的主要特性

页面示例使用 PoYo 托管的 CDN 媒体,并与支持的 API 模式匹配:文本到视频、图像到视频和视频输入生成。

01

从单个提示生成动作

当您想要快速概念剪辑而不准备源媒体时,请使用纯文本生成。在提示中描述场景物理、相机运动、材质行为和氛围,然后选择 720p 或 1080p 输出。

  • 没有图像或视频输入的文本到视频
  • 4s、6s、8s 或 10s 持续时间控制
  • 宽屏、垂直、方形和纵向布局的宽高比

02

在保留主题的同时对一张图像进行动画处理

对于图像到视频,上传一张源图像并解释它应该如何移动。这个官方的Google DeepMind鸟类绘画示例保留了简单的线条艺术作为视觉锚点,同时将其变成了一个简短的动画场景。

  • 一张图像 URL 用于图像转视频
  • 提示引导的运动和环境细节
  • 适用于草图、产品框架和视觉概念

03

使用视频参考进行动作和风格转移

当提供源视频时,Omni Flash 切换到视频输入工作流程。使用它来传输运动提示、计时或场景结构,同时可以选择通过同一请求添加参考图像。

  • 每个请求最多一个视频 URL
  • 视频输入作业的持续时间被省略
  • 支持 720p 和 1080p 分辨率层

团队使用 Omni Flash API 构建什么

01

概念视频草稿

根据推介、故事板和创意方向测试的简单提示生成短片。

02

图像到视频资产

将产品照片、插图和静止图像制作成社交或活动短片。

03

参考图像融合

当场景在一次生成请求中需要多个视觉参考时,请提交三个源图像。

04

视频输入变化

使用视频参考来指导运动,同时调整最终外观和输出分辨率。

Omni Flash vs Veo 3.1 vs Seedance 2.0 - 视频型号比较

特点Omni FlashVeo 3.1Seedance 2.0
提供者Google Gemini OmniGoogle DeepMind VeoByteDance Seedance
最适合对话式视频编辑、提示视频、图像到视频和参考引导迭代电影生成、原生音频、图像引导镜头和制作预览多镜头故事、原生音频视频生成、口型同步和复杂的多模式参考
官方定位通过任何输入创建和编辑视频,具有对世界的理解和对话的改进面向电影制作者和故事讲述者的领先视频生成模型,具有真实性、即时依从性和音频用于文本、图像、音频和视频输入的本机多模态音视频生成模型
PoYo 上的输入模式仅提示、1 个图像、3 个图像或 1 个视频 URL提示、图像引导、第一帧/最后一帧、参考图像或视频扩展(取决于层)通过 Seedance 2 API 页面的文本、图像、视频和音频参考工作流程
输出和音频PoYo上的视频输出;官方模型卡描述了带有音频的高分辨率视频具有本机音频或静音输出的视频,具体取决于型号设置对话、SFX、音乐、氛围的原生音视频联合生成
PoYo 决议720p, 1080p720p 或 1080p 取决于等级480p、720p、1080p 取决于型号
PoYo 上的持续时间4s、6s、8s、10s 适用于无视频输入作业;视频输入使用自己的模式通常为4s、6s或8s一代;扩展支持源视频延续4-15秒,按秒计费
已发布的评估状态Google 表示,当开发人员和企业 API 推出时,将共享详细的 T2VA、I2VA、R2VA、编辑和图像生成评估Google 发布 Veo 3.1 偏好、对齐、视觉质量、音视频对齐和物理声明Seedance 2.0 型号卡在专家和公众用户测试中报告了广泛的改进和领先水平的性能
选择此时间您需要 Google Omni Flash 搜索覆盖范围、对话式编辑语言和紧凑的 PoYo API 控件您需要一个成熟的电影模型,具有原生音频选项和更强大的公共基准证据您需要更长的多镜头剪辑、音频/唇形同步工作流程以及更丰富的多模式参考

模型功能变化很快。该表结合了公开型号信息和截至2026年6月PoYo当前的API接口;在生产集成之前验证 PoYo 文档中的当前请求字段和定价。

如何在PoYo上使用Omni Flash API

第 1 步:创建您的 API 密钥
生成PoYo API密钥并将请求提交到统一异步生成端点。
创建 API 密钥

步骤 2:选择输入模式
仅发送 prompt 对于文本转视频,添加一个 image_urls 用于图像到视频的项目,发送三张图像以进行参考融合,或添加一张 video_urls 用于视频输入生成的项目。
添加制作人员

第 3 步:轮询状态或使用 webhook
使用返回的任务ID查询进度,或者提供 callback_url 异步接收完成的视频。
开放API文档

Omni Flash API常见问题解答

Google流程中的Omni Flash是什么?

在 Google Flow 中,Omni Flash 指的是 Gemini Omni Flash,Google 的对话视频模型,用于从不同类型的输入创建和编辑视频。 Google 将其描述为一个模型,可以从视频开始,从任何输入创建任何内容,并表示 Flow 用户可以将现实世界的灵感与生成的内容融合在一起,并以对话方式进行迭代。 Google流量公告

Omni Flash是什么?

Omni Flash通常用来指代Google的Gemini Omni Flash。 Google DeepMind 模型卡将其描述为用于文本、图像、音频和视频输入的本机多模态模型,可创建高质量、高分辨率的音频视频,支持对话式编辑,并围绕世界理解和多模态进行设计。在 PoYo 上,Omni Flash API 通过分辨率、持续时间和宽高比控件公开提示、图像和视频参考工作流程。 Google DeepMind型号卡

Omni Flash比Veo 3.1好多少?

没有公开的同类分数证明 Omni Flash 比 Veo 3.1 好一个固定的百分比。 Google 表示,当开发者和企业 API 推出时,将共享 T2VA、I2VA、R2VA、视频编辑和图像生成的 Omni Flash 评估详细信息。 Veo 3.1 已经公开了 Google 基准测试,包括偏好、即时对齐、视觉质量、音频视频对齐和真实物理效果。实际中,选择Omni Flash进行对话式编辑和任意输入迭代;当您想要具有已发布基准证据的更成熟的电影视频模型时,请选择 Veo 3.1。 Veo 3.1概述

如何使用Google、Omni Flash?

在 Google 产品中,如果您的计划和区域可用,请通过 Gemini、Google Flow、YouTube 或 Flow Music 使用 Gemini Omni Flash。从提示、图像、视频或其他参考开始,然后通过后续说明完善结果。在PoYo上,创建API密钥,发送 model: "omni-flash" 有提示和可选image_urlsvideo_urls,然后轮询状态端点或使用 Webhook 检索视频。

Omni Flash在PoYo上支持哪些输入模式?

PoYo 支持无源媒体的文本到视频、一张图像的图像到视频、三张图像的参考融合以及一张视频的视频输入生成。

我可以上传两张图片吗?

不可以。公共 API 接受此模型的 0、1 或 3 个图像。带有两个图像的请求将被拒绝,因此输入模式保持明确。

我可以使用 video_urls 发送持续时间吗?

否。当提供 video_urls 时,省略持续时间。视频输入作业使用自己的固定计费和生成模式。

有哪些分辨率和宽高比可用?

分辨率支持720p和1080p。宽高比支持 16:9、9:16、1:1、4:3 和 3:4。

PoYo 是否存储内部上游有效负载字段?

否。PoYo 仅存储面向用户的请求字段,例如提示、image_urls、video_urls、分辨率、持续时间、aspect_ratio、模型和 callback_url(如果提供)。

为什么 Omni Flash API 使用 PoYo

01

统一异步API

通过相同的 PoYo 生成端点提交任务,并使用标准任务状态流程检索最终文件。

02

清晰的控制

分辨率、持续时间、宽高比、图像计数和视频输入是显式请求字段。

03

透明的积分

模型卡和定价表在生成之前公开了基于持续时间和视频输入的信用等级。

04

清理存储的输入

任务输入记录仅保留面向用户的字段,这简化了调试和客户支持。