01
単一のプロンプトからモーションを生成
ソース メディアを準備せずに高速コンセプト クリップが必要な場合は、テキストのみの生成を使用します。プロンプトでシーンの物理学、カメラの動き、マテリアルの動作、雰囲気を説明し、720p または 1080p 出力を選択します。
- 画像またはビデオ入力を使用しないテキストからビデオへの変換
- 4s、6s、8s、または 10s 持続時間コントロール
- ワイドスクリーン、縦型、正方形、縦型レイアウトのアスペクト比
透明な価格設定。隠れた費用はありません。使った分だけ支払えます。
| モデル | 仕様 | PoYo価格 | 公式価格 | 節約率 |
|---|---|---|---|---|
720p/1080p - no video input - 4s | $0.600/生成 120 クレジット /生成 | - | - | |
720p/1080p - no video input - 6s | $0.750/生成 150 クレジット /生成 | - | - | |
720p/1080p - no video input - 8s | $1.00/生成 200 クレジット /生成 | - | - | |
720p/1080p - no video input - 10s | $1.10/生成 220 クレジット /生成 | - | - | |
4K - no video input - 4s | $1.25/生成 250 クレジット /生成 | - | - | |
4K - no video input - 6s | $1.50/生成 300 クレジット /生成 | - | - | |
4K - no video input - 8s | $1.75/生成 350 クレジット /生成 | - | - | |
4K - no video input - 10s | $2.25/生成 450 クレジット /生成 | - | - | |
720p/1080p / 動画入力あり | $1.50/生成 300 クレジット /生成 | - | - | |
4K / 動画入力あり | $2.00/生成 400 クレジット /生成 | - | - |
* 実際の料金は最終出力に基づきます。
Omni Flash マルチモーダルビデオ生成用 API を使用するための完全なガイド
ページの例では、PoYo でホストされる CDN メディアを使用し、サポートされている API モード (テキストからビデオへ、イメージからビデオへ、およびビデオ入力生成) に一致します。
01
ソース メディアを準備せずに高速コンセプト クリップが必要な場合は、テキストのみの生成を使用します。プロンプトでシーンの物理学、カメラの動き、マテリアルの動作、雰囲気を説明し、720p または 1080p 出力を選択します。
02
画像からビデオへの変換の場合は、ソース画像を 1 つアップロードし、それがどのように移動するかを説明します。この公式 Google DeepMind 鳥の描画サンプルでは、シンプルな線画を視覚的なアンカーとして保持しながら、それを短いアニメーション シーンに変換します。
03
ソースビデオが提供されると、Omni Flash はビデオ入力ワークフローに切り替わります。これを使用して、同じリクエストを通じてオプションで参照画像を追加しながら、モーション キュー、タイミング、またはシーン構造を転送します。
ピッチ、ストーリーボード、クリエイティブ ディレクション テスト用の単純なプロンプトから短いクリップを生成します。
製品の写真、イラスト、静止画をアニメーション化して、短いソーシャル クリップやキャンペーン クリップを作成します。
シーンで 1 回の生成リクエストで複数のビジュアル リファレンスが必要な場合は、3 つのソース イメージを送信します。
ビデオリファレンスを使用してモーションをガイドし、最終的な外観と出力解像度を調整します。
| 特徴 | Omni Flash | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|
| プロバイダー | Google Gemini Omni | Google DeepMind Veo | ByteDance Seedance |
| 最適な用途 | 会話型ビデオ編集、プロンプトからビデオへ、画像からビデオへ、リファレンスガイド付き反復 | 映画のような生成、ネイティブ オーディオ、画像ガイド付きショット、制作の事前ビジュアライゼーション | マルチショット ストーリー、ネイティブ オーディオビデオ生成、リップシンク、および複雑なマルチモーダル リファレンス |
| 公式的な位置づけ | 世界を理解し、会話を洗練させて、あらゆる入力からビデオを作成および編集します | リアリズム、迅速な遵守、オーディオを備えた、映画制作者やストーリーテラー向けの主要なビデオ生成モデル | テキスト、画像、オーディオ、ビデオ入力用のネイティブ マルチモーダル オーディオ/ビデオ生成モデル |
| PoYoの入力モード | プロンプトのみ、1 つの画像、3 つの画像、または 1 つのビデオ URL | プロンプト、画像ガイダンス、最初/最後のフレーム、参照画像、または階層に応じたビデオ拡張子 | Seedance 2 API ページを介したテキスト、画像、ビデオ、およびオーディオのリファレンス ワークフロー |
| 出力とオーディオ | PoYo のビデオ出力。公式モデルカードには音声付きの高解像度ビデオが記載されています | モデルの設定に応じて、ネイティブオーディオまたはサイレント出力を含むビデオ | ダイアログ、SFX、音楽、アンビエンスを備えたネイティブ オーディオとビデオの共同生成 |
| PoYoの解像度 | 720p, 1080p | 層に応じて 720p または 1080p | 480p、720p、1080p(モデルによる) |
| PoYoでの持続時間 | ビデオ入力のないジョブの場合は 4s、6s、8s、10s。ビデオ入力は独自のモードを使用します | 通常は 4s、6s、または 8s 世代です。拡張機能はソースビデオの継続をサポートします | 4-15 秒、1 秒ごとに請求されます |
| 公開された評価ステータス | Google によると、T2VA、I2VA、R2VA、編集、画像生成の詳細な評価は、開発者およびエンタープライズ API の展開時に共有される予定です | Google は、Veo 3.1 の設定、調整、ビジュアル品質、オーディオビデオの調整、および物理的主張を公開します。 | Seedance 2.0 モデル カードは、専門家および一般ユーザーのテストで広範な改善と最高レベルのパフォーマンスを報告 |
| こんなときに選択してください | Google Omni Flash 検索範囲、会話型編集言語、コンパクトな PoYo API コントロールが必要です | ネイティブオーディオオプションと強力な公開ベンチマーク証拠を備えた成熟した映画モデルが必要です | より長いマルチショット クリップ、オーディオ/リップシンク ワークフロー、より豊富なマルチモーダル リファレンスが必要 |
モデルの機能はすぐに変化します。この表は、公開モデル情報と 2026 年 6 月時点の PoYo の現在の API サーフェスを組み合わせたものです。運用統合の前に、PoYo ドキュメントで現在のリクエスト フィールドと価格を確認してください。
ステップ 1: API キーを作成する
PoYo API キーを生成し、統合非同期生成エンドポイントにリクエストを送信します。
APIキーの作成
ステップ 2: 入力モードを選択する
送信のみ prompt テキストからビデオへの変換の場合は、1 つ追加します image_urls 画像からビデオへの項目、参照融合のために 3 つの画像を送信するか、1 つ追加します video_urls ビデオ入力生成の項目。
クレジットを追加する
ステップ 3: ステータスをポーリングするか、Webhook を使用する
返されたタスク ID を使用して進行状況をクエリするか、 callback_url 完成したビデオを非同期で受信します。
オープンAPIドキュメント
model: "omni-flash" プロンプトとオプション付きimage_urlsまたは video_urls、ステータス エンドポイントをポーリングするか、Webhook を使用してビデオを取得します。同じ PoYo 生成エンドポイントを通じてタスクを送信し、標準のタスク ステータス フローで最終ファイルを取得します。
解像度、継続時間、アスペクト比、画像数、ビデオ入力は明示的なリクエスト フィールドです。
モデル カードと価格表は、生成前に期間ベースおよびビデオ入力のクレジット階層を公開します。
タスク入力レコードにはユーザーに表示されるフィールドのみが保持されるため、デバッグとカスタマー サポートが簡素化されます。