
開発者向けの AI API
音声から動画生成API
PoYo 音声から動画生成API を使用して、オーディオ主導のビデオ ワークフローを構築します。オーディオを使用するモデルをポートレートやその他のリファレンスと比較し、入力コントロール、出力、価格を確認します。
対応モデル
4 個のモデル

$0.085 /課金対象秒
seedance-2.5
ByteDance Seedance 2.5 video generation with 4-30 second output, first and last frame control, up to 50 image, video, and audio references, optional synchronized audio, and 480p, 720p, or 1080p delivery.

$0.045 /出力・参照動画の秒数
seedance-2
ByteDance Seedance 2 video generation with text-to-video, image-to-video, multimodal reference-to-video, video-to-video, and audio-to-video workflows using image, video, and audio references with optional native audio.

$0.03 /出力・参照動画の秒数
seedance-2-mini
ByteDance Seedance 2.0 Mini video generation for lower-cost text-to-video, image-to-video, and multimodal reference workflows with 480p and 720p output.
$0.035 /秒
kling-avatar-2.0/standard
Kling Avatar 2.0 creates audio-driven talking avatar videos from one reference image and one driving audio file, with Standard and Pro quality modes.
音声から動画モデル API - 価格とモデル適合性
モデルを選ぶ前に、提供元、対応入力、出力形式、料金を比較してください。
正確なタスク一致
カタログメタデータに Audio to Video が含まれるモデルだけがここに表示されます。
プロバイダー比較
タスクディレクトリから離れずに、複数プロバイダーのモデルファミリーを比較できます。
API対応の導線
各モデルカードから PoYo の価格、例、Playground、API詳細へ移動できます。
| モデル | プロバイダー | タスクタイプ | 価格 |
|---|---|---|---|
| Seedance 2.5 seedance-2.5 | Seedance | Text to Video, Image to Video, Video to Video | $0.085/課金対象秒 |
| Seedance 2 seedance-2 | Seedance | Text to Video, Image to Video, Video to Video | $0.045/出力・参照動画の秒数 |
| Seedance 2.0 Mini seedance-2-mini | Seedance | Text to Video, Image to Video, Video to Video | $0.03/出力・参照動画の秒数 |
| Kling Avatar 2.0 kling-avatar-2.0/standard | Kling | Image to Video, Audio to Video, Talking Avatar | $0.035/秒 |
よくある質問
音声から動画生成APIとは何ですか?
+
オーディオからビデオへの API は、生成されたビデオの駆動信号または基準としてオーディオを使用します。一部のワークフローでは、話すポートレートをアニメーション化します。サウンドと画像、テキスト、映像を組み合わせたものもあります。選択したモデルによって、オーディオ コントロールの種類と必要な追加入力が決まります。
音声ファイルだけからビデオを生成できますか?
+
選択したエンドポイントがその入力の組み合わせをサポートしている場合のみ。多くのオーディオ主導型ワークフローでは、ポートレート、プロンプト、または視覚的なリファレンスも必要です。送信する前に必須フィールドを確認してください。 Audio to Video タスク ラベルは、オーディオだけで完全なシーンを定義することを意味するものではありません。
オーディオからビデオへの変換は、MP3 から MP4 への変換と同じですか?
+
いいえ。静止画像または波形の上にオーディオを配置することは、メディア レンダリング タスクです。 AI オーディオ駆動型生成では、モデルを使用してビジュアル コンテンツを作成またはアニメーション化します。 API を選択する前に、ファイル コンテナの変更、話すポートレート、または生成的なビジュアルが必要かどうかを決定します。
話すポートレートにはどの API を使用すればよいですか?
+
ポートレートと運転音声入力を文書化するトーキング アバター モデルから始めます。これらは話す主題を中心に設計されています。唇の位置、顔の動き、ソース画像の要件をテストします。一般的なマルチモーダル ビデオ エンドポイントは、同じアバター コントロールを提供せずにオーディオを使用する場合があります。
API は曲に同期した音楽ビジュアライゼーションを作成できますか?
+
文書化されたミュージックビデオまたはオーディオビジュアライゼーションのワークフローを探し、リズムと構造がどのように使用されているかをテストします。一般的なオーディオリファレンスのサポートは、ビート同期を保証するものではありません。音楽関連のツールとマルチモーダル ビデオ生成では、入力と出力の動作が異なる場合があります。
ビデオ生成用にオーディオを準備するにはどうすればよいですか?
+
クリッピング、過剰な背景ノイズ、または長い無関係なセクションのないクリアなオーディオを使用します。受け入れられるコーデック、期間、ファイル サイズ、URL の要件を確認します。音声アニメーションの場合、単一話者のきれいなサンプルを使用すると、タイミングと口の動きを判断しやすくなります。
Text to Speech API によって生成されたナレーションを使用できますか?
+
はい、出力形式と長さがビデオ エンドポイントの要件を満たしている場合。まずナレーションを生成して検査し、それを運転オーディオまたはサポートされているリファレンスとして提供します。後のリビジョンに備えて、ビデオ ジョブにリンクされたテキスト、音声設定、およびオーディオ アセットを保持します。
すべてのオーディオ駆動ビデオ モデルはオリジナルのサウンドトラックを保持しますか?
+
いいえ。エンドポイントは、オーディオを別の方法で保存、再解釈、条件付け、または生成する可能性があります。ドキュメントを確認し、完成したクリップを聞いてください。元のトラックを正確に保つ必要がある場合は、結果を確認し、必要に応じて別のオーディオ アセンブリ手順を計画します。
オーディオからビデオへの API リクエストから結果を取得するにはどうすればよいですか?
+
必要なオーディオおよびビジュアル入力を含むモデルを送信し、task_id を保存します。 PoYo ステータス ポーリングまたはサポートされている Webhook コールバックを使用して、完成したビデオを取得します。タスクを使用可能なクリエイティブな結果として扱う前に、画像とサウンドトラックの両方を検査してください。
音声から動画生成API の価格はどのように計算されますか?
+
価格は、選択したモデル、品質設定、および期間ルールによって異なります。層が生成された秒数、入力期間、または別の請求単位を使用しているかどうかを確認します。オーディオ駆動型の生成に 1 つの汎用レートがあると仮定するのではなく、現実的な例を必要なすべてのリファレンスと比較してください。
口の動きや視覚的なタイミングが不正確なのはなぜですか?
+
まず、エンドポイントが音声同期または必要なタイミング動作を目的としていることを確認します。次に、ソースのオーディオ品質、ポートレート表示、サポートされている再生時間を確認します。いくつかのモデル設定を変更したり、長いクリップを生成したりする前に、短くクリーンなサンプルを比較してください。
オーディオ主導のビデオ リクエストの例はどこで見つけられますか?
+
選択したモデルのページを開いて、必要な音声、画像、プロンプトのフィールド、サポートされている形式と例を確認します。コーディングするときは、その API ドキュメントまたはモデル固有の llms.txt を使用してください。ソース アセットをサービスにアクセスできるようにし、アプリケーションで返されたタスク ID を追跡します。