開発者向けの AI API
AIトーキングアバターAPI
PoYo AIトーキングアバターAPI を使用して、話すポートレートを作成します。参照画像と音声をアバター ビデオ生成に接続し、入力要件、品質モード、価格を比較します。
デジタルヒューマンモデル API - 価格とモデル適合性
モデルを選ぶ前に、提供元、対応入力、出力形式、料金を比較してください。
正確なタスク一致
カタログメタデータに Talking Avatar が含まれるモデルだけがここに表示されます。
プロバイダー比較
タスクディレクトリから離れずに、複数プロバイダーのモデルファミリーを比較できます。
API対応の導線
各モデルカードから PoYo の価格、例、Playground、API詳細へ移動できます。
| モデル | プロバイダー | タスクタイプ | 価格 |
|---|---|---|---|
| Kling Avatar 2.0 kling-avatar-2.0/standard | Kling | Image to Video, Audio to Video, Talking Avatar | $0.035/秒 |
よくある質問
AIトーキングアバターAPIとは何ですか?
+
AI トーキング アバター API は、ポートレートとオーディオまたはその他の文書化された入力を使用して、スピーキング キャラクター ビデオを作成します。クリップごとに新しいプレゼンターを録音する必要がなく、音声関連の動きをアニメーション化します。サポートされるコントロールは、選択したアバター エンドポイントによって異なります。
PoYo トーキングアバターの生成にはどのような入力が必要ですか?
+
現在のトーキング アバター ワークフローは、1 つの参照画像と 1 つの駆動音声ファイルを使用します。モデル ページで正確なフィールド名、受け入れられる形式、制限、品質オプションを確認します。生成リクエストを送信する前に、これらのアセットを準備してください。
しゃべるアバターにはどのようなポートレートを使用すればよいですか?
+
適切な照明があり、口の周りの障害物が少ない、すっきりとした顔を選択してください。小さな顔、極端なトリミング、気を散らす重なりを避けてください。モデルによってリアルな写真と様式化されたキャラクターの処理方法が異なる場合があるため、意図したポートレート スタイルとフレーミングをテストします。
テキストスクリプトから直接アバタービデオを作成できますか?
+
アバター エンドポイントが音声を必要とする場合、まず互換性のある TTS モデルを使用してスクリプトを音声に変換します。発音、一時停止、ペースを確認し、生成された音声をポートレートと一緒に送信します。これにより、音声制作とアバター アニメーションが分離され、修正が容易になります。
アバターのリップシンクの品質を向上するにはどうすればよいですか?
+
背景ノイズが制限され、ソース画像内の口がはっきりと見えるきれいな音声を使用します。自然なペースで短い録音をテストし、難しい音や一時停止を調べます。音声の長さとファイルの設定がモデルの要件を満たしていることを確認します。
話すアバター API は複数の言語をサポートできますか?
+
運転オーディオは音声を提供しますが、アニメーションの品質は言語、声、話し方によって異なります。使用する予定の実際の録音をテストします。翻訳バージョンの場合は、まず適切なナレーションを準備し、文書化されたワークフローに従って各クリップを生成します。
これはリアルタイム インタラクティブ アバター API ですか?
+
このタスクは、生成されたアバター ビデオ クリップ用です。リアルタイム ストリーミング、会話型ターンテイク、ライブ アバター セッションは別の機能です。ライブ インタラクションを設計する前に、特定のエンドポイントを確認してください。非同期ビデオ生成の結果は、リアルタイム サポートを意味するものではありません。
アバターの品質モードはどのように選択すればよいですか?
+
同じポートレートとオーディオで利用可能なモードを比較します。モード名だけで選ぶのではなく、口の位置、顔の安定性、出力の詳細、価格を検討してください。サポートされている解像度と期間の組み合わせについては、モデルのドキュメントを使用してください。
生成されたアバタービデオを取得するにはどうすればよいですか?
+
PoYo 生成を通じて、ポートレートおよびオーディオ入力を備えたモデルを送信します。 task_id を保存し、ステータス クエリまたはサポートされている callback_url によって完了した出力を取得します。リクエスト設定とソースアセットを一緒に保持して、ユーザーが改訂されたナレーションを一貫して再生成できるようにします。
話すアバターの API コストに影響するものは何ですか?
+
モデルの請求単位、オーディオまたは出力の継続時間ルール、および選択した品質モードを確認してください。短いテスト クリップは、完全なナレーション付きプロジェクトのコストを見積もるのに役立ちます。開始レートがすべての品質設定または長さに適用されると想定しないでください。
実在の人物をアニメーションにしたり、その結果を商業的に使用したりできますか?
+
適切な使用許可を得ているポートレートと録音を使用し、選択したモデルとプロジェクトのサービス条件を確認してください。肖像や声を提供する人々に対して、使用目的を明確にしてください。技術的に認められたアップロードは、許可や商業権を確立するものではありません。
トーキングアバターとモーションコントロールはどう違うのですか?
+
Talking Avatar は、音声によって駆動されるポートレートに焦点を当てています。モーション コントロールは、リファレンス ビデオからキャラクター イメージに動きを転送します。パフォーマンスソースと必要な動作に基づいて選択し、モデル固有の入力と出力の品質を比較します。