音频转视频 API

面向开发者的 AI API

音频转视频 API

通过 PoYo 音频转视频 API 构建音频驱动的视觉工作流。对比人像口播与多模态参考模型,确认输入、同步方式、输出和计费。

音频转视频模型 API - 价格和模型适配

选择模型前,对比供应商、支持的输入、输出格式和价格。

精确任务匹配

只有模型目录元数据包含 Audio to Video 的模型才会出现在这里。

供应商对比

无需离开任务目录,即可查看不同供应商的模型系列。

API 就绪路径

每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。

模型供应商任务类型价格
Seedance 2.5

seedance-2.5

SeedanceText to Video, Image to Video, Video to Video$0.085/计费秒
Seedance 2

seedance-2

SeedanceText to Video, Image to Video, Video to Video$0.045/输出与参考视频秒
Seedance 2.0 Mini

seedance-2-mini

SeedanceText to Video, Image to Video, Video to Video$0.03/输出与参考视频秒
Kling Avatar 2.0

kling-avatar-2.0/standard

KlingImage to Video, Audio to Video, Talking Avatar$0.035/秒

常见问题

什么是音频转视频 API?

+

音频转视频 API 将声音作为视频生成的驱动或参考。部分工作流让人像开口说话,其他工作流组合音频、图片、文字或视频。所选模型决定声音控制什么,以及需要哪些额外输入。

只有音频文件可以生成视频吗?

+

仅当接口支持这种输入组合时可以。许多音频驱动流程还需要人像、提示词或视觉参考。提交前确认必填字段,不能仅凭任务名称假定声音能定义完整场景。

音频转视频与 MP3 转 MP4 一样吗?

+

不同。将音轨放在静态图或波形上属于媒体渲染,AI 音频驱动则通过模型生成或动画化视觉内容。先区分格式封装、人物口播和生成画面,再选择接口。

让人像说话应该选哪个 API?

+

优先比较明确要求人像与驱动音频的数字人模型,测试口型、脸部运动和图片要求。普通多模态视频接口可能使用音频参考,但不提供同样的口播控制。

可以生成与歌曲同步的音乐画面吗?

+

应查找明确支持音乐视频或可视化的工作流,并测试节奏和段落跟随效果。普通音频参考能力不保证节拍同步,音乐相关工具与多模态生成可能采用不同输入。

如何准备驱动视频的音频?

+

使用无削波、背景噪声较少、没有长段无关内容的清晰音频,核对编码、时长、大小和 URL 要求。口播先用干净单人语音测试,更容易判断口型与节奏。

可以使用文本转语音 API 生成的旁白吗?

+

音频格式与时长符合视频接口要求时可以。先生成并检查旁白,再作为驱动或参考输入,保存文字、音色设置与音轨,以便后续修改。

所有模型都会保留原始音轨吗?

+

不会。模型可能保留、重新生成或仅参考音频。按文档核对并试听输出;原音轨必须完全一致时,应检查结果并在需要时安排独立音频合成步骤。

如何获取音频转视频结果?

+

提交模型要求的音频和视觉素材,保存 task_id,通过状态查询或支持的 webhook 获取结果。把任务视为可用创意成品之前,应同时检查画面与音轨。

音频转视频 API 如何计费?

+

费用取决于模型、质量和时长规则,可能计算生成秒数、输入时长或其他单位。应连同必要参考素材估算真实请求,不存在适用于所有音频驱动模型的统一单价。

为什么口型或画面节奏不准确?

+

先确认接口针对语音同步或所需节奏行为,再检查音频质量、人像可见程度和时长。先比较短而清晰的样本,再调整参数或生成长片。

在哪里查看音频驱动视频 API 示例?

+

所选模型页提供音频、图片和提示词字段、格式与示例,也可读取模型专属 llms.txt。保证来源素材可访问,并在应用中保存返回的任务 ID。