
面向开发者的 AI API
音频转视频 API
通过 PoYo 音频转视频 API 构建音频驱动的视觉工作流。对比人像口播与多模态参考模型,确认输入、同步方式、输出和计费。
匹配模型
4 个模型

$0.085 /计费秒
seedance-2.5
ByteDance Seedance 2.5 video generation with 4-30 second output, first and last frame control, up to 50 image, video, and audio references, optional synchronized audio, and 480p, 720p, or 1080p delivery.

$0.045 /输出与参考视频秒
seedance-2
ByteDance Seedance 2 video generation with text-to-video, image-to-video, multimodal reference-to-video, video-to-video, and audio-to-video workflows using image, video, and audio references with optional native audio.

$0.03 /输出与参考视频秒
seedance-2-mini
ByteDance Seedance 2.0 Mini video generation for lower-cost text-to-video, image-to-video, and multimodal reference workflows with 480p and 720p output.
$0.035 /秒
kling-avatar-2.0/standard
Kling Avatar 2.0 creates audio-driven talking avatar videos from one reference image and one driving audio file, with Standard and Pro quality modes.
音频转视频模型 API - 价格和模型适配
选择模型前,对比供应商、支持的输入、输出格式和价格。
精确任务匹配
只有模型目录元数据包含 Audio to Video 的模型才会出现在这里。
供应商对比
无需离开任务目录,即可查看不同供应商的模型系列。
API 就绪路径
每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。
| 模型 | 供应商 | 任务类型 | 价格 |
|---|---|---|---|
| Seedance 2.5 seedance-2.5 | Seedance | Text to Video, Image to Video, Video to Video | $0.085/计费秒 |
| Seedance 2 seedance-2 | Seedance | Text to Video, Image to Video, Video to Video | $0.045/输出与参考视频秒 |
| Seedance 2.0 Mini seedance-2-mini | Seedance | Text to Video, Image to Video, Video to Video | $0.03/输出与参考视频秒 |
| Kling Avatar 2.0 kling-avatar-2.0/standard | Kling | Image to Video, Audio to Video, Talking Avatar | $0.035/秒 |
常见问题
什么是音频转视频 API?
+
音频转视频 API 将声音作为视频生成的驱动或参考。部分工作流让人像开口说话,其他工作流组合音频、图片、文字或视频。所选模型决定声音控制什么,以及需要哪些额外输入。
只有音频文件可以生成视频吗?
+
仅当接口支持这种输入组合时可以。许多音频驱动流程还需要人像、提示词或视觉参考。提交前确认必填字段,不能仅凭任务名称假定声音能定义完整场景。
音频转视频与 MP3 转 MP4 一样吗?
+
不同。将音轨放在静态图或波形上属于媒体渲染,AI 音频驱动则通过模型生成或动画化视觉内容。先区分格式封装、人物口播和生成画面,再选择接口。
让人像说话应该选哪个 API?
+
优先比较明确要求人像与驱动音频的数字人模型,测试口型、脸部运动和图片要求。普通多模态视频接口可能使用音频参考,但不提供同样的口播控制。
可以生成与歌曲同步的音乐画面吗?
+
应查找明确支持音乐视频或可视化的工作流,并测试节奏和段落跟随效果。普通音频参考能力不保证节拍同步,音乐相关工具与多模态生成可能采用不同输入。
如何准备驱动视频的音频?
+
使用无削波、背景噪声较少、没有长段无关内容的清晰音频,核对编码、时长、大小和 URL 要求。口播先用干净单人语音测试,更容易判断口型与节奏。
可以使用文本转语音 API 生成的旁白吗?
+
音频格式与时长符合视频接口要求时可以。先生成并检查旁白,再作为驱动或参考输入,保存文字、音色设置与音轨,以便后续修改。
所有模型都会保留原始音轨吗?
+
不会。模型可能保留、重新生成或仅参考音频。按文档核对并试听输出;原音轨必须完全一致时,应检查结果并在需要时安排独立音频合成步骤。
如何获取音频转视频结果?
+
提交模型要求的音频和视觉素材,保存 task_id,通过状态查询或支持的 webhook 获取结果。把任务视为可用创意成品之前,应同时检查画面与音轨。
音频转视频 API 如何计费?
+
费用取决于模型、质量和时长规则,可能计算生成秒数、输入时长或其他单位。应连同必要参考素材估算真实请求,不存在适用于所有音频驱动模型的统一单价。
为什么口型或画面节奏不准确?
+
先确认接口针对语音同步或所需节奏行为,再检查音频质量、人像可见程度和时长。先比较短而清晰的样本,再调整参数或生成长片。
在哪里查看音频驱动视频 API 示例?
+
所选模型页提供音频、图片和提示词字段、格式与示例,也可读取模型专属 llms.txt。保证来源素材可访问,并在应用中保存返回的任务 ID。