面向开发者的 AI API
AI 数字人 API
使用 PoYo AI 数字人 API,把人像图片和语音转为口播视频。对比输入要求、口型、表情、质量档位和费用,构建数字人口播工作流。
数字人模型 API - 价格和模型适配
选择模型前,对比供应商、支持的输入、输出格式和价格。
精确任务匹配
只有模型目录元数据包含 Talking Avatar 的模型才会出现在这里。
供应商对比
无需离开任务目录,即可查看不同供应商的模型系列。
API 就绪路径
每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。
| 模型 | 供应商 | 任务类型 | 价格 |
|---|---|---|---|
| Kling Avatar 2.0 kling-avatar-2.0/standard | Kling | Image to Video, Audio to Video, Talking Avatar | $0.035/秒 |
常见问题
什么是 AI 数字人 API?
+
AI 数字人 API 根据人像与音频等指定输入生成说话角色视频,适合在应用中自动制作口播内容。可用表情、画质和其他控制以具体数字人接口为准。
PoYo 数字人生成需要什么输入?
+
当前口播工作流使用一张参考图片和一份驱动音频。先在模型页确认字段、格式、时长、大小与质量选项,准备好素材后再提交。
什么人像更适合数字人视频?
+
选择脸部清楚、光线合理、嘴部遮挡较少的图片,避免脸太小或极端裁剪。应测试实际人物风格和构图,真人照片与风格化角色的表现可能不同。
可以直接用文字脚本生成口播吗?
+
所选接口要求音频时,应先通过兼容的文本转语音模型生成旁白,检查发音、停顿与节奏,再与人像一起提交。语音和动画分步处理更便于修改。
如何改善数字人口型?
+
使用清晰、低噪声语音和嘴部可见的人像,先测试短片段,检查复杂发音和停顿。确认音频长度与文件设置符合模型要求。
数字人 API 支持多语言吗?
+
语音由驱动音频提供,但效果会随语言、音色和表达方式变化。测试计划使用的实际录音;制作翻译版本时,先准备合适旁白,再分别生成视频。
这是实时互动数字人 API 吗?
+
此任务用于生成数字人视频片段,实时流媒体、对话轮次与直播会话属于其他能力。设计实时互动前必须确认接口支持,异步生成结果不代表实时服务。
如何选择数字人质量模式?
+
用相同人像和音频比较模式,检查口型、脸部稳定、输出细节与价格,而不是只看模式名称。支持的分辨率和时长组合以文档为准。
如何获取生成的数字人视频?
+
提交模型要求的人像和音频,保存 task_id,通过状态查询或支持的 callback_url 获取完成结果。保留素材与设置,便于修改旁白后重新生成。
数字人 API 的费用受什么影响?
+
查看计费单位、音频或输出时长规则与质量档位。先用短片估算完整旁白项目的费用,不应把最低起始费率套用到所有模式和长度。
可以使用真人肖像或将结果商用吗?
+
应有适当的人像与录音使用授权,并检查模型和服务条款。向素材提供者说明用途;接口能处理上传,不代表已经取得肖像、声音或商业使用权利。
数字人与动作控制有什么区别?
+
数字人口播主要以语音驱动人像,动作控制主要将参考视频的运动转移到角色图片。根据表演来源和所需动作选择,再比较具体输入与生成效果。