AI 数字人 API

面向开发者的 AI API

AI 数字人 API

使用 PoYo AI 数字人 API,把人像图片和语音转为口播视频。对比输入要求、口型、表情、质量档位和费用,构建数字人口播工作流。

数字人模型 API - 价格和模型适配

选择模型前,对比供应商、支持的输入、输出格式和价格。

精确任务匹配

只有模型目录元数据包含 Talking Avatar 的模型才会出现在这里。

供应商对比

无需离开任务目录,即可查看不同供应商的模型系列。

API 就绪路径

每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。

模型供应商任务类型价格
Kling Avatar 2.0

kling-avatar-2.0/standard

KlingImage to Video, Audio to Video, Talking Avatar$0.035/秒

常见问题

什么是 AI 数字人 API?

+

AI 数字人 API 根据人像与音频等指定输入生成说话角色视频,适合在应用中自动制作口播内容。可用表情、画质和其他控制以具体数字人接口为准。

PoYo 数字人生成需要什么输入?

+

当前口播工作流使用一张参考图片和一份驱动音频。先在模型页确认字段、格式、时长、大小与质量选项,准备好素材后再提交。

什么人像更适合数字人视频?

+

选择脸部清楚、光线合理、嘴部遮挡较少的图片,避免脸太小或极端裁剪。应测试实际人物风格和构图,真人照片与风格化角色的表现可能不同。

可以直接用文字脚本生成口播吗?

+

所选接口要求音频时,应先通过兼容的文本转语音模型生成旁白,检查发音、停顿与节奏,再与人像一起提交。语音和动画分步处理更便于修改。

如何改善数字人口型?

+

使用清晰、低噪声语音和嘴部可见的人像,先测试短片段,检查复杂发音和停顿。确认音频长度与文件设置符合模型要求。

数字人 API 支持多语言吗?

+

语音由驱动音频提供,但效果会随语言、音色和表达方式变化。测试计划使用的实际录音;制作翻译版本时,先准备合适旁白,再分别生成视频。

这是实时互动数字人 API 吗?

+

此任务用于生成数字人视频片段,实时流媒体、对话轮次与直播会话属于其他能力。设计实时互动前必须确认接口支持,异步生成结果不代表实时服务。

如何选择数字人质量模式?

+

用相同人像和音频比较模式,检查口型、脸部稳定、输出细节与价格,而不是只看模式名称。支持的分辨率和时长组合以文档为准。

如何获取生成的数字人视频?

+

提交模型要求的人像和音频,保存 task_id,通过状态查询或支持的 callback_url 获取完成结果。保留素材与设置,便于修改旁白后重新生成。

数字人 API 的费用受什么影响?

+

查看计费单位、音频或输出时长规则与质量档位。先用短片估算完整旁白项目的费用,不应把最低起始费率套用到所有模式和长度。

可以使用真人肖像或将结果商用吗?

+

应有适当的人像与录音使用授权,并检查模型和服务条款。向素材提供者说明用途;接口能处理上传,不代表已经取得肖像、声音或商业使用权利。

数字人与动作控制有什么区别?

+

数字人口播主要以语音驱动人像,动作控制主要将参考视频的运动转移到角色图片。根据表演来源和所需动作选择,再比较具体输入与生成效果。