01
图片和语音生成数字人视频
从人脸、主持人或风格化角色图片开始,添加音频文件,生成角色按上传语音开口说话的视频。
- 用一张参考图作为数字人来源
- 用上传音频驱动语音和口型
- 生成主持人式视频输出
使用 AI 数字人生成器 - 创建会说话的数字人视频 的完整指南
将人像或角色图片变成会说话的数字人,让口型同步到任意上传语音,并生成可预览、下载和接入 API 的数字人视频。
在 PoYo 中切换 Kling Avatar 2.0 Standard / Pro,检查输出 MP4,并把审核通过的图片、语音和 prompt 设置复用到 API 工作流。
将人像或角色图片与上传语音生成会说话的数字人视频,覆盖口型同步、自然表情、本地化草稿与授权合规交付。
01
从人脸、主持人或风格化角色图片开始,添加音频文件,生成角色按上传语音开口说话的视频。
02
生成匹配语音的嘴型、轻微头部动作、眼神和表情。可在支持的模型变体中用 prompt 指导构图、手势和主持人行为。
03
为同一张数字人形象图上传不同语言的驱动语音,快速制作营销、培训、产品讲解和客服支持场景的本地化主持人视频草稿。每个语言版本发布前都应人工检查。
04
仅使用你拥有授权的图片、声音和肖像素材。生成后可预览数字人视频、下载 MP4、复制 URL 或 prompt,并把审核通过的设置复用到 API 工作流。
用图片和语音生成短讲解、产品演示、创始人发言和 UGC 风格代言人视频。
将课程脚本、入职培训语音和内部培训音频变成主持人讲解视频。
用同一张主持人图片搭配不同语言语音,快速制作区域广告、教程和公告草稿。
为客服讲解、助手演示、帮助中心视频和产品引导流程创建虚拟主持人。
生成适合社媒发布的数字人视频,用于创作者内容、短广告、活动版本和快速测试。
在接入产品前验证数字人 prompt、图片/音频输入、视频预览和响应 URL。
1. 选择 Standard 或 Pro。 在 Input 面板的模型选择器中选择 Kling Avatar 2.0 变体。
2. 添加数字人形象图。 上传或提供清晰的人像、主持人或角色图片,确保脸部可见。
3. 添加驱动语音。 上传数字人要说的语音轨道,并可用 prompt 描述构图、表情、手势和场景行为。
4. 生成并预览。 运行任务,在 Output 中检查视频,下载 MP4,并将测试过的参数复用到 API 工作流。
PoYo 数字人视频生成器可以根据参考图片和驱动音频生成数字人视频,适合主持人视频、虚拟主播、产品讲解、培训短片和本地化数字人视频草稿。
这个页面用于数字人视频生成,不是静态数字人形象图标、卡通数字人、证件照或数字人素材库工具。
你需要一张清晰数字人形象图和一个音频文件。prompt 不是必填,但可以帮助描述构图、表情、手势、场景和主持人行为。
直接生成数字人短片或快速测试时选 Standard;需要更丰富的主持人指令、更有表现力的动作或更精致的视频草稿时选 Pro。
口型质量取决于数字人形象图、脸部可见度、音频清晰度、语言、语速和所选模型。建议使用干净语音,避免噪音,并在发布前人工检查输出。
只能使用你拥有权利和授权的图片、声音与肖像。不要生成误导性、冒充或未经授权的名人/真人内容。
Output 图库可在浏览器中预览生成的视频,并支持下载 provider 返回的视频文件,通常为 MP4。
耗时和积分取决于模型变体、输入媒体、时长和 provider 处理情况。Input 底部会显示当前成本。商业使用取决于 provider 条款,以及你对图片、声音、脚本和肖像拥有的权利。
不用在所有视频模型里查找,直接进入专门的数字人生成页面。
在 Output 图库直接预览数字人视频,也可以打开完整预览弹窗。
图片、音频、prompt、Standard 和 Pro 控制项都保留在数字人模型流程里。
先可视化测试数字人输入,再把同一工作流接入 API 产品。