GPT Image 2.5 API 已上线,立即体验图片生成与编辑 →
GPT Image 2.5 API 已上线,立即体验图片生成与编辑 →
PoYoPoYo
API 市场
定价
企业版
Ctrl+K
poyo.ai

一个 API,调用所有模型。

为开发者而生

All systems operational

资源

  • 替代方案中心
  • 对比中心
  • 博客
  • 供应商
  • 推广合作
  • Features
  • 站点地图

© 2025 PoYo API. 保留所有权利。

热门模型hot

  • Seedance 2.5
  • MiniMax H3 / Hailuo 03
  • FLUX 3
  • Nano Banana Pro
  • Seedance 2
  • GPT Image 2

新上架new

  • GPT-6.1 Sol
  • Claude Sonnet 5.5
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • Qwen Image 2.1
  • GPT-6 Luna

即将上线soon

  • Wan Animate 2

全部供应商

Google

  • Nano Banana Pro
  • Gemini Omni 1.1 Flash
  • Gemini 3.7 Flash
  • Gemini 3.8 Flash
  • Gemini 3.1 Flash TTS
  • Nano Banana
  • Veo 3.1
  • Veo 3.1 Official
  • Omni Flash
  • Nano Banana 2
  • Gemini 3.5 Flash
  • Nano Banana 2 Lite
  • Gemini 3 Series

Kling

  • Kling 3.0 Motion Control
  • Kling 3.0
  • Kling O3
  • Kling 1.6
  • Kling 2.1
  • Kling 2.6
  • Kling Avatar 2.0
  • Kling 2.5 Turbo Pro
  • Kling 3.0 Turbo
  • Kling 2.6 Motion Control
  • Kling O3 Image
  • Kling O1 Image

Anthropic

  • Claude Sonnet 5
  • Claude Fable 5.1
  • Claude Opus 5
  • Claude Opus 5.5
  • Claude Sonnet 5.5
  • Claude Opus 4.8
  • Claude Opus 4.7
  • Claude 4.6 API
  • Claude 4.5 Series

MiniMax

  • MiniMax H3 / Hailuo 03
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • MiniMax Music 2.6
  • Hailuo 02
  • Hailuo 2.3

Tripo3D

  • Tripo3D H3.1
  • Tripo3D P1

Moonshot AI

  • Kimi K3

OpenAI

  • GPT Image 2
  • Sora 2 Official
  • GPT-6 Astra
  • GPT-6 Sol
  • GPT Image 2.5
  • GPT-5.6
  • GPT-6 Luna
  • GPT-6.1 Sol
  • GPT Image 1.5
  • GPT-4o Image
  • GPT-5.5
  • GPT-5.4
  • GPT-5.2

Seedream

  • Seedream 5.0 Pro
  • Seedream 4
  • Seedream 4.5
  • Seedream 5.0 Lite

Seedance

  • Seedance 2.5
  • Seedance 2
  • Seedance 2.0 Mini
  • Seedance 1.0 Pro
  • Seedance 1.5 Pro

DeepSeek

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • DeepSeek V4.1 Flash

Hunyuan

  • Hunyuan 3D v3.1

ElevenLabs

  • ElevenLabs Music
  • ElevenLabs TTS Turbo v2.5
  • ElevenLabs V3 TTS

Black Forest Labs

  • FLUX 3
  • FLUX.2
  • Flux Kontext
  • Flux Dev
  • Flux Schnell

Alibaba

  • Qwen Image 3.0
  • Happy Horse 1.1
  • Wan 2.7 Video
  • Wan 3.0
  • Wan 3.0 Video Prime
  • Qwen Image 2.1
  • Wan Animate 2
  • Wan 2.2 Fast
  • Z-Image
  • Wan 2.5
  • Wan 2.6
  • Wan 2.7 Image
  • Wan Animate
  • Happy Horse

xAI

  • Grok 4.6
  • Grok 4.7
  • Grok Imagine Image 2.0
  • xAI TTS 1
  • Grok Imagine
  • Grok Imagine Video 1.5
  • Grok Imagine Image Quality

Meshy

  • Meshy 6 3D

Runway

  • Runway Gen-4.5

PoYo

  • AI Video Background Removal
  • AI Video Upscaler
  • Image Translator
  • Video Translator
  • Suno Music
GitHubXInstagramYouTubeDiscordTelegramEmail
客户支持文档
图像视频3D音频数字人工具
Loading playground...
AI 数字人生成器指南

使用 AI 数字人生成器 - 创建会说话的数字人视频 的完整指南

AI 数字人生成器 - 创建会说话的数字人视频

将人像或角色图片变成会说话的数字人,让口型同步到任意上传语音,并生成可预览、下载和接入 API 的数字人视频。

在 PoYo 中切换 Kling Avatar 2.0 Standard / Pro,检查输出 MP4,并把审核通过的图片、语音和 prompt 设置复用到 API 工作流。

创建数字人视频

PoYo AI 数字人生成器核心功能

将人像或角色图片与上传语音生成会说话的数字人视频,覆盖口型同步、自然表情、本地化草稿与授权合规交付。

01

图片和语音生成数字人视频

从人脸、主持人或风格化角色图片开始,添加音频文件,生成角色按上传语音开口说话的视频。

  • 用一张参考图作为数字人来源
  • 用上传音频驱动语音和口型
  • 生成主持人式视频输出
图片和语音生成数字人视频流程

02

口型同步、表情和主持人动作

生成匹配语音的嘴型、轻微头部动作、眼神和表情。可在支持的模型变体中用 prompt 指导构图、手势和主持人行为。

  • 让嘴型匹配语音轨道
  • 保留人物身份或角色设计
  • 用 prompt 指导表情、姿态和动作
数字人的口型同步和面部动作

03

多语言语音和本地化数字人视频草稿

为同一张数字人形象图上传不同语言的驱动语音,快速制作营销、培训、产品讲解和客服支持场景的本地化主持人视频草稿。每个语言版本发布前都应人工检查。

  • 同一张数字人形象图可复用于多个语言版本
  • 为每个 locale 上传清晰的语音轨道
  • 人工检查发音、时序和口型同步
多语言语音轨和本地化数字人视频草稿

04

授权合规的数字人使用和生产交付

仅使用你拥有授权的图片、声音和肖像素材。生成后可预览数字人视频、下载 MP4、复制 URL 或 prompt,并把审核通过的设置复用到 API 工作流。

  • 只使用已授权的图片、声音和肖像
  • 避免误导性冒充和未经授权的名人内容
  • 预览、下载并复用审核通过的 API 参数
授权合规的数字人视频预览和 API 交付流程

AI 数字人生成器可以创作什么?

01

产品讲解和 UGC 代言人视频

用图片和语音生成短讲解、产品演示、创始人发言和 UGC 风格代言人视频。

02

培训、课程和入门讲解

将课程脚本、入职培训语音和内部培训音频变成主持人讲解视频。

03

多语言营销和本地化草稿

用同一张主持人图片搭配不同语言语音,快速制作区域广告、教程和公告草稿。

04

虚拟主持人、客服和助手演示

为客服讲解、助手演示、帮助中心视频和产品引导流程创建虚拟主持人。

05

社媒创作者短片、广告和短内容

生成适合社媒发布的数字人视频,用于创作者内容、短广告、活动版本和快速测试。

06

开发者、API 和 agent 工作流

在接入产品前验证数字人 prompt、图片/音频输入、视频预览和响应 URL。

如何在 PoYo 使用 AI 数字人生成器

1. 选择 Standard 或 Pro。 在 Input 面板的模型选择器中选择 Kling Avatar 2.0 变体。

2. 添加数字人形象图。 上传或提供清晰的人像、主持人或角色图片,确保脸部可见。

3. 添加驱动语音。 上传数字人要说的语音轨道,并可用 prompt 描述构图、表情、手势和场景行为。

4. 生成并预览。 运行任务,在 Output 中检查视频,下载 MP4,并将测试过的参数复用到 API 工作流。

AI 数字人生成器常见问题

AI 数字人视频生成器可以生成什么?

PoYo 数字人视频生成器可以根据参考图片和驱动音频生成数字人视频,适合主持人视频、虚拟主播、产品讲解、培训短片和本地化数字人视频草稿。

这是静态数字人工具还是数字人视频工具?

这个页面用于数字人视频生成,不是静态数字人形象图标、卡通数字人、证件照或数字人素材库工具。

我需要准备哪些输入?

你需要一张清晰数字人形象图和一个音频文件。prompt 不是必填,但可以帮助描述构图、表情、手势、场景和主持人行为。

Standard 和 Pro 应该选哪个?

直接生成数字人短片或快速测试时选 Standard;需要更丰富的主持人指令、更有表现力的动作或更精致的视频草稿时选 Pro。

口型同步准确吗?

口型质量取决于数字人形象图、脸部可见度、音频清晰度、语言、语速和所选模型。建议使用干净语音,避免噪音,并在发布前人工检查输出。

可以使用真人、员工或名人图片吗?

只能使用你拥有权利和授权的图片、声音与肖像。不要生成误导性、冒充或未经授权的名人/真人内容。

可以预览或下载什么格式?

Output 图库可在浏览器中预览生成的视频,并支持下载 provider 返回的视频文件,通常为 MP4。

生成要多久,如何计费,能商用吗?

耗时和积分取决于模型变体、输入媒体、时长和 provider 处理情况。Input 底部会显示当前成本。商业使用取决于 provider 条款,以及你对图片、声音、脚本和肖像拥有的权利。

为什么用 PoYo 做 AI 数字人生成

01

专注的数字人视频流程

不用在所有视频模型里查找,直接进入专门的数字人生成页面。

02

内置视频输出

在 Output 图库直接预览数字人视频,也可以打开完整预览弹窗。

03

原生模型控制

图片、音频、prompt、Standard 和 Pro 控制项都保留在数字人模型流程里。

04

从 Playground 到 API

先可视化测试数字人输入,再把同一工作流接入 API 产品。