文本转语音 API

面向开发者的 AI API

文本转语音 API

通过 PoYo 文本转语音 API 接入 AI 配音。对比 TTS 模型的语言、音色、表达控制、音频格式和价格,构建旁白与语音工作流。

文本转语音模型 API - 价格和模型适配

选择模型前,对比供应商、支持的输入、输出格式和价格。

精确任务匹配

只有模型目录元数据包含 Text to Speech 的模型才会出现在这里。

供应商对比

无需离开任务目录,即可查看不同供应商的模型系列。

API 就绪路径

每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。

模型供应商任务类型价格
ElevenLabs TTS Turbo v2.5

elevenlabs-tts-turbo-2-5

ElevenLabsText to Speech$0.04/千字符
ElevenLabs V3 TTS

elevenlabs-v3-tts

ElevenLabsText to Speech$0.08/千字符
Gemini 3.1 Flash TTS

gemini-3-1-flash-tts

GoogleText to Speech$0.12/千字符
xAI TTS 1

xai-tts-1

xAIText to Speech$0.012/千字符

常见问题

什么是文本转语音 API?

+

文本转语音 API 根据文字生成语音,让应用无需逐条录音即可制作旁白与朗读内容。音色、语言、表达方式和格式以所选模型为准。

如何选择 TTS API 模型?

+

使用真实脚本测试人名、数字和长句,比较自然度、发音、情绪控制、音色稳定和成本。确认语言、格式及请求流程,响应时间重要时尤其应实测。

可以调整音色、语速和情绪吗?

+

不同模型可能提供预设音色、语速、稳定性、风格指令或音频标签。只使用文档支持的字段和取值,不应通过未提供的参数假定模型具备某项控制。

文本转语音 API 支持哪些语言?

+

语言覆盖和发音效果取决于模型与音色。查看语言设置或自动检测方式,再测试母语文字和混合语言;多语言标签不保证所有口音与专有名词表现一致。

人名、缩写和数字读错怎么办?

+

将文本改写为更适合口语的形式,展开有歧义的缩写,并先测试短句。有发音或文本规范化设置时按文档使用;展示文字不一定适合直接作为配音脚本。

可以生成长篇旁白吗?

+

先查文本限制与输出规则,按自然段或句子拆分长文,复用音色设置并检查拼接。模型支持上下文参数时可用于保持连续性。

TTS API 会自动克隆声音吗?

+

不会。选择合成音色与根据录音创建声音克隆是不同能力。克隆需要明确支持的工作流与适当授权,不能仅凭语音合成接口设计自定义声音功能。

可以获取词级时间戳或生成多角色对话吗?

+

部分模型提供时间戳或多说话人控制,其他模型不提供。先核对输入与输出字段,再用实际脚本验证对齐,之后用于字幕或同步高亮。

可以请求哪些音频格式?

+

使用所选模型支持的编码与质量设置。网页播放、电话和编辑可能需要不同格式或采样率,完成后检查输出;接口不支持的格式可通过独立媒体步骤转换。

如何获取 PoYo 生成的语音?

+

按模型生成接口提交请求,保存 task_id,通过状态查询或支持的 callback_url 获取音频。低延迟模型不等于 PoYo 一定提供流式接口,应核对实际文档。

文本转语音 API 如何计费?

+

可能按字符、token、生成次数或其他模型单位计费。核对统计方式与可选设置,按完整脚本和重试次数估算,不能直接比较不同单位的数字。

如何将 TTS 与数字人 API 组合?

+

先生成并检查语音,确认格式和时长符合数字人要求,再与人像一同提交,并单独跟踪视频任务。保留文字与音色设置,方便后续修改。