
面向开发者的 AI API
文本转语音 API
通过 PoYo 文本转语音 API 接入 AI 配音。对比 TTS 模型的语言、音色、表达控制、音频格式和价格,构建旁白与语音工作流。
匹配模型
4 个模型

$0.04 /千字符
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /千字符
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /千字符
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /千字符
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
文本转语音模型 API - 价格和模型适配
选择模型前,对比供应商、支持的输入、输出格式和价格。
精确任务匹配
只有模型目录元数据包含 Text to Speech 的模型才会出现在这里。
供应商对比
无需离开任务目录,即可查看不同供应商的模型系列。
API 就绪路径
每张模型卡都会跳转到 PoYo 的价格、示例、Playground 控件和 API 详情。
| 模型 | 供应商 | 任务类型 | 价格 |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/千字符 |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/千字符 |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/千字符 | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/千字符 |
常见问题
什么是文本转语音 API?
+
文本转语音 API 根据文字生成语音,让应用无需逐条录音即可制作旁白与朗读内容。音色、语言、表达方式和格式以所选模型为准。
如何选择 TTS API 模型?
+
使用真实脚本测试人名、数字和长句,比较自然度、发音、情绪控制、音色稳定和成本。确认语言、格式及请求流程,响应时间重要时尤其应实测。
可以调整音色、语速和情绪吗?
+
不同模型可能提供预设音色、语速、稳定性、风格指令或音频标签。只使用文档支持的字段和取值,不应通过未提供的参数假定模型具备某项控制。
文本转语音 API 支持哪些语言?
+
语言覆盖和发音效果取决于模型与音色。查看语言设置或自动检测方式,再测试母语文字和混合语言;多语言标签不保证所有口音与专有名词表现一致。
人名、缩写和数字读错怎么办?
+
将文本改写为更适合口语的形式,展开有歧义的缩写,并先测试短句。有发音或文本规范化设置时按文档使用;展示文字不一定适合直接作为配音脚本。
可以生成长篇旁白吗?
+
先查文本限制与输出规则,按自然段或句子拆分长文,复用音色设置并检查拼接。模型支持上下文参数时可用于保持连续性。
TTS API 会自动克隆声音吗?
+
不会。选择合成音色与根据录音创建声音克隆是不同能力。克隆需要明确支持的工作流与适当授权,不能仅凭语音合成接口设计自定义声音功能。
可以获取词级时间戳或生成多角色对话吗?
+
部分模型提供时间戳或多说话人控制,其他模型不提供。先核对输入与输出字段,再用实际脚本验证对齐,之后用于字幕或同步高亮。
可以请求哪些音频格式?
+
使用所选模型支持的编码与质量设置。网页播放、电话和编辑可能需要不同格式或采样率,完成后检查输出;接口不支持的格式可通过独立媒体步骤转换。
如何获取 PoYo 生成的语音?
+
按模型生成接口提交请求,保存 task_id,通过状态查询或支持的 callback_url 获取音频。低延迟模型不等于 PoYo 一定提供流式接口,应核对实际文档。
文本转语音 API 如何计费?
+
可能按字符、token、生成次数或其他模型单位计费。核对统计方式与可选设置,按完整脚本和重试次数估算,不能直接比较不同单位的数字。
如何将 TTS 与数字人 API 组合?
+
先生成并检查语音,确认格式和时长符合数字人要求,再与人像一同提交,并单独跟踪视频任务。保留文字与音色设置,方便后续修改。