01
富有表现力的多语言文本转语音
将脚本、产品文案、旁白和对话转换为自然音频。支持的模型会展示声音选择、语言控制、情绪标签、文本规范化、语速和时间戳等能力。
- 从文本脚本生成配音和旁白
- 在模型支持时控制语言、声音和表达方式
- 为应用、视频、课程和智能体创建语音

使用 面向语音和音乐创作的完整音频生成器 的完整指南
PoYo 音频生成器将领先的语音、配音和音乐生成模型集中到一个专注工作区。你可以直接在 Input 面板中选择 ElevenLabs、Gemini、xAI、MiniMax 等可执行音频模型,而不需要在多个厂商工具之间切换。
每个模型都会保留自己的原生参数,因此语言、声音、情绪标签、语速、歌词、纯伴奏模式、输出格式、预览、JSON 响应和下载流程只会在当前模型支持时出现。
生成语音、配音和音乐,并在同一流程中完成预览、下载和 API 参数验证。
01
将脚本、产品文案、旁白和对话转换为自然音频。支持的模型会展示声音选择、语言控制、情绪标签、文本规范化、语速和时间戳等能力。

02
通过提示词、歌词、纯伴奏设置和结构化编曲想法创建音乐。文本转音乐模型适合快速生成 demo、hook、伴奏和创意方向。

03
在不同音频模型之间切换,同时保留各自的原生控制项。快速 TTS、表现力语音、音乐生成、采样率、码率、输出格式和质量参数都会跟随当前模型变化。

04
直接在浏览器中试听生成音频,在返回时查看结构化 JSON 和时间戳,下载最终文件,并将验证过的参数迁移到 API 或自动化工作流。

为产品演示、短视频、教程和多语言版本快速生成旁白、解说和配音草稿。
生成课程讲解、章节预览、播客片段和长文本旁白测试,再进入录制或后期制作。
原型验证 App 语音、屏幕朗读、引导页旁白和本地化语音体验。
通过提示词、歌词和风格方向生成歌曲想法、伴奏、hook、demo 和背景音乐。
探索角色声音、游戏界面音频、创作者素材和互动媒体音频概念。
在接入 API 产品前验证提示词、声音、格式、预览和 JSON 响应。
1. 在 Input 面板选择音频模型。选择适合语音或音乐工作流的提供商和可执行模型。
2. 添加文本、歌词或音乐方向。根据当前模型要求填写脚本、提示词、语言、声音风格、情绪、乐器或歌词。
3. 调整模型专属参数。只设置当前模型展示的选项,例如声音、情绪标签、语速、采样率、码率、输出格式、歌词优化或纯伴奏模式。
4. 运行、预览并下载。提交生成任务,试听音频预览,需要时查看 JSON,并下载生成文件。
PoYo 音频生成器可以根据所选模型创建文本转语音、配音、旁白、对话、音乐 demo、歌曲和纯伴奏。Input 面板只会展示当前音频模型支持的字段。
表达力配音可以先试 ElevenLabs V3 TTS;快速语音测试可以用 ElevenLabs TTS Turbo v2.5 或 xAI TTS 1;需要自然语言风格指令可试 Gemini 3.1 Flash TTS;结构化音乐生成可试 ElevenLabs Music;Prompt 和歌词工作流可试 MiniMax Music 2.6;通用音乐创作可试 Generate Music。
质量取决于模型、提示词、语言、声音和输出设置。现代 TTS 模型可以非常自然,但生产使用前仍建议做试听、发音修正、节奏检查和最终母带处理。
可以,前提是所选模型支持这些参数。部分语音模型支持语言、声音、语速、稳定性、风格、情绪标签和时间戳;音乐模型可能支持类型、情绪、歌词、纯伴奏、段落结构和输出格式。
图库可以在浏览器中预览常见音频文件。根据厂商返回结果,下载内容可能包含 MP3、WAV、OGG、Opus、PCM、mu-law、A-law、时间戳或辅助文件。
使用干净脚本、清晰发音提示、具体声音方向、自然节奏和克制的情绪标签。生成音乐时,写清类型、情绪、速度、乐器、人声、结构、歌词和需要避免的元素。
耗时和成本会随模型、文本长度、音频时长、格式、音乐长度、质量设置和厂商变化。运行较长旁白或音乐前,请先查看 Input 底部的当前模型成本。
商用取决于所选模型、厂商条款、账号计划,以及脚本、歌词、声音、参考素材和上传内容的权利。请查看相关条款,避免使用没有授权的内容。
无需在多个厂商工具之间重建提示词,就能比较语音、配音和音乐生成模型。
每个模型保留自己的声音、语言、风格、歌词、格式和结果流程。
下载前可以直接在输出图库中试听生成音频。
先测试脚本、提示词、声音、格式和 JSON 响应,再迁移到 API 产品。