GPT Image 2.5 API 已上线,立即体验图片生成与编辑 →
GPT Image 2.5 API 已上线,立即体验图片生成与编辑 →
PoYoPoYo
API 市场
定价
企业版
Ctrl+K
poyo.ai

一个 API,调用所有模型。

为开发者而生

All systems operational

资源

  • 替代方案中心
  • 对比中心
  • 博客
  • 供应商
  • 推广合作
  • Features
  • 站点地图

© 2025 PoYo API. 保留所有权利。

热门模型hot

  • Seedance 2.5
  • MiniMax H3 / Hailuo 03
  • FLUX 3
  • Nano Banana Pro
  • Seedance 2
  • GPT Image 2

新上架new

  • GPT-6.1 Sol
  • Claude Sonnet 5.5
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • Qwen Image 2.1
  • GPT-6 Luna

即将上线soon

  • Wan Animate 2

全部供应商

Google

  • Nano Banana Pro
  • Gemini Omni 1.1 Flash
  • Gemini 3.7 Flash
  • Gemini 3.8 Flash
  • Gemini 3.1 Flash TTS
  • Nano Banana
  • Veo 3.1
  • Veo 3.1 Official
  • Omni Flash
  • Nano Banana 2
  • Gemini 3.5 Flash
  • Nano Banana 2 Lite
  • Gemini 3 Series

Kling

  • Kling 3.0 Motion Control
  • Kling 3.0
  • Kling O3
  • Kling 1.6
  • Kling 2.1
  • Kling 2.6
  • Kling Avatar 2.0
  • Kling 2.5 Turbo Pro
  • Kling 3.0 Turbo
  • Kling 2.6 Motion Control
  • Kling O3 Image
  • Kling O1 Image

Anthropic

  • Claude Sonnet 5
  • Claude Fable 5.1
  • Claude Opus 5
  • Claude Opus 5.5
  • Claude Sonnet 5.5
  • Claude Opus 4.8
  • Claude Opus 4.7
  • Claude 4.6 API
  • Claude 4.5 Series

MiniMax

  • MiniMax H3 / Hailuo 03
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • MiniMax Music 2.6
  • Hailuo 02
  • Hailuo 2.3

Tripo3D

  • Tripo3D H3.1
  • Tripo3D P1

Moonshot AI

  • Kimi K3

OpenAI

  • GPT Image 2
  • Sora 2 Official
  • GPT-6 Astra
  • GPT-6 Sol
  • GPT Image 2.5
  • GPT-5.6
  • GPT-6 Luna
  • GPT-6.1 Sol
  • GPT Image 1.5
  • GPT-4o Image
  • GPT-5.5
  • GPT-5.4
  • GPT-5.2

Seedream

  • Seedream 5.0 Pro
  • Seedream 4
  • Seedream 4.5
  • Seedream 5.0 Lite

Seedance

  • Seedance 2.5
  • Seedance 2
  • Seedance 2.0 Mini
  • Seedance 1.0 Pro
  • Seedance 1.5 Pro

DeepSeek

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • DeepSeek V4.1 Flash

Hunyuan

  • Hunyuan 3D v3.1

ElevenLabs

  • ElevenLabs Music
  • ElevenLabs TTS Turbo v2.5
  • ElevenLabs V3 TTS

Black Forest Labs

  • FLUX 3
  • FLUX.2
  • Flux Kontext
  • Flux Dev
  • Flux Schnell

Alibaba

  • Qwen Image 3.0
  • Happy Horse 1.1
  • Wan 2.7 Video
  • Wan 3.0
  • Wan 3.0 Video Prime
  • Qwen Image 2.1
  • Wan Animate 2
  • Wan 2.2 Fast
  • Z-Image
  • Wan 2.5
  • Wan 2.6
  • Wan 2.7 Image
  • Wan Animate
  • Happy Horse

xAI

  • Grok 4.6
  • Grok 4.7
  • Grok Imagine Image 2.0
  • xAI TTS 1
  • Grok Imagine
  • Grok Imagine Video 1.5
  • Grok Imagine Image Quality

Meshy

  • Meshy 6 3D

Runway

  • Runway Gen-4.5

PoYo

  • AI Video Background Removal
  • AI Video Upscaler
  • Image Translator
  • Video Translator
  • Suno Music
GitHubXInstagramYouTubeDiscordTelegramEmail
客户支持文档
图像视频3D音频数字人工具
Loading playground...
音频生成器指南

使用 面向语音和音乐创作的完整音频生成器 的完整指南

面向语音和音乐创作的完整音频生成器

PoYo 音频生成器将领先的语音、配音和音乐生成模型集中到一个专注工作区。你可以直接在 Input 面板中选择 ElevenLabs、Gemini、xAI、MiniMax 等可执行音频模型,而不需要在多个厂商工具之间切换。

每个模型都会保留自己的原生参数,因此语言、声音、情绪标签、语速、歌词、纯伴奏模式、输出格式、预览、JSON 响应和下载流程只会在当前模型支持时出现。

开始创作

PoYo 音频生成器的核心功能

生成语音、配音和音乐,并在同一流程中完成预览、下载和 API 参数验证。

01

富有表现力的多语言文本转语音

将脚本、产品文案、旁白和对话转换为自然音频。支持的模型会展示声音选择、语言控制、情绪标签、文本规范化、语速和时间戳等能力。

  • 从文本脚本生成配音和旁白
  • 在模型支持时控制语言、声音和表达方式
  • 为应用、视频、课程和智能体创建语音
多语言文本转语音工作流

02

Prompt 到音乐和歌曲创作

通过提示词、歌词、纯伴奏设置和结构化编曲想法创建音乐。文本转音乐模型适合快速生成 demo、hook、伴奏和创意方向。

  • 生成歌曲、纯音乐和音乐概念
  • 控制情绪、类型、编曲、歌词和人声
  • 使用模型支持的结构化作曲字段
文本转音乐生成工作流

03

模型专属的质量、速度和格式控制

在不同音频模型之间切换,同时保留各自的原生控制项。快速 TTS、表现力语音、音乐生成、采样率、码率、输出格式和质量参数都会跟随当前模型变化。

  • 在一个选择器中比较多个音频提供商
  • 只展示当前模型支持的参数
  • 选择 MP3、WAV、OGG、PCM 或厂商特定格式
音频模型控制和格式设置

04

预览、下载和 API 交付

直接在浏览器中试听生成音频,在返回时查看结构化 JSON 和时间戳,下载最终文件,并将验证过的参数迁移到 API 或自动化工作流。

  • 下载前先预览音频输出
  • 下载可用于剪辑和发布的音频文件
  • 在 API 集成前验证提示词和参数
音频预览和 API 交付工作流

你可以用 PoYo 音频生成器创建什么?

01

视频配音和多语言 dubbing

为产品演示、短视频、教程和多语言版本快速生成旁白、解说和配音草稿。

02

播客、有声书和课程旁白

生成课程讲解、章节预览、播客片段和长文本旁白测试,再进入录制或后期制作。

03

多语言应用语音和无障碍体验

原型验证 App 语音、屏幕朗读、引导页旁白和本地化语音体验。

04

音乐 demo、歌曲和伴奏

通过提示词、歌词和风格方向生成歌曲想法、伴奏、hook、demo 和背景音乐。

05

社交、游戏和创意音频概念

探索角色声音、游戏界面音频、创作者素材和互动媒体音频概念。

06

开发者、API 和智能体工作流

在接入 API 产品前验证提示词、声音、格式、预览和 JSON 响应。

如何在 PoYo 使用音频生成器

1. 在 Input 面板选择音频模型。选择适合语音或音乐工作流的提供商和可执行模型。

2. 添加文本、歌词或音乐方向。根据当前模型要求填写脚本、提示词、语言、声音风格、情绪、乐器或歌词。

3. 调整模型专属参数。只设置当前模型展示的选项,例如声音、情绪标签、语速、采样率、码率、输出格式、歌词优化或纯伴奏模式。

4. 运行、预览并下载。提交生成任务,试听音频预览,需要时查看 JSON,并下载生成文件。

音频生成器常见问题

音频生成器可以创建什么?

PoYo 音频生成器可以根据所选模型创建文本转语音、配音、旁白、对话、音乐 demo、歌曲和纯伴奏。Input 面板只会展示当前音频模型支持的字段。

我应该先选择哪个音频模型?

表达力配音可以先试 ElevenLabs V3 TTS;快速语音测试可以用 ElevenLabs TTS Turbo v2.5 或 xAI TTS 1;需要自然语言风格指令可试 Gemini 3.1 Flash TTS;结构化音乐生成可试 ElevenLabs Music;Prompt 和歌词工作流可试 MiniMax Music 2.6;通用音乐创作可试 Generate Music。

生成音频听起来有多自然?

质量取决于模型、提示词、语言、声音和输出设置。现代 TTS 模型可以非常自然,但生产使用前仍建议做试听、发音修正、节奏检查和最终母带处理。

能控制语言、情绪、声音、语速或音乐风格吗?

可以,前提是所选模型支持这些参数。部分语音模型支持语言、声音、语速、稳定性、风格、情绪标签和时间戳;音乐模型可能支持类型、情绪、歌词、纯伴奏、段落结构和输出格式。

可以预览或下载哪些音频格式?

图库可以在浏览器中预览常见音频文件。根据厂商返回结果,下载内容可能包含 MP3、WAV、OGG、Opus、PCM、mu-law、A-law、时间戳或辅助文件。

如何提升音频质量?

使用干净脚本、清晰发音提示、具体声音方向、自然节奏和克制的情绪标签。生成音乐时,写清类型、情绪、速度、乐器、人声、结构、歌词和需要避免的元素。

生成需要多久,价格怎么算?

耗时和成本会随模型、文本长度、音频时长、格式、音乐长度、质量设置和厂商变化。运行较长旁白或音乐前,请先查看 Input 底部的当前模型成本。

生成音频可以商用吗?

商用取决于所选模型、厂商条款、账号计划,以及脚本、歌词、声音、参考素材和上传内容的权利。请查看相关条款,避免使用没有授权的内容。

为什么用 PoYo 做音频生成?

01

一个工作区覆盖多类音频模型

无需在多个厂商工具之间重建提示词,就能比较语音、配音和音乐生成模型。

02

保留原生音频参数

每个模型保留自己的声音、语言、风格、歌词、格式和结果流程。

03

浏览器内音频预览

下载前可以直接在输出图库中试听生成音频。

04

Playground 到 API 工作流

先测试脚本、提示词、声音、格式和 JSON 响应,再迁移到 API 产品。