A API GPT Image 2.5 já está disponível. Crie e edite imagens →
A API GPT Image 2.5 já está disponível. Crie e edite imagens →
PoYoPoYo
Mercado de API
Preços
Enterprise
Ctrl+K
poyo.ai

Uma API. Todos os modelos.

Feito para desenvolvedores

All systems operational

Recursos

  • Central de Alternativas
  • Central de Comparativos
  • Blog
  • Provedores
  • Programa de Afiliados
  • Features
  • Sitemap

© 2025 PoYo API. Todos os direitos reservados.

Modelos populareshot

  • Seedance 2.5
  • MiniMax H3 / Hailuo 03
  • FLUX 3
  • Nano Banana Pro
  • Seedance 2
  • GPT Image 2

Novos lançamentosnew

  • GPT-6.1 Sol
  • Claude Sonnet 5.5
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • Qwen Image 2.1
  • GPT-6 Luna

Em brevesoon

  • Wan Animate 2

Todos os provedores

Google

  • Nano Banana Pro
  • Gemini Omni 1.1 Flash
  • Gemini 3.7 Flash
  • Gemini 3.8 Flash
  • Gemini 3.1 Flash TTS
  • Nano Banana
  • Veo 3.1
  • Veo 3.1 Official
  • Omni Flash
  • Nano Banana 2
  • Gemini 3.5 Flash
  • Nano Banana 2 Lite
  • Gemini 3 Series

Kling

  • Kling 3.0 Motion Control
  • Kling 3.0
  • Kling O3
  • Kling 1.6
  • Kling 2.1
  • Kling 2.6
  • Kling Avatar 2.0
  • Kling 2.5 Turbo Pro
  • Kling 3.0 Turbo
  • Kling 2.6 Motion Control
  • Kling O3 Image
  • Kling O1 Image

Anthropic

  • Claude Sonnet 5
  • Claude Fable 5.1
  • Claude Opus 5
  • Claude Opus 5.5
  • Claude Sonnet 5.5
  • Claude Opus 4.8
  • Claude Opus 4.7
  • Claude 4.6 API
  • Claude 4.5 Series

MiniMax

  • MiniMax H3 / Hailuo 03
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • MiniMax Music 2.6
  • Hailuo 02
  • Hailuo 2.3

Tripo3D

  • Tripo3D H3.1
  • Tripo3D P1

Moonshot AI

  • Kimi K3

OpenAI

  • GPT Image 2
  • Sora 2 Official
  • GPT-6 Astra
  • GPT-6 Sol
  • GPT Image 2.5
  • GPT-5.6
  • GPT-6 Luna
  • GPT-6.1 Sol
  • GPT Image 1.5
  • GPT-4o Image
  • GPT-5.5
  • GPT-5.4
  • GPT-5.2

Seedream

  • Seedream 5.0 Pro
  • Seedream 4
  • Seedream 4.5
  • Seedream 5.0 Lite

Seedance

  • Seedance 2.5
  • Seedance 2
  • Seedance 2.0 Mini
  • Seedance 1.0 Pro
  • Seedance 1.5 Pro

DeepSeek

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • DeepSeek V4.1 Flash

Hunyuan

  • Hunyuan 3D v3.1

ElevenLabs

  • ElevenLabs Music
  • ElevenLabs TTS Turbo v2.5
  • ElevenLabs V3 TTS

Black Forest Labs

  • FLUX 3
  • FLUX.2
  • Flux Kontext
  • Flux Dev
  • Flux Schnell

Alibaba

  • Qwen Image 3.0
  • Happy Horse 1.1
  • Wan 2.7 Video
  • Wan 3.0
  • Wan 3.0 Video Prime
  • Qwen Image 2.1
  • Wan Animate 2
  • Wan 2.2 Fast
  • Z-Image
  • Wan 2.5
  • Wan 2.6
  • Wan 2.7 Image
  • Wan Animate
  • Happy Horse

xAI

  • Grok 4.6
  • Grok 4.7
  • Grok Imagine Image 2.0
  • xAI TTS 1
  • Grok Imagine
  • Grok Imagine Video 1.5
  • Grok Imagine Image Quality

Meshy

  • Meshy 6 3D

Runway

  • Runway Gen-4.5

PoYo

  • AI Video Background Removal
  • AI Video Upscaler
  • Image Translator
  • Video Translator
  • Suno Music
GitHubXInstagramYouTubeDiscordTelegramEmail
Suporte ao clienteDocumentação
ImagemVídeo3DÁudioAvatarFerramentas
Loading playground...
Guia do gerador de áudio

Guia completo para usar o Um gerador de áudio completo para voz e música

Um gerador de áudio completo para voz e música

O gerador de áudio do PoYo reúne modelos de fala, voiceover e música em um workspace focado. Você escolhe ElevenLabs, Gemini, xAI, MiniMax e outros modelos executáveis diretamente no painel Input.

Cada modelo mantém seus controles nativos, então idioma, voz, tags de emoção, velocidade, letras, modo instrumental, formato, prévia, resposta JSON e download aparecem apenas quando o modelo ativo oferece suporte.

Começar

Principais recursos do gerador de áudio do PoYo

Gere fala, voiceovers e música, depois escute, baixe e valide parâmetros para seu fluxo de API.

01

Text-to-speech multilíngue expressivo

Transforme scripts, textos de produto, narração e diálogos em áudio natural. Modelos compatíveis mostram voz, idioma, tags de emoção, normalização de texto, velocidade e timestamps.

  • Gerar voiceovers a partir de scripts
  • Controlar idioma, voz e entrega quando disponível
  • Criar áudio para apps, vídeos, cursos e agentes
Fluxo de text-to-speech multilíngue

02

Prompt-to-music e criação de músicas

Crie música a partir de prompts, letras, modo instrumental e ideias de composição estruturadas. Use text-to-music para demos, hooks, bases e direção criativa.

  • Gerar músicas, instrumentais e conceitos musicais
  • Controlar clima, gênero, arranjo, letras e vocais
  • Usar campos de composição específicos do modelo
Fluxo prompt-to-music

03

Controles de qualidade, latência e formato por modelo

Alterne entre famílias de modelos de áudio sem perder os controles nativos. TTS rápido, vozes expressivas, música, sample rate, bitrate, formato e qualidade ficam ligados ao modelo ativo.

  • Comparar provedores de áudio em um seletor
  • Mostrar apenas parâmetros suportados
  • Escolher MP3, WAV, OGG, PCM ou formatos do provedor
Controles e formatos de áudio

04

Prévia, download e passagem para API

Ouça o áudio gerado no navegador, inspecione JSON e timestamps quando retornados, baixe o arquivo final e leve configurações validadas para APIs ou agentes.

  • Ouvir saídas antes do download
  • Baixar arquivos para edição e publicação
  • Validar prompts e parâmetros antes da API
Prévia de áudio e handoff para API

O que criar com o gerador de áudio do PoYo?

01

Voiceovers e dublagem para vídeo

Crie narração, áudio para demos de produto, rascunhos de dublagem multilíngue e trilhas vocais para vídeos sociais.

02

Podcasts, audiobooks e cursos

Gere aulas narradas, prévias de capítulos, segmentos de podcast e testes de narração longa.

03

Vozes de app multilíngues e acessibilidade

Prototipe vozes de app, onboarding falado, áudio de acessibilidade e experiências localizadas.

04

Demos musicais, canções e instrumentais

Crie ideias de músicas, bases, hooks, demos e trilhas a partir de prompts, letras e direção de estilo.

05

Áudio para social, jogos e criação

Explore vozes de personagens, sons de UI de jogos, assets para criadores e conceitos de áudio interativo.

06

Fluxos de desenvolvedor, API e agentes

Valide prompts, vozes, formatos, prévias e respostas JSON antes de integrar em um produto API.

Como usar o gerador de áudio no PoYo

1. Escolha um modelo de áudio no painel Input. Selecione o provedor e o modelo executável para fala ou música.

2. Adicione texto, letras ou direção musical. Escreva script, prompt, idioma, estilo de voz, clima, instrumentos ou letras.

3. Ajuste controles específicos do modelo. Configure voz, tags de emoção, velocidade, sample rate, bitrate, formato, lyrics optimizer ou modo instrumental.

4. Gere, escute e baixe. Envie a geração, ouça a prévia, inspecione JSON se necessário e baixe o arquivo.

Perguntas frequentes sobre o gerador de áudio

O que o gerador de áudio pode criar?

Ele pode criar text-to-speech, voiceovers, narração, diálogos, demos musicais, canções e instrumentais dependendo do modelo selecionado. O painel Input mostra apenas campos suportados.

Qual modelo de áudio devo escolher primeiro?

Use ElevenLabs V3 TTS para voiceovers expressivos, ElevenLabs TTS Turbo v2.5 ou xAI TTS 1 para testes rápidos, Gemini 3.1 Flash TTS para fala guiada por estilo, ElevenLabs Music para música estruturada, MiniMax Music 2.6 para prompts e letras e Generate Music para criação musical ampla.

O áudio gerado soa natural?

A qualidade depende do modelo, prompt, idioma, voz e configurações. TTS moderno pode soar muito natural, mas uso em produção ainda pede escuta, ajuste de pronúncia, ritmo e masterização.

Posso controlar idioma, emoção, voz, velocidade ou estilo musical?

Sim, quando o modelo oferece suporte. Modelos de voz podem expor idioma, voz, velocidade, estabilidade, estilo, tags de emoção e timestamps; modelos de música podem expor gênero, clima, letras, instrumental, estrutura e formato.

Quais formatos posso pré-visualizar ou baixar?

A galeria reproduz arquivos comuns no navegador. Dependendo do provedor, downloads podem incluir MP3, WAV, OGG, Opus, PCM, mu-law, A-law, timestamps ou arquivos auxiliares.

Como melhorar a qualidade do áudio?

Use scripts limpos, dicas de pronúncia, direção vocal específica, ritmo realista e tags de emoção moderadas. Para música, descreva gênero, clima, tempo, instrumentos, vocais, estrutura, letras e o que evitar.

Quanto tempo leva e como o preço é calculado?

Tempo e custo variam por modelo, tamanho do texto, duração, formato, duração musical, qualidade e provedor. Verifique o custo no footer do Input antes de execuções longas.

Posso usar áudio gerado comercialmente?

O uso comercial depende do modelo, termos do provedor, plano e direitos de scripts, letras, vozes, referências e uploads. Revise os termos e evite conteúdo sem permissão.

Por que usar PoYo para áudio?

01

Um workspace para modelos de áudio

Compare fala, voz e música sem reconstruir prompts em várias ferramentas.

02

Parâmetros nativos de áudio

Cada modelo mantém suas vozes, idiomas, estilos, letras, formatos e fluxo de resultado.

03

Prévia de áudio no navegador

Ouça o áudio gerado na galeria antes de baixar.

04

Playground e workflow de API

Teste scripts, prompts, vozes, formatos e JSON antes de levar para produção.