La API de GPT Image 2.5 ya está disponible. Crea y edita imágenes →
La API de GPT Image 2.5 ya está disponible. Crea y edita imágenes →
PoYoPoYo
Mercado
Precios
Enterprise
Ctrl+K
poyo.ai

Una API. Todos los modelos.

Creado para desarrolladores

All systems operational

Resources

  • Centro alternativo
  • Centro de comparación
  • Blog
  • Providers
  • Programa de afiliados
  • Funciones
  • Sitemap

© 2025 PoYo API. Reservados todos los derechos.

Modelos populareshot

  • Seedance 2.5
  • MiniMax H3 / Hailuo 03
  • FLUX 3
  • Nano Banana Pro
  • Seedance 2
  • GPT Image 2

Nuevos lanzamientosnew

  • GPT-6.1 Sol
  • Claude Sonnet 5.5
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • Qwen Image 2.1
  • GPT-6 Luna

Próximamentesoon

  • Wan Animate 2

Todos los proveedores

Google

  • Nano Banana Pro
  • Gemini Omni 1.1 Flash
  • Gemini 3.7 Flash
  • Gemini 3.8 Flash
  • Gemini 3.1 Flash TTS
  • Nano Banana
  • Veo 3.1
  • Veo 3.1 Official
  • Omni Flash
  • Nano Banana 2
  • Gemini 3.5 Flash
  • Nano Banana 2 Lite
  • Gemini 3 Series

Kling

  • Kling 3.0 Motion Control
  • Kling 3.0
  • Kling O3
  • Kling 1.6
  • Kling 2.1
  • Kling 2.6
  • Kling Avatar 2.0
  • Kling 2.5 Turbo Pro
  • Kling 3.0 Turbo
  • Kling 2.6 Motion Control
  • Kling O3 Image
  • Kling O1 Image

Anthropic

  • Claude Sonnet 5
  • Claude Fable 5.1
  • Claude Opus 5
  • Claude Opus 5.5
  • Claude Sonnet 5.5
  • Claude Opus 4.8
  • Claude Opus 4.7
  • Claude 4.6 API
  • Claude 4.5 Series

MiniMax

  • MiniMax H3 / Hailuo 03
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • MiniMax Music 2.6
  • Hailuo 02
  • Hailuo 2.3

Tripo3D

  • Tripo3D H3.1
  • Tripo3D P1

Moonshot AI

  • Kimi K3

OpenAI

  • GPT Image 2
  • Sora 2 Official
  • GPT-6 Astra
  • GPT-6 Sol
  • GPT Image 2.5
  • GPT-5.6
  • GPT-6 Luna
  • GPT-6.1 Sol
  • GPT Image 1.5
  • GPT-4o Image
  • GPT-5.5
  • GPT-5.4
  • GPT-5.2

Seedream

  • Seedream 5.0 Pro
  • Seedream 4
  • Seedream 4.5
  • Seedream 5.0 Lite

Seedance

  • Seedance 2.5
  • Seedance 2
  • Seedance 2.0 Mini
  • Seedance 1.0 Pro
  • Seedance 1.5 Pro

DeepSeek

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • DeepSeek V4.1 Flash

Hunyuan

  • Hunyuan 3D v3.1

ElevenLabs

  • ElevenLabs Music
  • ElevenLabs TTS Turbo v2.5
  • ElevenLabs V3 TTS

Black Forest Labs

  • FLUX 3
  • FLUX.2
  • Flux Kontext
  • Flux Dev
  • Flux Schnell

Alibaba

  • Qwen Image 3.0
  • Happy Horse 1.1
  • Wan 2.7 Video
  • Wan 3.0
  • Wan 3.0 Video Prime
  • Qwen Image 2.1
  • Wan Animate 2
  • Wan 2.2 Fast
  • Z-Image
  • Wan 2.5
  • Wan 2.6
  • Wan 2.7 Image
  • Wan Animate
  • Happy Horse

xAI

  • Grok 4.6
  • Grok 4.7
  • Grok Imagine Image 2.0
  • xAI TTS 1
  • Grok Imagine
  • Grok Imagine Video 1.5
  • Grok Imagine Image Quality

Meshy

  • Meshy 6 3D

Runway

  • Runway Gen-4.5

PoYo

  • AI Video Background Removal
  • AI Video Upscaler
  • Image Translator
  • Video Translator
  • Suno Music
GitHubXInstagramYouTubeDiscordTelegramEmail
Atención al clienteDocumentación
ImagenVídeo3DAudioAvatarTools
Loading playground...
Guía del generador de audio

Guía completa para usar Un generador de audio completo para voz y música

Un generador de audio completo para voz y música

PoYo Audio Generator reúne los principales modelos de generación de voz, voz y música en un espacio de trabajo enfocado. En lugar de cambiar entre herramientas de proveedores independientes, puede elegir ElevenLabs, Gemini, xAI, MiniMax y otros modelos de audio ejecutables directamente dentro del panel de entrada.

Cada modelo mantiene sus controles nativos, por lo que el idioma, la voz, las etiquetas de emoción, la velocidad, la letra, el modo instrumental, el formato de salida, la vista previa, la respuesta JSON y la descarga. Los flujos de trabajo aparecen solo cuando el modelo seleccionado los admite.

Empezar a crear

Características clave del generador de audio PoYo

Genere discursos, voces en off y música, luego obtenga una vista previa, descargue y mueva flujos de trabajo estables a su canal API.

01

Expresivo multilingüe text-to-speech

Convierta guiones, textos de productos, narraciones y diálogos en audio natural. Los modelos compatibles exponen selección de voz, control de idioma, etiquetas de emociones, normalización de texto, velocidad y marcas de tiempo cuando estén disponibles.

  • Genere locuciones a partir de texto prompts y guiones
  • Utilice controles de idioma, voz y entrega cuando sea posible
  • Cree discursos para aplicaciones, videos, cursos y agentes
Flujo de trabajo expresivo multilingüe text-to-speech

02

Prompt-to-music y creación de canciones.

Cree música a partir de prompts, letras, configuraciones instrumentales e ideas de composición estructuradas. Utilice los modelos text-to-music para demostraciones, ganchos, pistas de acompañamiento y dirección creativa antes de pasar a la producción.

  • Generar canciones, instrumentales y conceptos musicales.
  • Controla el estado de ánimo, el género, los arreglos, las letras y las voces.
  • Utilice los campos de composición model-specific cuando estén disponibles
Flujo de trabajo de generación Prompt-to-music

03

Controles de calidad, latencia y formato Model-specific

Cambie entre familias de modelos de audio sin perder sus controles nativos. El rápido TTS, los modelos de voz expresivos, los generadores de música, la frecuencia de muestreo, la tasa de bits, el formato de salida y las opciones de calidad permanecen adjuntos al modelo activo.

  • Compara proveedores de audio desde un selector
  • Exponer solo los parámetros admitidos por el modelo activo.
  • Elija los formatos MP3, WAV, OGG, PCM o provider-specific.
Controles del modelo de audio y opciones de formato.

04

Vista previa, descarga y transferencia de API

Escuche el audio generado directamente en el navegador, inspeccione el JSON estructurado y las marcas de tiempo cuando se devuelvan, descargue el archivo final y mueva las configuraciones validadas a API o a los flujos de trabajo del agente.

  • Vista previa de las salidas de audio antes de descargarlas
  • Descargue archivos de producción para editarlos y publicarlos.
  • Valide prompts y los parámetros antes de la integración de API.
Vista previa de audio y flujo de trabajo de transferencia API

¿Qué puedes crear con el generador de audio PoYo?

01

Locuciones y doblajes de vídeos

Cree narraciones, audio de recorrido del producto, borradores de doblaje multilingüe y pistas de voz de videos sociales a partir de guiones.

02

Podcasts, audiolibros y narraciones de cursos.

Genere lecciones habladas, vistas previas de capítulos, segmentos de podcasts y pruebas de narración long-form antes de grabar o masterizar.

03

Voces y accesibilidad de aplicaciones multilingües

Voces de aplicaciones prototipo, audio estilo screen-reader, narración integrada y experiencias de habla localizadas.

04

Demostraciones musicales, canciones y pistas instrumentales.

Cree ideas de canciones, bases instrumentales, ganchos, demostraciones y pistas de acompañamiento a partir de prompts, letras y dirección de estilo.

05

Conceptos sociales, de juegos y de audio creativo.

Explore las voces de los personajes, los sonidos de la interfaz de usuario del juego, los recursos del creador y los conceptos de audio para medios interactivos.

06

Flujos de trabajo de desarrollador, API y agente

Valide prompts, voces, formatos, vistas previas y respuestas JSON antes de agregar generación de audio a un producto API.

Cómo utilizar el generador de audio en PoYo

1. Elija un modelo de audio en el panel de Entrada. Elija el proveedor y el modelo ejecutable que coincida con su flujo de trabajo de voz o música.

2. Agregue texto, letra o dirección musical. Escriba el guión, prompt, idioma, estilo de voz, estado de ánimo, instrumentación o letra requerida por el modelo seleccionado.

3. Ajuste los controles de model-specific. Configure solo las opciones que muestra el modelo activo, como voz, etiquetas de emoción, velocidad, frecuencia de muestreo, tasa de bits, formato de salida, optimizador de letras o modo instrumental.

4. Ejecute, obtenga una vista previa y descargue. Envíe la generación, escuche la vista previa del audio, inspeccione JSON si es necesario y descargue el archivo generado.

Preguntas frecuentes sobre el generador de audio

¿Qué puede crear Audio Generator?

PoYo Audio Generator puede crear text-to-speech, audio de voz en off, narración, diálogo, demostraciones musicales, canciones y pistas instrumentales según el modelo seleccionado. El panel Entrada solo muestra los campos admitidos por el modelo de audio activo.

¿Qué modelo de audio debo elegir primero?

Comience con ElevenLabs V3 TTS para voces en off expresivas, ElevenLabs TTS Turbo v2.5 o xAI TTS 1 para pruebas de voz más rápidas, Gemini 3.1 Flash TTS para discursos style-instructed, ElevenLabs Música para generación de música estructurada, MiniMax Música 2.6 para prompt y flujos de trabajo de letras, y Generar música para creación musical amplia.

¿Qué tan realista o natural es el audio generado?

La calidad depende del modelo, prompt, idioma, voz y configuración de salida. Los modelos modernos TTS pueden sonar muy naturales, pero el uso en producción aún se beneficia de las comprobaciones de escucha, ediciones de pronunciación, revisión del ritmo y masterización final.

¿Puedo controlar el lenguaje, las emociones, la voz, la velocidad o el estilo musical?

YSí, cuando el modelo seleccionado admita esos controles. Algunos modelos de habla exponen el lenguaje, la voz, la velocidad, la estabilidad, el estilo, las etiquetas de emociones o las marcas de tiempo. Los modelos musicales pueden exponer el género, el estado de ánimo, la letra, el modo instrumental, la estructura de la sección y el formato de salida.

¿Qué formatos de audio puedo previsualizar o descargar?

La galería muestra una vista previa de los archivos de audio comunes en el navegador. Dependiendo de la respuesta del proveedor, las descargas pueden incluir MP3, WAV, OGG, Opus, PCM, mu-law, A-law, marcas de tiempo o archivos de soporte.

¿Cómo mejoro la calidad del audio?

Uuse guiones limpios, sugerencias de pronunciación claras, dirección de voz específica, ritmo realista y etiquetas de emociones concisas. Para la música, describe el género, el estado de ánimo, el tempo, los instrumentos, las voces, la estructura, la letra y lo que debes evitar.

¿Cuánto tiempo lleva la generación y cómo se calcula el precio?

El tiempo de generación y el costo varían según el modelo, la longitud del texto, la duración, el formato, la duración de la música, la configuración de calidad y el proveedor. Verifique el costo del modelo activo en el pie de página de Entrada antes de ejecutar una narración más larga o generaciones de música.

¿Puedo utilizar audio generado comercialmente?

El uso comercial depende del modelo seleccionado, los términos del proveedor, su plan de cuenta y los derechos adjuntos a los guiones, letras, voces, referencias y material cargado. Revise los términos relevantes y evite el contenido para el que no tiene permiso.

¿Por qué utilizar PoYo para la generación de audio?

01

Un espacio de trabajo para modelos de audio

Compare generadores de voz, voz y música sin reconstruir prompts entre las herramientas del proveedor.

02

Parámetros de audio nativos

Cada modelo mantiene su propia voz, lenguaje, estilo, letra, formato y flujo de trabajo de resultados.

03

Vistas previas de audio del navegador

Escuche el audio generado directamente en la galería de salida antes de descargar los archivos.

04

Área de juegos y flujo de trabajo API

Pruebe guiones, prompts, voces, formatos y respuestas de JSON antes de pasar a los productos API-powered.