
API de IA para desarrolladores
API de texto a voz
Agregue generación de voz mediante IA a su producto con la API de texto a voz PoYo. Compare modelos TTS, controles de voz, idiomas, formatos de audio, marcas de tiempo y precios para flujos de trabajo de narración.
Modelos compatibles
Modelos 4

$0.04 /1.000 caracteres
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1.000 caracteres
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1.000 caracteres
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1.000 caracteres
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
APIs de modelos de Texto a voz: precios y ajuste del modelo
Compara proveedores, entradas compatibles, formatos de salida y precios antes de elegir un modelo.
Coincidencia exacta de tareas
Los modelos aparecen aquí solo cuando los metadatos de su catálogo incluyen Text to Speech.
Comparación de proveedores
Revise las familias de modelos de todos los proveedores sin salir del directorio de tareas.
Rutas listas para API
Cada tarjeta de modelo enlaza con los precios de PoYo, ejemplos, controles del área de juegos y detalles de API.
| Modelo | Proveedor | Tipos de tareas | Precio |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1.000 caracteres |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1.000 caracteres |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1.000 caracteres | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1.000 caracteres |
Preguntas frecuentes
¿Qué es una API de texto a voz?
+
Una API de texto a voz genera audio hablado a partir de texto escrito. Permite funciones de narración y voz en una aplicación sin grabar cada guión manualmente. El modelo seleccionado determina las voces, idiomas, controles de voz y formatos de salida disponibles.
¿Cómo elijo un modelo API TTS?
+
Pruebe sus guiones reales, incluidos nombres, números y oraciones largas. Compara pronunciación, naturalidad, control expresivo, consistencia de la voz y costo. Confirme el idioma y el formato de audio requeridos, y verifique el flujo de solicitud documentado si el tiempo de respuesta es importante para su producto.
¿Puedo elegir la voz, la velocidad de habla y la emoción?
+
Los controles disponibles varían según el modelo. Un punto final puede ofrecer ajustes preestablecidos de voz, velocidad, estabilidad, instrucciones de estilo o etiquetas de audio. Utilice campos documentados y valores admitidos; No se debe esperar que un modelo sin control de velocidad o emoción interprete un parámetro arbitrario.
¿Qué idiomas admite la API de texto a voz?
+
La cobertura del idioma y la calidad de la pronunciación dependen del modelo y la voz. Verifique las opciones de idioma documentadas o el comportamiento de detección, luego pruebe el texto nativo y los pasajes en idiomas mixtos. Una etiqueta multilingüe no garantiza la misma calidad para cada acento o nombre propio.
¿Cómo puedo corregir nombres, abreviaturas o números mal pronunciados?
+
Reescribe el pasaje para el lenguaje hablado, amplía las abreviaturas ambiguas y prueba una oración corta. Utilice controles de normalización o pronunciación documentados cuando estén disponibles. Mantenga una versión de texto revisada para la narración en lugar de asumir que una cadena de visualización escrita es siempre la mejor entrada de voz.
¿Puedo generar una narración larga?
+
Verifique el límite de texto del punto final y el comportamiento de duración admitido. Divida guiones largos en límites naturales de párrafos o oraciones, reutilice configuraciones de voz y revise las transiciones después del ensamblaje. Conserve los campos de contexto donde el modelo los admite para ayudar a la continuidad entre solicitudes independientes.
¿Una API TTS clona automáticamente una voz?
+
No. Seleccionar una voz sintética o un ajuste preestablecido es diferente a crear un clon a partir de una grabación. La clonación de voz requiere un flujo de trabajo específicamente compatible y el permiso adecuado. Verifique el punto final disponible antes de diseñar un producto en torno a una identidad de voz personalizada.
¿Puedo obtener marcas de tiempo de palabras o generar diálogos?
+
Algunos modelos proporcionan marcas de tiempo o controles de varios altavoces, mientras que otros no. Confirme los campos de salida y solicite las opciones en la página del modelo. Valide la alineación en su propio guión antes de usar marcas de tiempo para subtítulos o resaltado de texto sincronizado.
¿Qué formatos de audio puedo solicitar?
+
Utilice los formatos y opciones de calidad documentados para el modelo TTS elegido. La reproducción, la telefonía y la edición pueden requerir códecs o frecuencias de muestreo diferentes. Inspeccione el resultado completo y conviértalo en un paso multimedia independiente cuando su aplicación necesite un formato no compatible.
¿Cómo recupero la voz generada mediante PoYo?
+
Utilice el punto final de generación del modelo seleccionado, guarde task_id y recupere el audio completo a través de consultas de estado o un callback_url compatible. No infiera un punto final de transmisión a partir de la frase TTS de baja latencia; verifique la interfaz PoYo exacta documentada para ese modelo.
¿Cómo se calcula el precio de la API de texto a voz?
+
El precio de TTS puede utilizar caracteres, tokens, generación u otra unidad específica del modelo. Compruebe cómo el nivel elegido cuenta el uso y cómo lo afectan las configuraciones opcionales. Calcule el script completo y los reintentos esperados, en lugar de comparar precios brutos con diferentes unidades de facturación.
¿Cómo puedo conectar TTS con una API de avatar parlante?
+
Primero genere y revise el discurso, luego confirme que su formato y longitud cumplan con los requisitos del punto final del avatar. Proporcione al audio un retrato adecuado y realice un seguimiento de la tarea del avatar por separado. Mantenga el texto de la narración y la configuración de voz para que las revisiones puedan reproducir la entrega prevista.
Explorar todos los modelos de IA
Abra el mercado de modelos completo para comparar modelos de imágenes, videos, audio, chat, 3D y herramientas.
Ver todos los modelosCrear con la API
Abre la página del modelo para ver parámetros, precios y documentación de la API.
Documentos APIPáginas de tareas relacionadas