
APIs de IA para desenvolvedores
API de texto para fala
Adicione geração de voz de IA ao seu produto com a API de texto para fala PoYo. Compare modelos TTS, controles de voz, idiomas, formatos de áudio, carimbos de data/hora e preços para fluxos de trabalho de narração.
Modelos compatíveis
4 modelos

$0.04 /1.000 caracteres
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1.000 caracteres
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1.000 caracteres
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1.000 caracteres
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
APIs de modelos Texto para fala - Preços e adequação
Compare fornecedores, entradas aceitas, formatos de saída e preços antes de escolher um modelo.
Correspondência exata
Os modelos aparecem aqui somente quando os metadados do catálogo incluem Text to Speech.
Comparação de provedores
Compare famílias de modelos de vários provedores sem sair do diretório de tarefas.
Caminhos prontos para API
Cada cartão leva a preços da PoYo, exemplos, playground e detalhes da API.
| Modelo | Provedor | Tipos de tarefa | Preço |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1.000 caracteres |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1.000 caracteres |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1.000 caracteres | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1.000 caracteres |
Perguntas frequentes
O que é a API de texto para fala?
+
Uma API de conversão de texto em fala gera áudio falado a partir de texto escrito. Ele permite recursos de narração e voz em um aplicativo sem gravar cada script manualmente. O modelo selecionado determina vozes, idiomas, controles de fala e formatos de saída disponíveis.
Como escolho um modelo de API TTS?
+
Teste seus scripts reais, incluindo nomes, números e frases longas. Compare pronúncia, naturalidade, controle expressivo, consistência de voz e custo. Confirme o idioma e o formato de áudio necessários e verifique o fluxo de solicitação documentado se o tempo de resposta for importante para o seu produto.
Posso escolher a voz, velocidade de fala e emoção?
+
Os controles disponíveis variam de acordo com o modelo. Um endpoint pode oferecer predefinições de voz, velocidade, estabilidade, instruções de estilo ou tags de áudio. Use campos documentados e valores suportados; não se deve esperar que um modelo sem controle de velocidade ou emoção interprete um parâmetro arbitrário.
Quais idiomas são suportados pela API de conversão de texto em fala?
+
A cobertura do idioma e a qualidade da pronúncia dependem do modelo e da voz. Verifique as opções de idioma documentadas ou o comportamento de detecção e, em seguida, teste o texto nativo e as passagens em idiomas mistos. Uma etiqueta multilíngue não garante qualidade igual para todos os sotaques ou nomes próprios.
Como posso corrigir nomes, abreviações ou números pronunciados incorretamente?
+
Reescreva a passagem para linguagem falada, expanda abreviações ambíguas e teste uma frase curta. Use pronúncia documentada ou controles de normalização quando disponíveis. Mantenha uma versão de texto revisada para narração, em vez de presumir que uma sequência de exibição escrita é sempre a melhor entrada de fala.
Posso gerar narração longa?
+
Verifique o limite de texto do endpoint e o comportamento de duração suportado. Divida scripts longos em limites naturais de parágrafos ou frases, reutilize configurações de voz e revise transições após a montagem. Preserve os campos de contexto onde o modelo os suporta para ajudar na continuidade entre solicitações separadas.
Uma API TTS clona automaticamente uma voz?
+
Não. Selecionar uma voz sintética ou predefinida é diferente de criar um clone de uma gravação. A clonagem de voz requer um fluxo de trabalho com suporte específico e permissão apropriada. Verifique o endpoint disponível antes de projetar um produto em torno de uma identidade de voz personalizada.
Posso obter carimbos de data e hora de palavras ou gerar diálogo?
+
Alguns modelos fornecem registros de data e hora ou controles de vários alto-falantes, enquanto outros não. Confirme os campos de saída e as opções de solicitação na página do modelo. Valide o alinhamento em seu próprio script antes de usar carimbos de data/hora para legendas ou realce de texto sincronizado.
Quais formatos de áudio posso solicitar?
+
Utilize os formatos e opções de qualidade documentados para o modelo TTS escolhido. A reprodução, a telefonia e a edição podem exigir diferentes codecs ou taxas de amostragem. Inspecione a saída concluída e converta-a em uma etapa de mídia separada quando seu aplicativo precisar de um formato não compatível.
Como recupero a fala gerada por meio de PoYo?
+
Use o endpoint de geração de modelo selecionado, salve task_id e recupere o áudio concluído por meio de consultas de status ou de um callback_url compatível. Não infira um endpoint de streaming a partir da frase TTS de baixa latência; verifique a interface PoYo exata documentada para esse modelo.
Como é calculado o preço da API de conversão de texto em fala?
+
A precificação do TTS pode usar caracteres, tokens, geração ou outra unidade específica do modelo. Verifique como o nível escolhido conta o uso e como as configurações opcionais o afetam. Estime o script completo e as novas tentativas esperadas, em vez de comparar preços brutos com diferentes unidades de faturamento.
Como posso conectar o TTS a uma API de avatar falante?
+
Primeiro gere e revise o discurso e, em seguida, confirme se seu formato e comprimento atendem aos requisitos do endpoint do avatar. Forneça ao áudio um retrato adequado e acompanhe a tarefa do avatar separadamente. Mantenha as configurações de texto e voz da narração para que as revisões possam reproduzir a entrega pretendida.
Explorar todos os modelos de IA
Abra o marketplace completo para comparar modelos de imagem, vídeo, áudio, chat, 3D e ferramentas.
Ver todos os modelosCriar com a API
Abra a página do modelo para consultar parâmetros, preços e documentação da API.
Docs da APIPáginas de tarefas relacionadas