Model icon
gemini-3-1-flash-tts
Text to Speech
Modelo:
Google Gemini 3.1 Flash TTS gera fala multilingue expressiva com audio tags granulares, controle natural de estilo e dialogo com dois speakers.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Saída de exemplo

Estes são dados de exemplo. Gere um novo resultado para ver a saída real.

ID da tarefa:ZVT5QJYOGL1MQ2LWCriado:2026-06-25 15:14:42
Status:finishedProgresso:100%
Examples
Detalhes de preços

Preços transparentes, sem taxas ocultas. Pague conforme o uso.

Googlegemini-3-1-flash-tts
Text to speech
Preço PoYo
$0.120
24 créditos
Preço oficial
$0.150
Reference
Economia
20%

* As taxas reais são baseadas na saída final.

Introdução

Guia completo para usar o API Gemini 3.1 Flash TTS acessivel para controle preciso por audio tags

API Gemini 3.1 Flash TTS acessivel para controle preciso por audio tags

Crie fluxos naturais de text-to-speech com Gemini 3.1 Flash TTS na PoYo. Use audio tags expressivas, instrucoes de estilo em linguagem natural, vozes Gemini, dialogo com dois speakers e consulta de status assincrona padrao em uma unica API. Gere falas de podcast, vozes para apps, narracao educacional e audio localizado com preco claro por caractere.

Modelos de API Gemini 3.1 Flash TTS disponíveis no PoYo

01

gemini-3-1-flash-tts

TTS expressivo do Google por 24 credits a cada 1000 caracteres, equivalente a $0.12 por 1000 caracteres na PoYo, com controles para text, style_instructions, voice, language_code, speakers, temperature e output_format.
Testar Playground

Por que Gemini 3.1 Flash TTS e diferente

Gemini 3.1 Flash TTS foi criado para fala que segue direcao, alterna entrega e suporta fluxos de produto multilingues sem uma pipeline de voz complexa.

01

Audio tags granulares

Oriente a entrega dentro do script com tags expressivas como [sigh], [laughing], [whispering] e [short pause]. Isso torna um unico campo text util tanto para palavras quanto para direcao de performance.
  • Controle emocao, ritmo e pistas nao verbais.
  • Use tags em historias, videos de produto, podcasts e falas de personagens.
  • Mantenha a direcao expressiva perto do script.
Controle de audio tags Gemini 3.1 Flash TTS

02

Dialogo com dois speakers

Atribua exatamente dois aliases de speaker a vozes Gemini diferentes para criar audio conversacional. Prefixe linhas no text com speaker IDs e mapeie cada speaker para uma voz distinta na requisicao da API.
  • Crie segmentos de podcast com host e convidado.
  • Prototipe dialogos de personagens e conversas de assistente.
  • Configure aliases e vozes para cada papel do dialogo.
Dialogo com dois speakers Gemini 3.1 Flash TTS

O que voce pode criar

01

Podcasts e narracao

Gere leituras expressivas de host, introducoes, narracao de audiolivro e audio editorial com entrega guiada.

02

Conteudo de aprendizagem

Transforme scripts de curso, aulas de onboarding e materiais de treinamento em audio multilingue claro.

03

Dialogo de personagens

Prototipe falas de jogos, fluxos de roleplay, cenas de historia e conversas com dois speakers distintos.

04

Voz de produto localizada

Crie text inputs de app, mensagens de suporte, demos de produto e fala de acessibilidade em varios idiomas.

Preços do Gemini 3.1 Flash TTS: PoYo vs fal.ai

A PoYo oferece Gemini 3.1 Flash TTS pelo mesmo fluxo assincrono de geracao usado nos modelos de audio da PoYo, com preco claro comparado a um preco publico de referencia.
RecursoPoYoFal.ai
ID publico do modelogemini-3-1-flash-ttsNao exposto
Preco de referencia$0.12 por 1000 caracteres$0.15 por 1000 caracteres
PoYo credits24 credits por 1000 caracteresN/A
Controles principaistext, style_instructions, voice, language_code, speakers, temperature, output_formatEntrada text com controles de estilo, voz, idioma, speaker, temperatura e formato
WorkflowEnviar tarefa, consultar status padrao, baixar arquivos de audioWorkflow de fila de referencia

O preco da PoYo usa 24 credits por 1000 caracteres. Um credit custa $0.005.

Como usar Gemini 3.1 Flash TTS na PoYo

  1. Obtenha sua API Key: Crie uma conta PoYo e gere uma API Key no dashboard. Obter API Key ->
  2. Escreva o text: Insira o text que sera falado e adicione audio tags como [laughing], [sigh], [whispering] ou [short pause] quando precisar de uma entrega expressiva.
  3. Escolha as configuracoes de voz: Selecione uma Gemini voice, opcionalmente language_code, style_instructions, temperature, output_format, ou configure exatamente dois speakers com speaker_id e voice.
  4. Envie e recupere: Envie a tarefa pela API generate da PoYo e consulte o endpoint padrao de status para obter a saida de audio. Ver docs da API ->

FAQ Gemini 3.1 Flash TTS

O que e Gemini 3.1 Flash TTS?

Gemini 3.1 Flash TTS e o modelo text-to-speech expressivo do Google para gerar audio multilingue natural a partir de text inputs. Ele suporta audio tags, direcao de estilo em linguagem natural, vozes Gemini e dialogo com dois speakers.

O que devo colocar no campo text?

Coloque no text as palavras que devem ser faladas. Voce tambem pode incluir audio tags inline como [laughing], [sigh], [whispering] e [short pause]. Para sintese multi-speaker, prefixe as linhas com aliases como Host: e Guest:.

Como funcionam style_instructions?

Use style_instructions para direcao de entrega aplicada a toda a requisicao, como quente e lento, noticiario dramatico, sotaque britanico, tom alegre ou sussurro misterioso.

Gemini 3.1 Flash TTS suporta audio tags?

Sim. Audio tags sao uma forca central do modelo e ajudam a controlar emocao, pausas, risadas, sussurros, ritmo e outros detalhes de entrega diretamente no script.

Quais vozes e idiomas sao suportados?

A API expoe 30 vozes Gemini, como Kore, Puck, Charon, Zephyr e Aoede. O modelo suporta sintese multilingue em mais de 70 idiomas, com direcionamento opcional por language_code.

Posso criar dialogo multi-speaker?

Sim. Envie exatamente dois speakers, cada um com speaker_id e voice. Use os mesmos prefixos speaker_id no text para que o modelo direcione cada linha para a voz correta. Quando speakers e definido, a voice de nivel superior e ignorada.

Quais formatos de saida posso solicitar?

A PoYo suporta mp3, wav e ogg_opus para Gemini 3.1 Flash TTS. MP3 e o padrao e e recomendado para arquivos compactos em web e apps.

Como a cobranca e calculada e como recebo os resultados?

A PoYo cobra 24 credits por 1000 caracteres, equivalente a $0.12 por 1000 caracteres. Envie a requisicao de geracao e use a task_id retornada no endpoint padrao de status da PoYo para recuperar os arquivos de audio.

Por que usar PoYo

01

Preco claro por caractere

Use Gemini 3.1 Flash TTS por $0.12 a cada 1000 caracteres com cobranca previsivel em credits.

02

Acesso unificado a modelos

Use a mesma conta PoYo, cobranca, consulta de status e workflow de callback em modelos de texto, imagem, video e audio.

03

Workflow de producao

Envie jobs assincronos, consulte status estavel e recupere arquivos de fala finalizados em uma unica superficie de API.

04

Controles expressivos

Disponibilize controles praticos de producao para text, style, voice, language, speakers, temperature e output_format.