Model icon
gemini-3-1-flash-tts
Text to Speech
Modèle:
Google Gemini 3.1 Flash TTS genere une voix multilingue expressive avec audio tags granulaires, controle de style naturel et dialogue a deux locuteurs.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Exemple de sortie

Ceci est un exemple de données. Générez un nouveau résultat pour voir la sortie réelle.

ID de tâche:ZVT5QJYOGL1MQ2LWCréé:2026-06-25 15:14:42
Statut:finishedProgression:100%
Examples
Détails des prix

Tarification transparente, sans frais cachés. Payez à l'usage.

Googlegemini-3-1-flash-tts
Text to speech
Prix PoYo
$0.120
24 crédits
Prix officiel
$0.150
Reference
Économie
20%

* Les frais réels sont basés sur la sortie finale.

Introduction

Guide complet d'utilisation de API Gemini 3.1 Flash TTS abordable pour un controle vocal precis par audio tags

API Gemini 3.1 Flash TTS abordable pour un controle vocal precis par audio tags

Creez des workflows text-to-speech naturels avec Gemini 3.1 Flash TTS sur PoYo. Utilisez des audio tags expressifs, des instructions de style en langage naturel, des voix Gemini, le dialogue a deux locuteurs et le suivi de statut asynchrone standard via une seule API. Generez des lignes de podcast, des voix d'app, des narrations pedagogiques et de la voix localisee avec une tarification claire par caractere.

Modèles d'API Gemini 3.1 Flash TTS disponibles sur PoYo

01

gemini-3-1-flash-tts

TTS Google expressif a 24 credits pour 1000 caracteres, soit $0.12 pour 1000 caracteres sur PoYo, avec controles pour text, style_instructions, voice, language_code, speakers, temperature et output_format.
Essayer le Playground

Pourquoi Gemini 3.1 Flash TTS est different

Gemini 3.1 Flash TTS est concu pour une voix qui suit les consignes, change de style de lecture et prend en charge les workflows produits multilingues sans pipeline vocal complexe.

01

Audio tags granulaires

Guidez l'interpretation dans le script avec des tags expressifs comme [sigh], [laughing], [whispering] et [short pause]. Un seul champ text sert ainsi au texte et aux indications de performance.
  • Controlez emotion, rythme et indices non verbaux.
  • Utilisez les tags pour histoires, videos produit, podcasts et dialogues de personnages.
  • Gardez les consignes vocales expressives au plus pres du script.
Controle audio tags Gemini 3.1 Flash TTS

02

Dialogue a deux locuteurs

Associez exactement deux alias de locuteurs a differentes voix Gemini pour creer un audio conversationnel. Prefixez les lignes du text avec les speaker IDs, puis mappez chaque locuteur vers une voix distincte dans la requete API.
  • Creez des segments podcast avec host et invite.
  • Prototypez dialogues de personnages et conversations d'assistant.
  • Configurez alias et voix pour chaque role du dialogue.
Dialogue a deux locuteurs Gemini 3.1 Flash TTS

Ce que vous pouvez creer

01

Podcasts et narration

Generez des lectures de host expressives, intros, narrations de livres audio et contenus editoriaux avec une interpretation guidee.

02

Contenus de formation

Transformez scripts de cours, lecons d'onboarding et supports de formation en audio multilingue clair.

03

Dialogues de personnages

Prototypez lignes de jeu, roleplay, scenes narratives et conversations a deux voix distinctes.

04

Voix produit localisee

Creez text inputs d'app, messages support, demos produit et voix d'accessibilite dans plusieurs langues.

Tarifs Gemini 3.1 Flash TTS : PoYo vs fal.ai

PoYo expose Gemini 3.1 Flash TTS via le meme workflow de generation asynchrone que les autres modeles audio PoYo, avec une tarification claire comparee a un prix public de reference.
FonctionPoYoFal.ai
ID public du modelegemini-3-1-flash-ttsNon expose
Prix de reference$0.12 pour 1000 caracteres$0.15 pour 1000 caracteres
Credits PoYo24 credits pour 1000 caracteresN/A
Controles principauxtext, style_instructions, voice, language_code, speakers, temperature, output_formatText avec controles de style, voix, langue, locuteur, temperature et format
WorkflowSoumettre la tache, interroger le statut standard, telecharger les fichiers audioWorkflow de file de reference

La tarification PoYo utilise 24 credits pour 1000 caracteres. Un credit coute $0.005.

Comment utiliser Gemini 3.1 Flash TTS sur PoYo

  1. Obtenir votre cle API : Creez un compte PoYo et genereez une cle API depuis le dashboard. Obtenir une cle API ->
  2. Ecrire le text : Entrez le text a prononcer et ajoutez si besoin des audio tags comme [laughing], [sigh], [whispering] ou [short pause].
  3. Choisir les reglages de voix : Selectionnez une Gemini voice, puis optionnellement language_code, style_instructions, temperature, output_format, ou configurez exactement deux speakers avec speaker_id et voice.
  4. Soumettre et recuperer : Soumettez la tache via l'API generate PoYo, puis utilisez l'endpoint standard de statut pour recuperer la sortie audio. Voir la documentation API ->

FAQ Gemini 3.1 Flash TTS

Qu'est-ce que Gemini 3.1 Flash TTS ?

Gemini 3.1 Flash TTS est le modele text-to-speech expressif de Google pour generer un audio multilingue naturel a partir de text inputs. Il prend en charge audio tags, instructions de style en langage naturel, voix Gemini et dialogue a deux locuteurs.

Que dois-je mettre dans le champ text ?

Mettez dans text les mots a prononcer. Vous pouvez aussi inclure des audio tags inline comme [laughing], [sigh], [whispering] et [short pause]. Pour la synthese multi-locuteur, prefixez les lignes avec des alias comme Host: et Guest:.

Comment fonctionnent les style_instructions ?

Utilisez style_instructions pour une direction de lecture appliquee a toute la requete, par exemple chaleureux et lent, journal televise dramatique, accent britannique, ton enjoue ou chuchotement mysterieux.

Gemini 3.1 Flash TTS prend-il en charge les audio tags ?

Oui. Les audio tags sont un point fort du modele et aident a controler emotion, pauses, rires, chuchotements, rythme et autres details d'interpretation directement dans le script.

Quelles voix et langues sont prises en charge ?

L'API expose 30 voix Gemini comme Kore, Puck, Charon, Zephyr et Aoede. Le modele prend en charge la synthese multilingue dans plus de 70 langues, avec guidage optionnel par language_code.

Puis-je creer un dialogue multi-locuteur ?

Oui. Envoyez exactement deux speakers, chacun avec speaker_id et voice. Utilisez les memes prefixes speaker_id dans text afin que le modele route chaque ligne vers la bonne voix. Quand speakers est defini, la voice de niveau superieur est ignoree.

Quels formats de sortie puis-je demander ?

PoYo prend en charge mp3, wav et ogg_opus pour Gemini 3.1 Flash TTS. MP3 est le format par defaut et il est recommande pour des fichiers compacts sur le web et dans les apps.

Comment la facturation est-elle calculee et comment obtenir les resultats ?

PoYo facture 24 credits pour 1000 caracteres, soit $0.12 pour 1000 caracteres. Soumettez la requete de generation, puis utilisez la task_id retournee avec l'endpoint de statut standard PoYo pour recuperer les fichiers audio.

Pourquoi utiliser PoYo

01

Prix clair par caractere

Utilisez Gemini 3.1 Flash TTS a $0.12 pour 1000 caracteres avec une facturation en credits previsible.

02

Acces unifie aux modeles

Utilisez le meme compte PoYo, la meme facturation, le meme polling de statut et le meme workflow de callback pour les modeles texte, image, video et audio.

03

Workflow de production

Soumettez des jobs asynchrones, interrogez un statut stable et recuperez les fichiers vocaux termines depuis une seule surface API.

04

Controles expressifs

Exposez des controles pratiques de production pour text, style, voice, language, speakers, temperature et output_format.