Tarification transparente, sans frais cachés. Payez à l'usage.
| Modèle | Spécification | Prix PoYo | Prix officiel | Économie |
|---|---|---|---|---|
Text to speech | $0.120 24 crédits per 1000 characters | $0.150 Reference | 20% |
* Les frais réels sont basés sur la sortie finale.
Guide complet d'utilisation de API Gemini 3.1 Flash TTS abordable pour un controle vocal precis par audio tags
API Gemini 3.1 Flash TTS abordable pour un controle vocal precis par audio tags
Modèles d'API Gemini 3.1 Flash TTS disponibles sur PoYo
Pourquoi Gemini 3.1 Flash TTS est different
Gemini 3.1 Flash TTS est concu pour une voix qui suit les consignes, change de style de lecture et prend en charge les workflows produits multilingues sans pipeline vocal complexe.
01
Audio tags granulaires
- Controlez emotion, rythme et indices non verbaux.
- Utilisez les tags pour histoires, videos produit, podcasts et dialogues de personnages.
- Gardez les consignes vocales expressives au plus pres du script.

02
Dialogue a deux locuteurs
- Creez des segments podcast avec host et invite.
- Prototypez dialogues de personnages et conversations d'assistant.
- Configurez alias et voix pour chaque role du dialogue.

Ce que vous pouvez creer
Podcasts et narration
Generez des lectures de host expressives, intros, narrations de livres audio et contenus editoriaux avec une interpretation guidee.
Contenus de formation
Transformez scripts de cours, lecons d'onboarding et supports de formation en audio multilingue clair.
Dialogues de personnages
Prototypez lignes de jeu, roleplay, scenes narratives et conversations a deux voix distinctes.
Voix produit localisee
Creez text inputs d'app, messages support, demos produit et voix d'accessibilite dans plusieurs langues.
Tarifs Gemini 3.1 Flash TTS : PoYo vs fal.ai
| Fonction | PoYo | Fal.ai |
|---|---|---|
| ID public du modele | gemini-3-1-flash-tts | Non expose |
| Prix de reference | $0.12 pour 1000 caracteres | $0.15 pour 1000 caracteres |
| Credits PoYo | 24 credits pour 1000 caracteres | N/A |
| Controles principaux | text, style_instructions, voice, language_code, speakers, temperature, output_format | Text avec controles de style, voix, langue, locuteur, temperature et format |
| Workflow | Soumettre la tache, interroger le statut standard, telecharger les fichiers audio | Workflow de file de reference |
La tarification PoYo utilise 24 credits pour 1000 caracteres. Un credit coute $0.005.
Comment utiliser Gemini 3.1 Flash TTS sur PoYo
- Obtenir votre cle API : Creez un compte PoYo et genereez une cle API depuis le dashboard. Obtenir une cle API ->
- Ecrire le text : Entrez le text a prononcer et ajoutez si besoin des audio tags comme [laughing], [sigh], [whispering] ou [short pause].
- Choisir les reglages de voix : Selectionnez une Gemini voice, puis optionnellement language_code, style_instructions, temperature, output_format, ou configurez exactement deux speakers avec speaker_id et voice.
- Soumettre et recuperer : Soumettez la tache via l'API generate PoYo, puis utilisez l'endpoint standard de statut pour recuperer la sortie audio. Voir la documentation API ->
FAQ Gemini 3.1 Flash TTS
Qu'est-ce que Gemini 3.1 Flash TTS ?
Que dois-je mettre dans le champ text ?
Comment fonctionnent les style_instructions ?
Gemini 3.1 Flash TTS prend-il en charge les audio tags ?
Quelles voix et langues sont prises en charge ?
Puis-je creer un dialogue multi-locuteur ?
Quels formats de sortie puis-je demander ?
Comment la facturation est-elle calculee et comment obtenir les resultats ?
Pourquoi utiliser PoYo
Prix clair par caractere
Utilisez Gemini 3.1 Flash TTS a $0.12 pour 1000 caracteres avec une facturation en credits previsible.
Acces unifie aux modeles
Utilisez le meme compte PoYo, la meme facturation, le meme polling de statut et le meme workflow de callback pour les modeles texte, image, video et audio.
Workflow de production
Soumettez des jobs asynchrones, interrogez un statut stable et recuperez les fichiers vocaux termines depuis une seule surface API.
Controles expressifs
Exposez des controles pratiques de production pour text, style, voice, language, speakers, temperature et output_format.