Model icon
gemini-3-1-flash-tts
Text to Speech
Model:
Google Gemini 3.1 Flash TTS erzeugt ausdrucksstarke mehrsprachige Sprache mit feinen Audio-Tags, naturlicher Stilsteuerung und Dialogen mit zwei Sprechern.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Beispielausgabe

Dies sind Beispieldaten. Generieren Sie ein neues Ergebnis, um die echte Ausgabe zu sehen.

Task-ID:ZVT5QJYOGL1MQ2LWErstellt:2026-06-25 15:14:42
Status:finishedFortschritt:100%
Examples
Preisinformationen

Transparente Preise ohne versteckte Kosten. Bezahle nur, was du nutzt.

Googlegemini-3-1-flash-tts
Text to speech
PoYo-Preis
$0.120
24 Credits
Offizieller Preis
$0.150
Reference
Du sparst
20%

* Tatsächliche Gebühren basieren auf dem endgültigen Ergebnis.

Introduction

Vollständige Anleitung zur Verwendung von Gunstige Gemini 3.1 Flash TTS API fur prazise Audio-Tag-Sprachsteuerung

Gunstige Gemini 3.1 Flash TTS API fur prazise Audio-Tag-Sprachsteuerung

Erstellen Sie naturliche Text-to-Speech-Workflows mit Gemini 3.1 Flash TTS auf PoYo. Nutzen Sie ausdrucksstarke Audio-Tags, natursprachliche Stilhinweise, Gemini-Stimmen, Dialoge mit zwei Sprechern und standardisiertes asynchrones Status-Polling uber eine API. Generieren Sie Podcast-Zeilen, App-Stimmen, Lernnarration und lokalisierte Sprache mit klarer Zeichenpreis-Abrechnung.

Verfügbare Gemini 3.1 Flash TTS API-Modelle auf PoYo

01

gemini-3-1-flash-tts

Ausdrucksstarkes Google TTS fur 24 Credits pro 1000 Zeichen, entsprechend $0.12 pro 1000 Zeichen auf PoYo, mit Steuerung fur text, style_instructions, voice, language_code, speakers, temperature und output_format.
Playground testen

Warum Gemini 3.1 Flash TTS anders ist

Gemini 3.1 Flash TTS ist fur Sprache gemacht, die Anweisungen folgt, Vortragsweisen wechseln kann und mehrsprachige Produkt-Workflows ohne komplexe Voice-Pipeline unterstutzt.

01

Feine Audio-Tags

Steuern Sie die Ausfuhrung direkt im Skript mit Tags wie [sigh], [laughing], [whispering] und [short pause]. So dient ein einziges text-Feld sowohl fur Text als auch fur Performance-Hinweise.
  • Steuern Sie Emotion, Tempo und nonverbale Hinweise.
  • Nutzen Sie Tags fur Geschichten, Produktvideos, Podcasts und Figurenzeilen.
  • Halten Sie ausdrucksstarke Sprechanweisungen direkt beim Skript.
Gemini 3.1 Flash TTS Audio-Tag-Steuerung

02

Dialog mit zwei Sprechern

Weisen Sie genau zwei Sprecher-Aliasse unterschiedlichen Gemini-Stimmen zu, um Gesprachsaudio zu erzeugen. Stellen Sie Zeilen im text mit speaker IDs voran und ordnen Sie jedem Sprecher eine eigene Stimme in der API-Anfrage zu.
  • Erstellen Sie Podcast-Segmente mit Host und Gast.
  • Prototypisieren Sie Figurendialoge und Assistenten-Gesprache.
  • Konfigurieren Sie Sprecher-Aliasse und Stimmen fur jede Dialogrolle.
Gemini 3.1 Flash TTS Dialog mit zwei Sprechern

Was Sie erstellen konnen

01

Podcasts und Narration

Erzeugen Sie ausdrucksstarke Host-Reads, Intro-Segmente, Horbuch-Narration und redaktionelles Audio mit gefuhrter Ausfuhrung.

02

Lerninhalte

Verwandeln Sie Kursskripte, Onboarding-Lektionen und Trainingsmaterial in klare mehrsprachige Sprachausgabe.

03

Figurendialoge

Prototypisieren Sie Spielzeilen, Rollenspielablaufe, Story-Szenen und Gesprache mit zwei unterschiedlichen Stimmen.

04

Lokalisierte Produktstimme

Erstellen Sie App-Hinweise, Support-Nachrichten, Produktdemos und barrierefreie Sprachausgabe in mehreren Sprachen.

Gemini 3.1 Flash TTS Preise: PoYo vs fal.ai

PoYo stellt Gemini 3.1 Flash TTS uber denselben asynchronen Generierungs-Workflow bereit, der auch fur andere PoYo-Audiomodelle genutzt wird, mit klarer Preisgestaltung gegenuber einem offentlichen Referenzpreis.
MerkmalPoYoFal.ai
Offentliche Modell-IDgemini-3-1-flash-ttsNicht offengelegt
Referenzpreis$0.12 pro 1000 Zeichen$0.15 pro 1000 Zeichen
PoYo Credits24 Credits pro 1000 ZeichenN/A
Kernsteuerungentext, style_instructions, voice, language_code, speakers, temperature, output_formatText-Eingabe mit Stil-, Stimmen-, Sprach-, Sprecher-, Temperatur- und Formatsteuerung
WorkflowAufgabe senden, Standardstatus abfragen, Audiodateien herunterladenReferenz-Queue-Workflow

PoYo-Preise verwenden 24 Credits pro 1000 Zeichen. Ein Credit kostet $0.005.

So nutzen Sie Gemini 3.1 Flash TTS auf PoYo

  1. API-Schlussel erhalten: Erstellen Sie ein PoYo-Konto und erzeugen Sie im Dashboard einen API-Schlussel. API-Schlussel erhalten ->
  2. Text schreiben: Geben Sie den zu sprechenden text ein und fugen Sie bei Bedarf Audio-Tags wie [laughing], [sigh], [whispering] oder [short pause] hinzu.
  3. Spracheinstellungen wahlen: Wahlen Sie eine Gemini voice, optional language_code, style_instructions, temperature, output_format, oder konfigurieren Sie genau zwei speakers mit speaker_id und voice.
  4. Senden und abrufen: Senden Sie die Aufgabe uber die PoYo generate API und rufen Sie das Audio anschliessend uber die Standard-Statusschnittstelle ab. API-Dokumentation ansehen ->

Gemini 3.1 Flash TTS FAQ

Was ist Gemini 3.1 Flash TTS?

Gemini 3.1 Flash TTS ist Googles ausdrucksstarkes Text-to-Speech-Modell fur naturliche mehrsprachige Audioausgabe aus text inputs. Es unterstutzt Audio-Tags, natursprachliche Stilhinweise, Gemini-Stimmen und Dialoge mit zwei Sprechern.

Was gehort in das text-Feld?

Geben Sie im text die Worte ein, die gesprochen werden sollen. Sie konnen auch Audio-Tags wie [laughing], [sigh], [whispering] und [short pause] einfugen. Fur Multi-Speaker-Synthese stellen Sie Zeilen mit Aliasen wie Host: und Guest: voran.

Wie funktionieren style_instructions?

Nutzen Sie style_instructions fur Vortragsanweisungen, die fur die gesamte Anfrage gelten sollen, etwa warm und langsam, dramatische Nachrichtensprache, britischer Akzent, freundlicher Ton oder geheimnisvolles Flustern.

Unterstutzt Gemini 3.1 Flash TTS Audio-Tags?

Ja. Audio-Tags sind eine zentrale Starke des Modells und helfen dabei, Emotionen, Pausen, Lachen, Flustern, Tempo und weitere Vortragsdetails direkt im Skript zu steuern.

Welche Stimmen und Sprachen werden unterstutzt?

Die API stellt 30 Gemini-Stimmen wie Kore, Puck, Charon, Zephyr und Aoede bereit. Das Modell unterstutzt mehrsprachige Synthese in uber 70 Sprachen mit optionaler Steuerung uber language_code.

Kann ich Dialoge mit mehreren Sprechern erstellen?

Ja. Senden Sie genau zwei speakers, jeweils mit speaker_id und voice. Verwenden Sie dieselben speaker_id-Prafixe im text, damit das Modell jede Zeile der richtigen Stimme zuordnen kann. Wenn speakers gesetzt ist, wird die oberste voice ignoriert.

Welche Ausgabeformate kann ich anfordern?

PoYo unterstutzt mp3, wav und ogg_opus fur Gemini 3.1 Flash TTS. MP3 ist der Standard und wird empfohlen, wenn Sie kompakte Dateien fur Web- und App-Wiedergabe mochten.

Wie wird abgerechnet und wie erhalte ich Ergebnisse?

PoYo berechnet 24 Credits pro 1000 Zeichen, entsprechend $0.12 pro 1000 Zeichen. Senden Sie die Generierungsanfrage und verwenden Sie anschliessend die task_id mit der Standard-Statusschnittstelle von PoYo, um Audiodateien abzurufen.

Warum PoYo

01

Klare Zeichenpreise

Nutzen Sie Gemini 3.1 Flash TTS fur $0.12 pro 1000 Zeichen mit planbarer Credit-Abrechnung.

02

Einheitlicher Modellzugang

Nutzen Sie dasselbe PoYo-Konto, dieselbe Abrechnung, Statusabfrage und Callback-Logik fur Text-, Bild-, Video- und Audiomodelle.

03

Produktionsworkflow

Senden Sie asynchrone Jobs, fragen Sie stabilen Aufgabenstatus ab und rufen Sie fertige Sprachdateien uber eine API-Oberflache ab.

04

Ausdrucksstarke Steuerung

Nutzen Sie praktische Produktionssteuerungen fur text, style, voice, language, speakers, temperature und output_format.