Model icon
gemini-3-1-flash-tts
Model:
Google Gemini 3.1 Flash TTS menghasilkan ekspresif pidato multilingual dengan tag audio granular, kontrol gaya alami, dan dialog dua pembicara.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Contoh output

Ini data sampel. Menghasilkan hasil baru untuk melihat output nyata.

ID Tugas:ZVT5QJYOGL1MQ2LWDicipta:2026-06-25 15:14:42
Status:finishedKemajuan:100%
Examples
Detail harga

Harga transparan tanpa biaya tersembunyi. Bayarlah seperti yang kau inginkan.

Googlegemini-3-1-flash-tts
Text to speech
PoYo Harga
$0.120
24 kredit
Harga resmi
$0.150
Reference
Kau menyelamatkan
20%

* Biaya sebenarnya didasarkan pada output akhir.

Pambuka

Panduan lengkap untuk penggunaan Terjangkau Gemini 3.1 Flash TTS API untuk Kontrol Suara Audio-Tag yang Tepat

Terjangkau Gemini 3.1 Flash TTS API untuk Kontrol Suara Audio-Tag yang Tepat

Membangun alur kerja teks-ke-bahasa alami dengan Gemini 3.1 Flash TTS pada PoYo. Gunakan tag audio yang ekspresif, instruksi gaya bahasa alam, Gemini suara, dialog dua pembicara, dan standar status async polling melalui satu API. Menghasilkan garis podcast, suara aplikasi, narasi belajar, dan ucapan lokal dengan harga yang jelas per karakter.

Tersedia Gemini 3.1 Flash TTS API Model pada PoYo

01

gemini-3-1-flash-tts

Ekspresif Google TTS di 24 kredit per 1000 karakter, setara dengan $0.12 per 1000 karakter pada PoYo, dengan kontrol untuk teks, instruksi gaya, suara, bahasa, speaker, suhu, dan format output.
Cobalah Taman Mainan

Mengapa? Gemini 3.1 Flash TTS Berbeda

Gemini 3.1 Flash TTS dibangun untuk pidato yang mengikuti arah, beralih pengiriman, dan mendukung alur kerja produk multilingual tanpa pipa suara yang kompleks.

01

Tag Audio Granular

Panduan pengiriman dalam naskah dengan tag ekspresif seperti [menangis], [tertawa], [berbisik], dan [pause singkat]. Hal ini membuat satu bidang teks berguna untuk kedua kata dan arah kinerja.
  • Mengontrol emosi, kecepatan, dan sinyal pengiriman non-verbal.
  • Gunakan tag untuk cerita, video produk, podcast, dan garis karakter.
  • Tetaplah arah ekspresif berbicara dekat dengan naskah.
Gemini 3.1 Flash TTS kontrol tag audio

02

Dialog Dua Pembicara

Atribusi tepat dua nama panggilan speaker untuk yang berbeda Gemini suara untuk audio percakapan. Prefix baris dalam teks dengan ID speaker, kemudian peta setiap speaker ke suara yang berbeda di API request.
  • Buat segmen podcast host dan tamu.
  • Prototype dialog karakter dan pembicaraan asisten.
  • Mengkonfigurasi nama panggilan pembicara dan suara untuk setiap peran dialog.
Gemini 3.1 Flash TTS dua dialog speaker

Apa yang Dapat Anda Bangun

01

Podcast Dan Cerita

Menghasilkan bacaan host yang ekspresif, segmen intro, narasi audiobook, dan audio editorial dengan pengiriman yang dipandu.

02

Konten Belajar

Pindah skrip kursus, pelajaran onboarding, dan materi pelatihan menjadi audio multilingual yang jelas.

03

Dialog Karakter

Prototype garis permainan, aliran bermain peran, adegan cerita, dan percakapan dua pembicara dengan suara yang berbeda.

04

Suara Produk Lokalisasi

Buat input teks aplikasi, pesan dukungan, demo produk, dan ucapan aksesibilitas dalam beberapa bahasa.

Gemini 3.1 Harga Flash TTS: PoYo vs fal.ai

PoYo eksposur Gemini 3.1 Flash TTS melalui alur kerja generasi async yang sama yang digunakan di seluruh PoYo model audio, dengan harga yang jelas terhadap harga referensi publik.
FiturPoYoFal.ai
ID model publikgemini-3-1-flash-ttsTidak terpapar
Fal.ai$0.12 per 1000 karakter$0.15 per 1000 karakter
PoYo kredit24 kredit per 1000 karakterN/A
Kontrol intiteks, style_instructions, voice, language_code, speaker, suhu, output_formatMasukan teks dengan gaya, suara, bahasa, speaker, suhu, dan kontrol format
Aliran kerjaKirim tugas, status standar survei, unduh file audioAliran kerja antrian referensi

PoYo penggunaan harga 24 kredit per 1000 karakter. Satu kredit harga di $0.005.

Bagaimana Menggunakan Gemini 3.1 Flash TTS dihidupkan PoYo

  1. Ambillahmu kunci API: Buatlah PoYo akun dan buat kunci API dari dashboard. Dapatkan kunci API ->
  2. Tuliskan teksnya: Masukkan teks pidato dan tambahkan tag audio seperti [tertawa], [menangis], [berbisik], atau [penundaan singkat] ketika Anda membutuhkan ekspresi.
  3. Pilih pengaturan suara: Pilih a Gemini suara, bahasa_kode opsional, gaya_instructions, suhu, output_format, atau mengkonfigurasi persis dua speaker dengan speaker_id dan suara.
  4. Kirim dan ambil: Kirim melalui PoYoyang menghasilkan API, lalu survei standar status tugas titik akhir untuk output audio. Lihat Dokumentasi API ->

Gemini 3.1 Flash TTS FAQ

Apa itu Gemini 3.1 Flash TTS?

Gemini 3.1 Flash TTS adalah GoogleModel teks-ke-bahasa yang ekspresif untuk menghasilkan audio multilingual alami dari input teks. Ini mendukung tag audio, gaya bahasa alam arah, Gemini suara preset, dan dialog dua speaker.

Apa yang harus saya masukkan ke kolom teks?

Masukkan kata-kata yang ingin Anda ucapkan dalam teks. Anda juga dapat memasukkan tag audio dalam garis seperti [tertawa], [menangis], [berbisik], dan [pause singkat]. Untuk sintesis multi-spiker, garis prefix dengan alias seperti Host: dan tamu:

Bagaimana cara kerja style_instructions?

Gunakan gaya_instruction untuk arah pengiriman yang harus berlaku untuk seluruh permintaan, seperti hangat dan lambat, siaran berita dramatis, aksen Inggris, nada ceria, atau bisikan misterius.

Apakah Gemini 3.1 Flash TTS mendukung tag audio?

Ya. Tag audio adalah kekuatan inti dari model dan membantu mengendalikan emosi, istirahat, tawa, berbisik, berlari, dan rincian pengiriman lainnya langsung di dalam naskah.

Suara dan bahasa mana yang didukung?

Pembagian API eksposur 30 Gemini Praset suara seperti Kore, Puck, Charon, Zephyr, dan Aoede. Model ini mendukung sintesis multilingual di seluruh 70+ bahasa, dengan pilihan bahasa_code pengemudi.

Bisakah saya membuat dialog multi-spiker?

Ya. Kirimkan dua speaker, masing-masing dengan speaker_id dan suara. Gunakan prefiks speaker_id yang sama dalam teks sehingga model dapat mengarahkan setiap baris ke suara yang dimaksud. Ketika speaker diatur, suara tingkat atas diabaikan.

Format output apa yang bisa saya minta?

PoYo mendukung mp3, wav, dan ogg_opus untuk Gemini 3.1 Flash TTS. MP3 adalah standar dan direkomendasikan ketika Anda ingin file kompak untuk pemutaran web dan aplikasi.

Bagaimana cara menghitung tagihan dan bagaimana saya mendapatkan hasil?

PoYo tagihan 24 kredit per 1000 karakter, setara dengan $0.12 per 1000 karakter. Kirim permintaan generasi, kemudian gunakan task_id yang dikembalikan dengan PoYoStandar tugas status titik akhir untuk mengambil file audio.

Mengapa Menggunakan PoYo

01

Harga Per Karakter yang Jelas

Penggunaan Gemini 3.1 Flash TTS di $0.12 per 1000 karakter dengan tagihan kredit yang dapat diprediksi.

02

Akses Model Bersatu

Gunakan yang sama PoYo akun, tagihan, polling status, dan callback workflow di seluruh teks, gambar, video, dan audio model.

03

Pelancongan produksi

Kirimkan pekerjaan async, survei status tugas stabil, dan mengambil file pidato selesai dari satu API surface.

04

Kontrol Ekspresi

Mengeksposisi kontrol produksi praktis untuk teks, gaya, suara, bahasa, speaker, suhu, dan format output.