Model icon
gemini-3-1-flash-tts
Text to Speech
Модель:
Google Gemini 3.1 Flash TTS генерирует выразительную многоязычную речь с точными audio tags, естественным управлением стилем и диалогом двух speakers.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Пример вывода

Это пример данных. Создайте новый результат, чтобы увидеть реальный вывод.

ID задачи:ZVT5QJYOGL1MQ2LWСоздано:2026-06-25 15:14:42
Статус:finishedПрогресс:100%
Examples
Детали цен

Прозрачные цены без скрытых платежей. Оплата по факту использования.

Googlegemini-3-1-flash-tts
Text to speech
Цена PoYo
$0.120
24 кредитов
Официальная цена
$0.150
Reference
Экономия
20%

* Фактическая стоимость зависит от итогового вывода.

Описание

Полное руководство по использованию Доступная Gemini 3.1 Flash TTS API для точного управления голосом через audio tags

Доступная Gemini 3.1 Flash TTS API для точного управления голосом через audio tags

Создавайте естественные text-to-speech процессы с Gemini 3.1 Flash TTS в PoYo. Используйте выразительные audio tags, стилевые инструкции на естественном языке, голоса Gemini, диалог двух speakers и стандартный асинхронный опрос статуса через один API. Генерируйте реплики для подкастов, голоса приложений, учебную озвучку и локализованную речь с понятной ценой за символ.

Доступные модели API Gemini 3.1 Flash TTS на PoYo

01

gemini-3-1-flash-tts

Выразительный Google TTS за 24 credits за 1000 символов, то есть $0.12 за 1000 символов в PoYo, с управлением text, style_instructions, voice, language_code, speakers, temperature и output_format.
Открыть Playground

Чем отличается Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS создан для речи, которая следует указаниям, меняет манеру подачи и поддерживает многоязычные продуктовые сценарии без сложного voice pipeline.

01

Точные audio tags

Управляйте исполнением прямо в script с помощью выразительных тегов вроде [sigh], [laughing], [whispering] и [short pause]. Одно поле text подходит и для текста, и для указаний по подаче.
  • Управляйте эмоциями, темпом и невербальными голосовыми сигналами.
  • Используйте теги для историй, продуктовых видео, подкастов и реплик персонажей.
  • Держите выразительные инструкции рядом со script.
Управление audio tags в Gemini 3.1 Flash TTS

02

Диалог двух speakers

Назначьте ровно два speaker alias разным голосам Gemini для разговорного аудио. Добавляйте speaker ID в начало строк text, а затем сопоставляйте каждого speaker с отдельным голосом в API-запросе.
  • Создавайте подкаст-сегменты с host и guest.
  • Прототипируйте диалоги персонажей и разговоры ассистентов.
  • Настраивайте speaker alias и voice для каждой роли диалога.
Диалог двух speakers в Gemini 3.1 Flash TTS

Что можно создать

01

Подкасты и озвучка

Генерируйте выразительные реплики ведущего, intro-сегменты, аудиокнижную озвучку и редакционное аудио с управляемой подачей.

02

Учебный контент

Превращайте сценарии курсов, onboarding-уроки и учебные материалы в понятное многоязычное аудио.

03

Диалоги персонажей

Прототипируйте игровые реплики, roleplay-сценарии, сюжетные сцены и разговоры двух speakers с разными голосами.

04

Локализованный голос продукта

Создавайте подсказки приложения, сообщения поддержки, продуктовые демо и accessibility-речь на нескольких языках.

Цены Gemini 3.1 Flash TTS: PoYo vs fal.ai

PoYo предоставляет Gemini 3.1 Flash TTS через тот же асинхронный workflow генерации, который используется для аудиомоделей PoYo, с прозрачной ценой относительно публичной справочной цены.
ПараметрPoYoFal.ai
Публичный model IDgemini-3-1-flash-ttsНе раскрывается
Справочная цена$0.12 за 1000 символов$0.15 за 1000 символов
PoYo credits24 credits за 1000 символовN/A
Основные настройкиtext, style_instructions, voice, language_code, speakers, temperature, output_formatText input с управлением стилем, voice, языком, speaker, temperature и format
WorkflowОтправить задачу, опросить стандартный статус, скачать audio filesСправочный queue workflow

Цена PoYo использует 24 credits за 1000 символов. Один credit стоит $0.005.

Как использовать Gemini 3.1 Flash TTS в PoYo

  1. Получите API Key: Создайте аккаунт PoYo и сгенерируйте API Key в dashboard. Получить API Key ->
  2. Напишите text: Введите text для озвучивания и при необходимости добавьте audio tags, например [laughing], [sigh], [whispering] или [short pause].
  3. Выберите настройки voice: Выберите Gemini voice, опционально language_code, style_instructions, temperature, output_format или настройте ровно два speakers с speaker_id и voice.
  4. Отправьте и получите результат: Отправьте задачу через PoYo generate API, затем используйте стандартный endpoint статуса задачи для получения audio output. Открыть API docs ->

Gemini 3.1 Flash TTS FAQ

Что такое Gemini 3.1 Flash TTS?

Gemini 3.1 Flash TTS - выразительная text-to-speech модель Google для генерации естественного многоязычного аудио из text inputs. Она поддерживает audio tags, style direction на естественном языке, голоса Gemini и диалог двух speakers.

Что указывать в поле text?

Укажите в text слова, которые нужно произнести. Также можно добавить inline audio tags, например [laughing], [sigh], [whispering] и [short pause]. Для multi-speaker синтеза начинайте строки с alias вроде Host: и Guest:.

Как работают style_instructions?

Используйте style_instructions для указаний по подаче, применимых ко всему запросу: например тепло и медленно, драматичный новостной стиль, британский акцент, веселый тон или загадочный шепот.

Поддерживает ли Gemini 3.1 Flash TTS audio tags?

Да. Audio tags - одна из сильных сторон модели: они помогают управлять эмоциями, паузами, смехом, шепотом, темпом и другими деталями исполнения прямо в script.

Какие voices и языки поддерживаются?

API предоставляет 30 голосов Gemini, включая Kore, Puck, Charon, Zephyr и Aoede. Модель поддерживает многоязычный синтез на 70+ языках с опциональным управлением через language_code.

Можно ли создать multi-speaker диалог?

Да. Отправьте ровно два speakers, каждый со speaker_id и voice. Используйте те же speaker_id prefixes в text, чтобы модель направляла каждую строку к нужному voice. Когда speakers задан, top-level voice игнорируется.

Какие форматы вывода можно запросить?

PoYo поддерживает mp3, wav и ogg_opus для Gemini 3.1 Flash TTS. MP3 используется по умолчанию и подходит для компактного воспроизведения в web и app.

Как считается биллинг и как получить результаты?

PoYo списывает 24 credits за 1000 символов, то есть $0.12 за 1000 символов. Отправьте запрос генерации, затем используйте возвращенный task_id со стандартным endpoint статуса PoYo, чтобы получить audio files.

Почему PoYo

01

Понятная цена за символ

Используйте Gemini 3.1 Flash TTS за $0.12 за 1000 символов с предсказуемым credit billing.

02

Единый доступ к моделям

Используйте один аккаунт PoYo, биллинг, status polling и callback workflow для text, image, video и audio моделей.

03

Production workflow

Отправляйте async jobs, опрашивайте стабильный task status и получайте готовые speech files через одну API surface.

04

Выразительные настройки

Используйте практичные production controls для text, style, voice, language, speakers, temperature и output_format.