Model icon
gemini-3-1-flash-tts
Text to Speech
モデル:
Google Gemini 3.1 Flash TTS は、細かな音声タグ、自然なスタイル制御、2 人話者の会話に対応した表現力のある多言語音声を生成します。
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

出力例

これはサンプルデータです。新しい結果を生成すると実際の出力を確認できます。

タスクID:ZVT5QJYOGL1MQ2LW作成日時:2026-06-25 15:14:42
ステータス:finished進行状況:100%
Examples
価格詳細

透明な価格設定。隠れた費用はありません。使った分だけ支払えます。

Googlegemini-3-1-flash-tts
Text to speech
PoYo価格
$0.120
24 クレジット
公式価格
$0.150
Reference
節約率
20%

* 実際の料金は最終出力に基づきます。

紹介

音声タグで精密制御できる手頃な Gemini 3.1 Flash TTS API を使用するための完全なガイド

音声タグで精密制御できる手頃な Gemini 3.1 Flash TTS API

PoYo 上の Gemini 3.1 Flash TTS で、自然な text-to-speech ワークフローを構築できます。表現力のある音声タグ、自然言語のスタイル指示、Gemini voice、2 人話者の会話、標準の非同期ステータス確認を 1 つの API で扱えます。Podcast 台本、アプリ音声、学習ナレーション、ローカライズ音声を、明確な文字単価で生成できます。

PoYoで利用できるGemini 3.1 Flash TTS APIモデル

01

gemini-3-1-flash-tts

PoYo では 1000 文字あたり 24 credits、つまり 1000 文字あたり $0.12 で利用できる表現力のある Google TTS です。text、style_instructions、voice、language_code、speakers、temperature、output_format を制御できます。
Playground を試す

Gemini 3.1 Flash TTS が違う理由

Gemini 3.1 Flash TTS は、指示に沿って話し方を切り替え、多言語のプロダクト音声ワークフローを複雑な voice pipeline なしで支えるために作られています。

01

細かな音声タグ

[sigh]、[laughing]、[whispering]、[short pause] などの表現タグを script 内に入れて読み上げを制御できます。1 つの text フィールドで、話す内容と演出指示の両方を扱えます。
  • 感情、間、非言語的な声の合図を制御できます。
  • ストーリー、製品動画、Podcast、キャラクター台詞にタグを使えます。
  • 表現の指示を script のすぐ近くに保てます。
Gemini 3.1 Flash TTS 音声タグ制御

02

2 人話者の会話

ちょうど 2 つの speaker alias を別々の Gemini voice に割り当てて、会話形式の音声を生成できます。text の各行に speaker ID を付け、API リクエストで各 speaker を個別の voice に対応させます。
  • Host と Guest の Podcast セグメントを作成できます。
  • キャラクター会話やアシスタント会話を試作できます。
  • 会話内の役割ごとに speaker alias と voice を設定できます。
Gemini 3.1 Flash TTS 2 人話者会話

作成できるもの

01

Podcast とナレーション

Host 読み、イントロ、オーディオブック、編集音声を、演出指示付きで生成できます。

02

学習コンテンツ

コース台本、オンボーディング教材、研修資料を、明瞭な多言語音声に変換できます。

03

キャラクター会話

ゲーム台詞、ロールプレイ、物語シーン、2 人話者の会話を別々の voice で試作できます。

04

ローカライズされた製品音声

アプリ案内、サポートメッセージ、製品デモ、アクセシビリティ音声を複数言語で作成できます。

Gemini 3.1 Flash TTS 料金:PoYo vs fal.ai

PoYo は、PoYo の他の audio モデルと同じ非同期生成ワークフローで Gemini 3.1 Flash TTS を提供し、公開参考価格と比較しやすい明確な料金を示します。
項目PoYoFal.ai
公開モデル IDgemini-3-1-flash-tts非公開
参考価格1000 文字あたり $0.121000 文字あたり $0.15
PoYo credits1000 文字あたり 24 creditsN/A
主要コントロールtext, style_instructions, voice, language_code, speakers, temperature, output_formatスタイル、voice、言語、speaker、temperature、format を制御できる text 入力
ワークフロータスク送信、標準ステータス確認、音声ファイルのダウンロード参考キューワークフロー

PoYo の料金は 1000 文字あたり 24 credits です。1 credit は $0.005 です。

PoYo で Gemini 3.1 Flash TTS を使う方法

  1. API Key を取得: PoYo アカウントを作成し、ダッシュボードで API Key を生成します。API Key を取得 ->
  2. text を書く: 読み上げたい text を入力し、必要に応じて [laughing]、[sigh]、[whispering]、[short pause] などの音声タグを追加します。
  3. voice 設定を選ぶ: Gemini voice を選び、任意で language_code、style_instructions、temperature、output_format を指定するか、speaker_id と voice を持つちょうど 2 つの speakers を設定します。
  4. 送信して取得: PoYo generate API でタスクを送信し、標準のタスクステータス API で音声出力を取得します。API ドキュメントを見る ->

Gemini 3.1 Flash TTS FAQ

Gemini 3.1 Flash TTS とは何ですか?

Gemini 3.1 Flash TTS は、text から自然な多言語音声を生成する Google の表現力豊かな text-to-speech モデルです。音声タグ、自然言語のスタイル指示、Gemini voice、2 人話者の会話に対応します。

text フィールドには何を入れればよいですか?

text には話してほしい言葉を入れます。[laughing]、[sigh]、[whispering]、[short pause] などの音声タグも使えます。複数話者では Host: や Guest: のような alias を行頭に付けます。

style_instructions はどう使いますか?

style_instructions はリクエスト全体に適用する読み上げ指示です。例として、暖かくゆっくり、ドラマチックなニュース風、英国アクセント、明るいトーン、ミステリアスなささやきなどを指定できます。

Gemini 3.1 Flash TTS は音声タグに対応していますか?

はい。音声タグはこのモデルの強みで、感情、間、笑い、ささやき、速度などの演出を script 内で直接制御できます。

どの voice と言語に対応していますか?

API は Kore、Puck、Charon、Zephyr、Aoede など 30 種類の Gemini voice を提供します。70 以上の言語で多言語合成に対応し、任意で language_code による誘導もできます。

複数話者の会話を作れますか?

はい。speaker_id と voice を持つちょうど 2 つの speakers を送信します。text 内でも同じ speaker_id の prefix を使うことで、各行を意図した voice に割り当てます。speakers を設定すると、トップレベルの voice は無視されます。

どの出力形式を指定できますか?

PoYo は Gemini 3.1 Flash TTS で mp3、wav、ogg_opus をサポートします。MP3 がデフォルトで、Web やアプリ再生向けの軽量ファイルに適しています。

課金はどう計算され、結果はどう取得しますか?

PoYo は 1000 文字あたり 24 credits、つまり 1000 文字あたり $0.12 で課金します。生成リクエストを送信し、返された task_id を PoYo の標準タスクステータス API に渡して音声ファイルを取得します。

PoYo を使う理由

01

明確な文字単価

Gemini 3.1 Flash TTS を 1000 文字あたり $0.12 で、予測しやすい credit 課金として利用できます。

02

統一されたモデルアクセス

text、image、video、audio モデルを、同じ PoYo アカウント、課金、ステータス確認、callback ワークフローで使えます。

03

本番向けワークフロー

非同期ジョブを送信し、安定したタスクステータスを確認し、完成した音声ファイルを 1 つの API surface から取得できます。

04

表現力のある制御

text、style、voice、language、speakers、temperature、output_format による実用的な本番向け制御を提供します。