Examples
価格詳細
透明な価格設定。隠れた費用はありません。使った分だけ支払えます。
Text to speech
PoYo価格
$0.120
24 クレジット
公式価格
$0.150
Reference
節約率
20%
| モデル | 仕様 | PoYo価格 | 公式価格 | 節約率 |
|---|---|---|---|---|
Text to speech | $0.120 24 クレジット per 1000 characters | $0.150 Reference | 20% |
* 実際の料金は最終出力に基づきます。
紹介
音声タグで精密制御できる手頃な Gemini 3.1 Flash TTS API を使用するための完全なガイド
音声タグで精密制御できる手頃な Gemini 3.1 Flash TTS API
PoYo 上の Gemini 3.1 Flash TTS で、自然な text-to-speech ワークフローを構築できます。表現力のある音声タグ、自然言語のスタイル指示、Gemini voice、2 人話者の会話、標準の非同期ステータス確認を 1 つの API で扱えます。Podcast 台本、アプリ音声、学習ナレーション、ローカライズ音声を、明確な文字単価で生成できます。
PoYoで利用できるGemini 3.1 Flash TTS APIモデル
01
PoYo では 1000 文字あたり 24 credits、つまり 1000 文字あたり $0.12 で利用できる表現力のある Google TTS です。text、style_instructions、voice、language_code、speakers、temperature、output_format を制御できます。
Gemini 3.1 Flash TTS が違う理由
Gemini 3.1 Flash TTS は、指示に沿って話し方を切り替え、多言語のプロダクト音声ワークフローを複雑な voice pipeline なしで支えるために作られています。
01
細かな音声タグ
[sigh]、[laughing]、[whispering]、[short pause] などの表現タグを script 内に入れて読み上げを制御できます。1 つの text フィールドで、話す内容と演出指示の両方を扱えます。
- 感情、間、非言語的な声の合図を制御できます。
- ストーリー、製品動画、Podcast、キャラクター台詞にタグを使えます。
- 表現の指示を script のすぐ近くに保てます。

02
2 人話者の会話
ちょうど 2 つの speaker alias を別々の Gemini voice に割り当てて、会話形式の音声を生成できます。text の各行に speaker ID を付け、API リクエストで各 speaker を個別の voice に対応させます。
- Host と Guest の Podcast セグメントを作成できます。
- キャラクター会話やアシスタント会話を試作できます。
- 会話内の役割ごとに speaker alias と voice を設定できます。

作成できるもの
01
Podcast とナレーション
Host 読み、イントロ、オーディオブック、編集音声を、演出指示付きで生成できます。
02
学習コンテンツ
コース台本、オンボーディング教材、研修資料を、明瞭な多言語音声に変換できます。
03
キャラクター会話
ゲーム台詞、ロールプレイ、物語シーン、2 人話者の会話を別々の voice で試作できます。
04
ローカライズされた製品音声
アプリ案内、サポートメッセージ、製品デモ、アクセシビリティ音声を複数言語で作成できます。
Gemini 3.1 Flash TTS 料金:PoYo vs fal.ai
PoYo は、PoYo の他の audio モデルと同じ非同期生成ワークフローで Gemini 3.1 Flash TTS を提供し、公開参考価格と比較しやすい明確な料金を示します。
| 項目 | PoYo | Fal.ai |
|---|---|---|
| 公開モデル ID | gemini-3-1-flash-tts | 非公開 |
| 参考価格 | 1000 文字あたり $0.12 | 1000 文字あたり $0.15 |
| PoYo credits | 1000 文字あたり 24 credits | N/A |
| 主要コントロール | text, style_instructions, voice, language_code, speakers, temperature, output_format | スタイル、voice、言語、speaker、temperature、format を制御できる text 入力 |
| ワークフロー | タスク送信、標準ステータス確認、音声ファイルのダウンロード | 参考キューワークフロー |
PoYo の料金は 1000 文字あたり 24 credits です。1 credit は $0.005 です。
PoYo で Gemini 3.1 Flash TTS を使う方法
- API Key を取得: PoYo アカウントを作成し、ダッシュボードで API Key を生成します。API Key を取得 ->
- text を書く: 読み上げたい text を入力し、必要に応じて [laughing]、[sigh]、[whispering]、[short pause] などの音声タグを追加します。
- voice 設定を選ぶ: Gemini voice を選び、任意で language_code、style_instructions、temperature、output_format を指定するか、speaker_id と voice を持つちょうど 2 つの speakers を設定します。
- 送信して取得: PoYo generate API でタスクを送信し、標準のタスクステータス API で音声出力を取得します。API ドキュメントを見る ->
Gemini 3.1 Flash TTS FAQ
Gemini 3.1 Flash TTS とは何ですか?
Gemini 3.1 Flash TTS は、text から自然な多言語音声を生成する Google の表現力豊かな text-to-speech モデルです。音声タグ、自然言語のスタイル指示、Gemini voice、2 人話者の会話に対応します。
text フィールドには何を入れればよいですか?
text には話してほしい言葉を入れます。[laughing]、[sigh]、[whispering]、[short pause] などの音声タグも使えます。複数話者では Host: や Guest: のような alias を行頭に付けます。
style_instructions はどう使いますか?
style_instructions はリクエスト全体に適用する読み上げ指示です。例として、暖かくゆっくり、ドラマチックなニュース風、英国アクセント、明るいトーン、ミステリアスなささやきなどを指定できます。
Gemini 3.1 Flash TTS は音声タグに対応していますか?
はい。音声タグはこのモデルの強みで、感情、間、笑い、ささやき、速度などの演出を script 内で直接制御できます。
どの voice と言語に対応していますか?
API は Kore、Puck、Charon、Zephyr、Aoede など 30 種類の Gemini voice を提供します。70 以上の言語で多言語合成に対応し、任意で language_code による誘導もできます。
複数話者の会話を作れますか?
はい。speaker_id と voice を持つちょうど 2 つの speakers を送信します。text 内でも同じ speaker_id の prefix を使うことで、各行を意図した voice に割り当てます。speakers を設定すると、トップレベルの voice は無視されます。
どの出力形式を指定できますか?
PoYo は Gemini 3.1 Flash TTS で mp3、wav、ogg_opus をサポートします。MP3 がデフォルトで、Web やアプリ再生向けの軽量ファイルに適しています。
課金はどう計算され、結果はどう取得しますか?
PoYo は 1000 文字あたり 24 credits、つまり 1000 文字あたり $0.12 で課金します。生成リクエストを送信し、返された task_id を PoYo の標準タスクステータス API に渡して音声ファイルを取得します。
PoYo を使う理由
01
明確な文字単価
Gemini 3.1 Flash TTS を 1000 文字あたり $0.12 で、予測しやすい credit 課金として利用できます。
02
統一されたモデルアクセス
text、image、video、audio モデルを、同じ PoYo アカウント、課金、ステータス確認、callback ワークフローで使えます。
03
本番向けワークフロー
非同期ジョブを送信し、安定したタスクステータスを確認し、完成した音声ファイルを 1 つの API surface から取得できます。
04
表現力のある制御
text、style、voice、language、speakers、temperature、output_format による実用的な本番向け制御を提供します。