
開発者向けの AI API
音声合成API
PoYo 音声合成API を使用して AI 音声生成を製品に追加します。 TTS モデル、音声コントロール、言語、オーディオ形式、タイムスタンプ、ナレーション ワークフローの価格を比較します。
対応モデル
4 個のモデル

$0.04 /1,000文字
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1,000文字
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1,000文字
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1,000文字
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
テキスト読み上げモデル API - 価格とモデル適合性
モデルを選ぶ前に、提供元、対応入力、出力形式、料金を比較してください。
正確なタスク一致
カタログメタデータに Text to Speech が含まれるモデルだけがここに表示されます。
プロバイダー比較
タスクディレクトリから離れずに、複数プロバイダーのモデルファミリーを比較できます。
API対応の導線
各モデルカードから PoYo の価格、例、Playground、API詳細へ移動できます。
| モデル | プロバイダー | タスクタイプ | 価格 |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1,000文字 |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1,000文字 |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1,000文字 | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1,000文字 |
よくある質問
音声合成APIとは何ですか?
+
音声合成API は、書かれたテキストから音声を生成します。すべてのスクリプトを手動で記録することなく、アプリケーションでナレーションおよび音声機能を有効にします。選択したモデルによって、利用可能な音声、言語、音声コントロール、出力形式が決まります。
TTS API モデルはどのように選択すればよいですか?
+
名前、数字、長い文を含む実際のスクリプトをテストします。発音、自然さ、表現力のコントロール、声の一貫性、コストを比較します。必要な言語と音声形式を確認し、製品にとって応答時間が重要である場合は文書化されたリクエスト フローを確認してください。
声、話すスピード、感情は選べますか?
+
利用可能なコントロールはモデルによって異なります。エンドポイントは、音声プリセット、速度、安定性、スタイル指示、またはオーディオ タグを提供する場合があります。文書化されたフィールドとサポートされている値を使用します。速度や感情の制御を持たないモデルは、任意のパラメーターを解釈することを期待すべきではありません。
音声合成API はどの言語をサポートしていますか?
+
言語範囲と発音品質はモデルと音声によって異なります。文書化された言語オプションまたは検出動作を確認し、ネイティブ テキストと混合言語の文章をテストします。多言語ラベルは、すべてのアクセントや固有名について同等の品質を保証するものではありません。
発音が間違っている名前、略語、または数字を修正するにはどうすればよいですか?
+
文章を話し言葉用に書き直し、曖昧な略語を拡張し、短い文をテストします。可能な場合は、文書化された発音または正規化コントロールを使用します。書かれた表示文字列が常に最適な音声入力であると想定するのではなく、レビュー済みのテキスト バージョンをナレーション用に保存してください。
長い形式のナレーションを生成できますか?
+
エンドポイントのテキスト制限とサポートされている期間の動作を確認してください。長いスクリプトを自然な段落または文の境界で分割し、音声設定を再利用し、組み立て後にトランジションを確認します。モデルがサポートするコンテキスト フィールドを保持して、個別のリクエスト間の連続性を高めます。
TTS API は自動的に音声のクローンを作成しますか?
+
いいえ。合成音声またはプリセットの選択は、録音からクローンを作成することとは異なります。音声クローン作成には、特別にサポートされているワークフローと適切な権限が必要です。カスタム音声 ID を中心に製品を設計する前に、利用可能なエンドポイントを確認してください。
単語のタイムスタンプを取得したり、ダイアログを生成したりできますか?
+
タイムスタンプや複数スピーカーのコントロールを提供するモデルもあれば、提供しないモデルもあります。モデル ページで出力フィールドとリクエスト オプションを確認します。字幕や同期されたテキストのハイライトにタイムスタンプを使用する前に、独自のスクリプトの位置合わせを検証してください。
どのオーディオ形式をリクエストできますか?
+
選択した TTS モデルについて文書化されている形式と品質オプションを使用します。再生、電話、編集には、異なるコーデックやサンプル レートが必要になる場合があります。アプリケーションでサポートされていない形式が必要な場合は、完成した出力を検査し、別のメディア ステップで変換します。
PoYo を通じて生成された音声を取得するにはどうすればよいですか?
+
選択したモデル生成エンドポイントを使用し、task_id を保存し、ステータス クエリまたはサポートされている callback_url を通じて完成したオーディオを取得します。低遅延 TTS というフレーズからストリーミング エンドポイントを推測しないでください。そのモデルについて文書化されている正確な PoYo インターフェイスを確認してください。
音声合成API の価格はどのように計算されますか?
+
TTS の価格設定では、キャラクター、トークン、世代、または別のモデル固有の単位を使用できます。選択した層が使用量をカウントする方法と、オプションの設定がそれにどのような影響を与えるかを確認してください。さまざまな請求単位で実際の価格を比較するのではなく、完全なスクリプトと予想される再試行を見積もります。
TTS をトーキング アバター API に接続するにはどうすればよいですか?
+
まず音声を生成してレビューし、次にその形式と長さがアバター エンドポイントの要件を満たしていることを確認します。音声に適切なポートレートを提供し、アバター タスクを個別に追跡します。ナレーションのテキストと音声の設定を維持し、改訂後に意図した内容を再現できるようにします。