Model icon
gemini-3-1-flash-tts
Text to Speech
모델:
Google Gemini 3.1 Flash TTS는 세밀한 오디오 태그, 자연스러운 스타일 제어, 두 명 화자 대화를 갖춘 표현력 있는 다국어 음성을 생성합니다.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

예시 출력

이는 샘플 데이터입니다. 새 결과를 생성하면 실제 출력을 확인할 수 있습니다.

작업 ID:ZVT5QJYOGL1MQ2LW생성 시간:2026-06-25 15:14:42
상태:finished진행률:100%
Examples
가격 세부정보

숨겨진 비용 없이 투명한 가격입니다. 사용한 만큼만 지불하세요.

Googlegemini-3-1-flash-tts
Text to speech
PoYo 가격
$0.120
24 크레딧
공식 가격
$0.150
Reference
절약률
20%

* 실제 비용은 최종 출력을 기준으로 합니다.

소개

오디오 태그로 정밀 제어하는 합리적인 Gemini 3.1 Flash TTS API 사용에 대한 전체 가이드

오디오 태그로 정밀 제어하는 합리적인 Gemini 3.1 Flash TTS API

PoYo의 Gemini 3.1 Flash TTS로 자연스러운 text-to-speech 워크플로를 구축하세요. 표현력 있는 오디오 태그, 자연어 스타일 지시, Gemini voice, 두 명 화자 대화, 표준 비동기 상태 조회를 하나의 API에서 사용할 수 있습니다. 팟캐스트 대사, 앱 음성, 학습 내레이션, 현지화 음성을 명확한 문자 단가로 생성할 수 있습니다.

PoYo에서 사용 가능한 Gemini 3.1 Flash TTS API 모델

01

gemini-3-1-flash-tts

PoYo에서 1000자당 24 credits, 즉 1000자당 $0.12로 사용할 수 있는 표현력 있는 Google TTS입니다. text, style_instructions, voice, language_code, speakers, temperature, output_format을 제어할 수 있습니다.
Playground 사용해 보기

Gemini 3.1 Flash TTS가 다른 이유

Gemini 3.1 Flash TTS는 지시를 따르고 전달 방식을 전환하며, 복잡한 음성 파이프라인 없이 다국어 제품 워크플로를 지원하도록 설계되었습니다.

01

세밀한 오디오 태그

[sigh], [laughing], [whispering], [short pause] 같은 표현 태그로 script 안에서 전달 방식을 제어하세요. 하나의 text 필드로 말할 내용과 연기 지시를 함께 다룰 수 있습니다.
  • 감정, 속도, 비언어적 전달 신호를 제어합니다.
  • 스토리, 제품 영상, 팟캐스트, 캐릭터 대사에 태그를 활용합니다.
  • 표현 지시를 script와 가까운 곳에 유지합니다.
Gemini 3.1 Flash TTS 오디오 태그 제어

02

두 명 화자 대화

정확히 두 개의 speaker alias를 서로 다른 Gemini voice에 할당해 대화형 오디오를 만들 수 있습니다. text의 줄 앞에 speaker ID를 붙이고, API 요청에서 각 speaker를 고유한 voice에 매핑합니다.
  • Host와 Guest가 있는 팟캐스트 세그먼트를 만듭니다.
  • 캐릭터 대화와 어시스턴트 대화를 프로토타입합니다.
  • 대화 역할마다 speaker alias와 voice를 설정합니다.
Gemini 3.1 Flash TTS 두 명 화자 대화

만들 수 있는 것

01

팟캐스트와 내레이션

표현력 있는 진행자 멘트, 인트로, 오디오북 내레이션, 편집 음성을 지시 기반으로 생성합니다.

02

학습 콘텐츠

강의 script, 온보딩 수업, 교육 자료를 명확한 다국어 음성으로 변환합니다.

03

캐릭터 대화

게임 대사, 롤플레이 흐름, 스토리 장면, 두 명 화자 대화를 서로 다른 voice로 프로토타입합니다.

04

현지화된 제품 음성

앱 안내, 지원 메시지, 제품 데모, 접근성 음성을 여러 언어로 만듭니다.

Gemini 3.1 Flash TTS 가격: PoYo vs fal.ai

PoYo는 다른 PoYo 오디오 모델과 동일한 비동기 생성 워크플로로 Gemini 3.1 Flash TTS를 제공하며, 공개 기준 가격과 비교 가능한 명확한 가격을 제공합니다.
항목PoYoFal.ai
공개 모델 IDgemini-3-1-flash-tts공개되지 않음
기준 가격1000자당 $0.121000자당 $0.15
PoYo credits1000자당 24 creditsN/A
핵심 제어text, style_instructions, voice, language_code, speakers, temperature, output_format스타일, voice, 언어, speaker, temperature, format 제어가 있는 text 입력
워크플로작업 제출, 표준 상태 조회, 오디오 파일 다운로드기준 큐 워크플로

PoYo 가격은 1000자당 24 credits입니다. 1 credit은 $0.005입니다.

PoYo에서 Gemini 3.1 Flash TTS 사용하는 방법

  1. API Key 받기: PoYo 계정을 만들고 대시보드에서 API Key를 생성합니다. API Key 받기 ->
  2. text 작성: 읽을 text를 입력하고 필요하면 [laughing], [sigh], [whispering], [short pause] 같은 오디오 태그를 추가합니다.
  3. voice 설정 선택: Gemini voice를 선택하고, 선택적으로 language_code, style_instructions, temperature, output_format을 지정하거나 speaker_id와 voice가 있는 정확히 두 개의 speakers를 설정합니다.
  4. 제출 및 조회: PoYo generate API로 작업을 제출한 뒤 표준 작업 상태 API를 사용해 오디오 출력을 가져옵니다. API 문서 보기 ->

Gemini 3.1 Flash TTS FAQ

Gemini 3.1 Flash TTS란 무엇인가요?

Gemini 3.1 Flash TTS는 text에서 자연스러운 다국어 오디오를 생성하는 Google의 표현형 text-to-speech 모델입니다. 오디오 태그, 자연어 스타일 지시, Gemini voice, 두 명 화자 대화를 지원합니다.

text 필드에는 무엇을 넣어야 하나요?

text에는 말할 문장을 넣습니다. [laughing], [sigh], [whispering], [short pause] 같은 인라인 오디오 태그도 포함할 수 있습니다. 다중 화자 합성에서는 Host:, Guest: 같은 alias를 줄 앞에 붙입니다.

style_instructions는 어떻게 동작하나요?

style_instructions는 전체 요청에 적용되는 전달 지시입니다. 예를 들어 따뜻하고 느리게, 극적인 뉴스 진행, 영국식 억양, 밝은 톤, 신비롭게 속삭이기 등을 지정할 수 있습니다.

Gemini 3.1 Flash TTS는 오디오 태그를 지원하나요?

예. 오디오 태그는 이 모델의 핵심 강점이며, 감정, 멈춤, 웃음, 속삭임, 속도 등 전달 세부 사항을 script 안에서 직접 제어하는 데 도움이 됩니다.

어떤 voice와 언어를 지원하나요?

API는 Kore, Puck, Charon, Zephyr, Aoede 등 30개의 Gemini voice를 제공합니다. 이 모델은 70개 이상의 언어에서 다국어 합성을 지원하며, language_code로 선택적 언어 유도를 할 수 있습니다.

다중 화자 대화를 만들 수 있나요?

예. speaker_id와 voice가 있는 정확히 두 개의 speakers를 전송합니다. text에서도 같은 speaker_id prefix를 사용해 각 줄을 원하는 voice로 라우팅합니다. speakers가 설정되면 최상위 voice는 무시됩니다.

어떤 출력 형식을 요청할 수 있나요?

PoYo는 Gemini 3.1 Flash TTS에 대해 mp3, wav, ogg_opus를 지원합니다. MP3가 기본값이며 웹과 앱 재생을 위한 작은 파일에 권장됩니다.

과금은 어떻게 계산되고 결과는 어떻게 받나요?

PoYo는 1000자당 24 credits, 즉 1000자당 $0.12로 과금합니다. 생성 요청을 제출한 뒤 반환된 task_id를 PoYo 표준 작업 상태 API에 사용해 오디오 파일을 가져옵니다.

PoYo를 사용하는 이유

01

명확한 문자 단가

Gemini 3.1 Flash TTS를 1000자당 $0.12에 예측 가능한 credit 과금으로 사용할 수 있습니다.

02

통합 모델 접근

text, image, video, audio 모델 전반에서 동일한 PoYo 계정, 과금, 상태 조회, callback 워크플로를 사용합니다.

03

프로덕션 워크플로

비동기 작업을 제출하고 안정적인 작업 상태를 조회하며 완성된 음성 파일을 하나의 API surface에서 가져옵니다.

04

표현력 있는 제어

text, style, voice, language, speakers, temperature, output_format을 위한 실용적인 프로덕션 제어를 제공합니다.