텍스트 음성 변환 API

개발자를 위한 AI API

텍스트 음성 변환 API

PoYo 텍스트 음성 변환 API를 사용하여 제품에 AI 음성 생성을 추가하세요. 내레이션 워크플로우에 대한 TTS 모델, 음성 제어, 언어, 오디오 형식, 타임스탬프 및 가격을 비교하세요.

텍스트 음성 변환 모델 API - 가격 및 모델 적합성

모델을 선택하기 전에 공급자, 지원 입력, 출력 형식 및 가격을 비교하세요.

정확한 작업 매칭

카탈로그 메타데이터에 Text to Speech가 포함된 모델만 여기에 표시됩니다.

제공사 비교

작업 디렉터리를 벗어나지 않고 여러 제공사의 모델 제품군을 비교하세요.

API 준비 경로

각 모델 카드는 PoYo 가격, 예시, 플레이그라운드, API 세부 정보로 연결됩니다.

모델제공사작업 유형가격
ElevenLabs TTS Turbo v2.5

elevenlabs-tts-turbo-2-5

ElevenLabsText to Speech$0.04/1,000자
ElevenLabs V3 TTS

elevenlabs-v3-tts

ElevenLabsText to Speech$0.08/1,000자
Gemini 3.1 Flash TTS

gemini-3-1-flash-tts

GoogleText to Speech$0.12/1,000자
xAI TTS 1

xai-tts-1

xAIText to Speech$0.012/1,000자

자주 묻는 질문

텍스트 음성 변환 API란 무엇인가요?

+

텍스트 음성 변환 API는 작성된 텍스트에서 음성 오디오를 생성합니다. 모든 스크립트를 수동으로 녹음하지 않고도 응용 프로그램에서 내레이션 및 음성 기능을 사용할 수 있습니다. 선택한 모델에 따라 사용 가능한 음성, 언어, 말하기 제어 및 출력 형식이 결정됩니다.

TTS API 모델을 어떻게 선택하나요?

+

이름, 숫자, 긴 문장을 포함한 실제 스크립트를 테스트하세요. 발음, 자연스러움, 표현 조절, 음성 일관성 및 비용을 비교하세요. 필요한 언어와 오디오 형식을 확인하고, 제품에 응답 시간이 중요한 경우 문서화된 요청 흐름을 확인하세요.

목소리, 말하는 속도, 감정을 선택할 수 있나요?

+

사용 가능한 컨트롤은 모델에 따라 다릅니다. 엔드포인트는 음성 사전 설정, 속도, 안정성, 스타일 지침 또는 오디오 태그를 제공할 수 있습니다. 문서화된 필드와 지원되는 값을 사용하세요. 속도나 감정 제어 기능이 없는 모델은 임의의 매개변수를 해석할 것으로 기대해서는 안 됩니다.

텍스트 음성 변환 API는 어떤 언어를 지원하나요?

+

언어 적용 범위와 발음 품질은 모델과 음성에 따라 다릅니다. 문서화된 언어 옵션이나 감지 동작을 확인한 다음 기본 텍스트와 혼합 언어 구절을 테스트하세요. 다국어 라벨은 모든 악센트나 고유명사에 대해 동일한 품질을 보장하지 않습니다.

잘못 발음된 이름, 약어, 숫자를 어떻게 고칠 수 있나요?

+

음성 언어에 대한 구절을 다시 작성하고, 모호한 약어를 확장하고, 짧은 문장을 테스트합니다. 가능한 경우 문서화된 발음 또는 정규화 제어를 사용합니다. 서면 표시 문자열이 항상 최고의 음성 입력이라고 가정하기보다는 내레이션을 위해 검토된 텍스트 버전을 유지하세요.

긴 형식의 내레이션을 생성할 수 있나요?

+

엔드포인트 텍스트 제한과 지원되는 기간 동작을 확인하세요. 자연스러운 단락이나 문장 경계에서 긴 스크립트를 나누고, 음성 설정을 재사용하고, 조립 후 전환을 검토하세요. 별도의 요청 간의 연속성을 돕기 위해 모델이 지원하는 컨텍스트 필드를 유지합니다.

TTS API가 자동으로 음성을 복제합니까?

+

아니요. 합성 음성이나 사전 설정을 선택하는 것은 녹음에서 복제본을 만드는 것과 다릅니다. 음성 복제에는 특별히 지원되는 워크플로와 적절한 권한이 필요합니다. 사용자 지정 음성 ID를 중심으로 제품을 설계하기 전에 사용 가능한 엔드포인트를 확인하세요.

단어 타임스탬프를 얻거나 대화를 생성할 수 있나요?

+

일부 모델은 타임스탬프나 다중 스피커 제어 기능을 제공하지만 다른 모델은 그렇지 않습니다. 모델 페이지에서 출력 필드와 요청 옵션을 확인하세요. 자막이나 동기화된 텍스트 강조 표시에 타임스탬프를 사용하기 전에 자신의 스크립트 정렬을 확인하세요.

어떤 오디오 포맷을 요청할 수 있나요?

+

선택한 TTS 모델에 대해 문서화된 형식 및 품질 옵션을 사용합니다. 재생, 전화 통신 및 편집에는 다양한 코덱이나 샘플링 속도가 필요할 수 있습니다. 애플리케이션에 지원되지 않는 형식이 필요한 경우 완료된 출력을 검사하고 별도의 미디어 단계에서 변환합니다.

PoYo를 통해 생성된 음성을 어떻게 검색합니까?

+

선택한 모델 생성 엔드포인트를 사용하고, task_id를 저장하고, 상태 쿼리 또는 지원되는 callback_url를 통해 완성된 오디오를 검색합니다. 지연 시간이 짧은 TTS라는 문구에서 스트리밍 엔드포인트를 추론하지 마세요. 해당 모델에 대해 문서화된 정확한 PoYo 인터페이스를 확인하세요.

텍스트 음성 변환 API 가격은 어떻게 계산되나요?

+

TTS 가격 책정에는 캐릭터, 토큰, 생성 또는 기타 모델별 단위를 사용할 수 있습니다. 선택한 계층이 사용량을 계산하는 방식과 옵션 설정이 이에 영향을 미치는 방식을 확인하세요. 다양한 청구 단위와 원시 가격을 비교하는 대신 전체 스크립트와 예상 재시도를 예측하세요.

TTS를 말하는 아바타 API와 어떻게 연결할 수 있나요?

+

먼저 음성을 생성하고 검토한 다음 음성의 형식과 길이가 아바타 엔드포인트 요구 사항을 충족하는지 확인합니다. 적절한 초상화와 함께 오디오를 제공하고 아바타 작업을 별도로 추적합니다. 내레이션 텍스트와 음성 설정을 유지하여 수정 시 의도한 내용을 재현할 수 있습니다.