API синтеза речи

AI API для разработчиков

API синтеза речи

Добавьте генерацию голоса AI в свой продукт с помощью PoYo API преобразования текста в речь. Сравните модели TTS, голосовое управление, языки, аудиоформаты, временные метки и цены на рабочие процессы повествования.

API моделей Текст в речь - цены и подбор модели

Сравните поставщиков, поддерживаемые входные данные, форматы результата и цены перед выбором модели.

Точное совпадение задачи

Здесь отображаются только модели, в метаданных каталога которых есть Text to Speech.

Сравнение провайдеров

Сравнивайте семейства моделей разных провайдеров, не покидая каталог задач.

Готовые API-маршруты

Каждая карточка модели ведет к ценам PoYo, примерам, playground и деталям API.

МодельПровайдерТипы задачЦена
ElevenLabs TTS Turbo v2.5

elevenlabs-tts-turbo-2-5

ElevenLabsText to Speech$0.04/1 000 символов
ElevenLabs V3 TTS

elevenlabs-v3-tts

ElevenLabsText to Speech$0.08/1 000 символов
Gemini 3.1 Flash TTS

gemini-3-1-flash-tts

GoogleText to Speech$0.12/1 000 символов
xAI TTS 1

xai-tts-1

xAIText to Speech$0.012/1 000 символов

Частые вопросы

Что такое API синтеза речи?

+

API преобразования текста в речь генерирует устный звук из письменного текста. Он позволяет использовать функции повествования и голоса в приложении без записи каждого сценария вручную. Выбранная модель определяет доступные голоса, языки, элементы управления речью и форматы вывода.

Как выбрать модель TTS API?

+

Проверьте свои настоящие сценарии, включая имена, цифры и длинные предложения. Сравните произношение, естественность, контроль выразительности, последовательность голоса и стоимость. Подтвердите требуемый язык и аудиоформат и проверьте документированный поток запросов, если время ответа важно для вашего продукта.

Могу ли я выбрать голос, скорость речи и эмоции?

+

Доступные элементы управления зависят от модели. Конечная точка может предлагать голосовые настройки, скорость, стабильность, инструкции по стилю или аудиотеги. Используйте документированные поля и поддерживаемые значения; Не следует ожидать, что модель без контроля скорости или эмоций будет интерпретировать произвольный параметр.

Какие языки поддерживает API преобразования текста в речь?

+

Языковой охват и качество произношения зависят от модели и голоса. Проверьте документированные языковые параметры или поведение обнаружения, затем протестируйте собственный текст и фрагменты на разных языках. Многоязычная этикетка не гарантирует одинаковое качество для каждого акцента или имени собственного.

Как исправить неправильное произношение имен, сокращений или цифр?

+

Перепишите отрывок на разговорную речь, раскройте двусмысленные сокращения и проверьте короткое предложение. Используйте документированные средства контроля произношения или нормализации, где это возможно. Сохраняйте проверенную текстовую версию для повествования, а не предполагайте, что письменная отображаемая строка всегда является лучшим речевым вводом.

Могу ли я создать подробное повествование?

+

Проверьте ограничение текста конечной точки и поддерживаемую длительность. Разделяйте длинные сценарии естественными границами абзацев или предложений, повторно используйте голосовые настройки и проверяйте переходы после сборки. Сохраняйте поля контекста, если модель поддерживает их, чтобы обеспечить непрерывность отдельных запросов.

API TTS автоматически клонирует голос?

+

Нет. Выбор синтетического голоса или пресета отличается от создания клона из записи. Для голосового клонирования требуется специально поддерживаемый рабочий процесс и соответствующее разрешение. Проверьте доступную конечную точку, прежде чем разрабатывать продукт на основе индивидуальной голосовой идентификации.

Могу ли я получить временные метки слов или создать диалог?

+

Некоторые модели имеют временные метки или элементы управления несколькими динамиками, а другие — нет. Подтвердите поля вывода и параметры запроса на странице модели. Проверьте выравнивание в своем собственном скрипте, прежде чем использовать временные метки для субтитров или синхронизированную подсветку текста.

Какие аудиоформаты я могу запросить?

+

Используйте форматы и параметры качества, задокументированные для выбранной модели TTS. Для воспроизведения, телефонии и редактирования могут потребоваться разные кодеки или частоты дискретизации. Проверьте готовый результат и преобразуйте его на отдельном этапе мультимедиа, если вашему приложению потребуется неподдерживаемый формат.

Как получить речь, сгенерированную с помощью PoYo?

+

Используйте выбранную конечную точку создания модели, сохраните task_id и получите готовый аудиофайл с помощью запросов состояния или поддерживаемого callback_url. Не делайте вывод о конечной точке потоковой передачи из фразы TTS с низкой задержкой; проверьте точный интерфейс PoYo, документированный для этой модели.

Как рассчитывается цена API преобразования текста в речь?

+

В ценах TTS могут использоваться символы, жетоны, поколение или другие единицы измерения, специфичные для модели. Проверьте, как выбранный уровень учитывает использование и как на него влияют дополнительные настройки. Оценивайте весь сценарий и ожидаемые повторы, а не сравнивайте необработанные цены в разных единицах выставления счетов.

Как подключить TTS к API говорящего аватара?

+

Сначала создайте и просмотрите речь, затем убедитесь, что ее формат и длина соответствуют требованиям конечной точки аватара. Добавьте в аудио подходящий портрет и отслеживайте задачу аватара отдельно. Сохраняйте настройки текста и голоса повествования, чтобы изменения могли воспроизводить предполагаемую доставку.