
AI API для разработчиков
API синтеза речи
Добавьте генерацию голоса AI в свой продукт с помощью PoYo API преобразования текста в речь. Сравните модели TTS, голосовое управление, языки, аудиоформаты, временные метки и цены на рабочие процессы повествования.
Подходящие модели
4 моделей

$0.04 /1 000 символов
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1 000 символов
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1 000 символов
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1 000 символов
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
API моделей Текст в речь - цены и подбор модели
Сравните поставщиков, поддерживаемые входные данные, форматы результата и цены перед выбором модели.
Точное совпадение задачи
Здесь отображаются только модели, в метаданных каталога которых есть Text to Speech.
Сравнение провайдеров
Сравнивайте семейства моделей разных провайдеров, не покидая каталог задач.
Готовые API-маршруты
Каждая карточка модели ведет к ценам PoYo, примерам, playground и деталям API.
| Модель | Провайдер | Типы задач | Цена |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1 000 символов |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1 000 символов |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1 000 символов | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1 000 символов |
Частые вопросы
Что такое API синтеза речи?
+
API преобразования текста в речь генерирует устный звук из письменного текста. Он позволяет использовать функции повествования и голоса в приложении без записи каждого сценария вручную. Выбранная модель определяет доступные голоса, языки, элементы управления речью и форматы вывода.
Как выбрать модель TTS API?
+
Проверьте свои настоящие сценарии, включая имена, цифры и длинные предложения. Сравните произношение, естественность, контроль выразительности, последовательность голоса и стоимость. Подтвердите требуемый язык и аудиоформат и проверьте документированный поток запросов, если время ответа важно для вашего продукта.
Могу ли я выбрать голос, скорость речи и эмоции?
+
Доступные элементы управления зависят от модели. Конечная точка может предлагать голосовые настройки, скорость, стабильность, инструкции по стилю или аудиотеги. Используйте документированные поля и поддерживаемые значения; Не следует ожидать, что модель без контроля скорости или эмоций будет интерпретировать произвольный параметр.
Какие языки поддерживает API преобразования текста в речь?
+
Языковой охват и качество произношения зависят от модели и голоса. Проверьте документированные языковые параметры или поведение обнаружения, затем протестируйте собственный текст и фрагменты на разных языках. Многоязычная этикетка не гарантирует одинаковое качество для каждого акцента или имени собственного.
Как исправить неправильное произношение имен, сокращений или цифр?
+
Перепишите отрывок на разговорную речь, раскройте двусмысленные сокращения и проверьте короткое предложение. Используйте документированные средства контроля произношения или нормализации, где это возможно. Сохраняйте проверенную текстовую версию для повествования, а не предполагайте, что письменная отображаемая строка всегда является лучшим речевым вводом.
Могу ли я создать подробное повествование?
+
Проверьте ограничение текста конечной точки и поддерживаемую длительность. Разделяйте длинные сценарии естественными границами абзацев или предложений, повторно используйте голосовые настройки и проверяйте переходы после сборки. Сохраняйте поля контекста, если модель поддерживает их, чтобы обеспечить непрерывность отдельных запросов.
API TTS автоматически клонирует голос?
+
Нет. Выбор синтетического голоса или пресета отличается от создания клона из записи. Для голосового клонирования требуется специально поддерживаемый рабочий процесс и соответствующее разрешение. Проверьте доступную конечную точку, прежде чем разрабатывать продукт на основе индивидуальной голосовой идентификации.
Могу ли я получить временные метки слов или создать диалог?
+
Некоторые модели имеют временные метки или элементы управления несколькими динамиками, а другие — нет. Подтвердите поля вывода и параметры запроса на странице модели. Проверьте выравнивание в своем собственном скрипте, прежде чем использовать временные метки для субтитров или синхронизированную подсветку текста.
Какие аудиоформаты я могу запросить?
+
Используйте форматы и параметры качества, задокументированные для выбранной модели TTS. Для воспроизведения, телефонии и редактирования могут потребоваться разные кодеки или частоты дискретизации. Проверьте готовый результат и преобразуйте его на отдельном этапе мультимедиа, если вашему приложению потребуется неподдерживаемый формат.
Как получить речь, сгенерированную с помощью PoYo?
+
Используйте выбранную конечную точку создания модели, сохраните task_id и получите готовый аудиофайл с помощью запросов состояния или поддерживаемого callback_url. Не делайте вывод о конечной точке потоковой передачи из фразы TTS с низкой задержкой; проверьте точный интерфейс PoYo, документированный для этой модели.
Как рассчитывается цена API преобразования текста в речь?
+
В ценах TTS могут использоваться символы, жетоны, поколение или другие единицы измерения, специфичные для модели. Проверьте, как выбранный уровень учитывает использование и как на него влияют дополнительные настройки. Оценивайте весь сценарий и ожидаемые повторы, а не сравнивайте необработанные цены в разных единицах выставления счетов.
Как подключить TTS к API говорящего аватара?
+
Сначала создайте и просмотрите речь, затем убедитесь, что ее формат и длина соответствуют требованиям конечной точки аватара. Добавьте в аудио подходящий портрет и отслеживайте задачу аватара отдельно. Сохраняйте настройки текста и голоса повествования, чтобы изменения могли воспроизводить предполагаемую доставку.