
API IA pour les développeurs
API de synthèse vocale
Ajoutez la génération vocale IA à votre produit avec l'API de synthèse vocale PoYo. Comparez les modèles TTS, les commandes vocales, les langues, les formats audio, les horodatages et les tarifs des flux de travail de narration.
Modèles compatibles
4 modèles

$0.04 /1 000 caractères
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1 000 caractères
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1 000 caractères
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1 000 caractères
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
API de modèles Texte vers parole - Prix et adéquation
Comparez les fournisseurs, les entrées acceptées, les formats de sortie et les tarifs avant de choisir.
Correspondance exacte
Les modèles apparaissent ici uniquement lorsque leurs métadonnées de catalogue incluent Text to Speech.
Comparaison des fournisseurs
Comparez les familles de modèles de plusieurs fournisseurs sans quitter ce répertoire de tâches.
Parcours prêts pour l'API
Chaque carte de modèle mène aux prix PoYo, aux exemples, au playground et aux détails API.
| Modèle | Fournisseur | Types de tâches | Prix |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1 000 caractères |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1 000 caractères |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1 000 caractères | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1 000 caractères |
Questions fréquentes
Qu’est-ce que l’API de synthèse vocale ?
+
Une API de synthèse vocale génère de l'audio parlé à partir d'un texte écrit. Il active les fonctionnalités de narration et de voix dans une application sans enregistrer manuellement chaque script. Le modèle sélectionné détermine les voix, langues, commandes vocales et formats de sortie disponibles.
Comment choisir un modèle d'API TTS ?
+
Testez vos scripts réels, y compris les noms, les chiffres et les phrases longues. Comparez la prononciation, le naturel, le contrôle expressif, la cohérence de la voix et le coût. Confirmez la langue et le format audio requis, et vérifiez le flux de demande documenté si le temps de réponse est important pour votre produit.
Puis-je choisir la voix, la vitesse de parole et l'émotion ?
+
Les commandes disponibles varient selon le modèle. Un point de terminaison peut proposer des préréglages vocaux, de la vitesse, de la stabilité, des instructions de style ou des balises audio. Utiliser des champs documentés et des valeurs prises en charge ; on ne devrait pas s'attendre à ce qu'un modèle sans contrôle de vitesse ou d'émotion interprète un paramètre arbitraire.
Quelles langues sont prises en charge par l'API de synthèse vocale ?
+
La couverture linguistique et la qualité de la prononciation dépendent du modèle et de la voix. Vérifiez les options linguistiques documentées ou le comportement de détection, puis testez le texte natif et les passages en langues mixtes. Une étiquette multilingue ne garantit pas une qualité égale pour chaque accent ou nom propre.
Comment puis-je corriger les noms, abréviations ou chiffres mal prononcés ?
+
Réécrivez le passage pour la langue parlée, développez les abréviations ambiguës et testez une phrase courte. Utilisez des contrôles de prononciation ou de normalisation documentés, le cas échéant. Conservez une version texte révisée pour la narration plutôt que de supposer qu'une chaîne d'affichage écrite est toujours la meilleure entrée vocale.
Puis-je générer une narration longue ?
+
Vérifiez la limite de texte du point de terminaison et le comportement de durée pris en charge. Divisez les longs scripts selon les limites naturelles des paragraphes ou des phrases, réutilisez les paramètres vocaux et révisez les transitions après l'assemblage. Conservez les champs de contexte là où le modèle les prend en charge pour faciliter la continuité entre des demandes distinctes.
Une API TTS clone-t-elle automatiquement une voix ?
+
Non. La sélection d'une voix synthétique ou d'un préréglage est différente de la création d'un clone à partir d'un enregistrement. Le clonage vocal nécessite un flux de travail spécifiquement pris en charge et une autorisation appropriée. Vérifiez le point de terminaison disponible avant de concevoir un produit autour d’une identité vocale personnalisée.
Puis-je obtenir des horodatages de mots ou générer un dialogue ?
+
Certains modèles fournissent des horodatages ou des commandes à plusieurs haut-parleurs, tandis que d'autres ne le font pas. Confirmez les champs de sortie et les options de demande sur la page du modèle. Validez l'alignement sur votre propre script avant d'utiliser des horodatages pour les sous-titres ou la mise en surbrillance synchronisée du texte.
Quels formats audio puis-je demander ?
+
Utilisez les formats et les options de qualité documentés pour le modèle TTS choisi. La lecture, la téléphonie et le montage peuvent nécessiter des codecs ou des fréquences d'échantillonnage différents. Inspectez la sortie terminée et convertissez-la lors d’une étape multimédia distincte lorsque votre application a besoin d’un format non pris en charge.
Comment récupérer la parole générée via PoYo ?
+
Utilisez le point de terminaison de génération de modèle sélectionné, enregistrez task_id et récupérez l'audio terminé via des requêtes d'état ou un callback_url pris en charge. Ne déduisez pas un point de terminaison de streaming à partir de l’expression TTS à faible latence ; vérifiez l'interface PoYo exacte documentée pour ce modèle.
Comment est calculé le prix de l'API de synthèse vocale ?
+
La tarification TTS peut utiliser des caractères, des jetons, une génération ou une autre unité spécifique au modèle. Vérifiez comment le niveau choisi compte l'utilisation et comment les paramètres facultatifs l'affectent. Estimez le script complet et les tentatives attendues, plutôt que de comparer les prix bruts avec différentes unités de facturation.
Comment puis-je connecter TTS avec une API d'avatar parlant ?
+
Générez et examinez d'abord le discours, puis confirmez que son format et sa longueur répondent aux exigences du point de terminaison de l'avatar. Fournissez à l'audio un portrait approprié et suivez la tâche de l'avatar séparément. Conservez le texte de la narration et les paramètres vocaux afin que les révisions puissent reproduire la diffusion prévue.