API de synthèse vocale

API IA pour les développeurs

API de synthèse vocale

Ajoutez la génération vocale IA à votre produit avec l'API de synthèse vocale PoYo. Comparez les modèles TTS, les commandes vocales, les langues, les formats audio, les horodatages et les tarifs des flux de travail de narration.

API de modèles Texte vers parole - Prix et adéquation

Comparez les fournisseurs, les entrées acceptées, les formats de sortie et les tarifs avant de choisir.

Correspondance exacte

Les modèles apparaissent ici uniquement lorsque leurs métadonnées de catalogue incluent Text to Speech.

Comparaison des fournisseurs

Comparez les familles de modèles de plusieurs fournisseurs sans quitter ce répertoire de tâches.

Parcours prêts pour l'API

Chaque carte de modèle mène aux prix PoYo, aux exemples, au playground et aux détails API.

ModèleFournisseurTypes de tâchesPrix
ElevenLabs TTS Turbo v2.5

elevenlabs-tts-turbo-2-5

ElevenLabsText to Speech$0.04/1 000 caractères
ElevenLabs V3 TTS

elevenlabs-v3-tts

ElevenLabsText to Speech$0.08/1 000 caractères
Gemini 3.1 Flash TTS

gemini-3-1-flash-tts

GoogleText to Speech$0.12/1 000 caractères
xAI TTS 1

xai-tts-1

xAIText to Speech$0.012/1 000 caractères

Questions fréquentes

Qu’est-ce que l’API de synthèse vocale ?

+

Une API de synthèse vocale génère de l'audio parlé à partir d'un texte écrit. Il active les fonctionnalités de narration et de voix dans une application sans enregistrer manuellement chaque script. Le modèle sélectionné détermine les voix, langues, commandes vocales et formats de sortie disponibles.

Comment choisir un modèle d'API TTS ?

+

Testez vos scripts réels, y compris les noms, les chiffres et les phrases longues. Comparez la prononciation, le naturel, le contrôle expressif, la cohérence de la voix et le coût. Confirmez la langue et le format audio requis, et vérifiez le flux de demande documenté si le temps de réponse est important pour votre produit.

Puis-je choisir la voix, la vitesse de parole et l'émotion ?

+

Les commandes disponibles varient selon le modèle. Un point de terminaison peut proposer des préréglages vocaux, de la vitesse, de la stabilité, des instructions de style ou des balises audio. Utiliser des champs documentés et des valeurs prises en charge ; on ne devrait pas s'attendre à ce qu'un modèle sans contrôle de vitesse ou d'émotion interprète un paramètre arbitraire.

Quelles langues sont prises en charge par l'API de synthèse vocale ?

+

La couverture linguistique et la qualité de la prononciation dépendent du modèle et de la voix. Vérifiez les options linguistiques documentées ou le comportement de détection, puis testez le texte natif et les passages en langues mixtes. Une étiquette multilingue ne garantit pas une qualité égale pour chaque accent ou nom propre.

Comment puis-je corriger les noms, abréviations ou chiffres mal prononcés ?

+

Réécrivez le passage pour la langue parlée, développez les abréviations ambiguës et testez une phrase courte. Utilisez des contrôles de prononciation ou de normalisation documentés, le cas échéant. Conservez une version texte révisée pour la narration plutôt que de supposer qu'une chaîne d'affichage écrite est toujours la meilleure entrée vocale.

Puis-je générer une narration longue ?

+

Vérifiez la limite de texte du point de terminaison et le comportement de durée pris en charge. Divisez les longs scripts selon les limites naturelles des paragraphes ou des phrases, réutilisez les paramètres vocaux et révisez les transitions après l'assemblage. Conservez les champs de contexte là où le modèle les prend en charge pour faciliter la continuité entre des demandes distinctes.

Une API TTS clone-t-elle automatiquement une voix ?

+

Non. La sélection d'une voix synthétique ou d'un préréglage est différente de la création d'un clone à partir d'un enregistrement. Le clonage vocal nécessite un flux de travail spécifiquement pris en charge et une autorisation appropriée. Vérifiez le point de terminaison disponible avant de concevoir un produit autour d’une identité vocale personnalisée.

Puis-je obtenir des horodatages de mots ou générer un dialogue ?

+

Certains modèles fournissent des horodatages ou des commandes à plusieurs haut-parleurs, tandis que d'autres ne le font pas. Confirmez les champs de sortie et les options de demande sur la page du modèle. Validez l'alignement sur votre propre script avant d'utiliser des horodatages pour les sous-titres ou la mise en surbrillance synchronisée du texte.

Quels formats audio puis-je demander ?

+

Utilisez les formats et les options de qualité documentés pour le modèle TTS choisi. La lecture, la téléphonie et le montage peuvent nécessiter des codecs ou des fréquences d'échantillonnage différents. Inspectez la sortie terminée et convertissez-la lors d’une étape multimédia distincte lorsque votre application a besoin d’un format non pris en charge.

Comment récupérer la parole générée via PoYo ?

+

Utilisez le point de terminaison de génération de modèle sélectionné, enregistrez task_id et récupérez l'audio terminé via des requêtes d'état ou un callback_url pris en charge. Ne déduisez pas un point de terminaison de streaming à partir de l’expression TTS à faible latence ; vérifiez l'interface PoYo exacte documentée pour ce modèle.

Comment est calculé le prix de l'API de synthèse vocale ?

+

La tarification TTS peut utiliser des caractères, des jetons, une génération ou une autre unité spécifique au modèle. Vérifiez comment le niveau choisi compte l'utilisation et comment les paramètres facultatifs l'affectent. Estimez le script complet et les tentatives attendues, plutôt que de comparer les prix bruts avec différentes unités de facturation.

Comment puis-je connecter TTS avec une API d'avatar parlant ?

+

Générez et examinez d'abord le discours, puis confirmez que son format et sa longueur répondent aux exigences du point de terminaison de l'avatar. Fournissez à l'audio un portrait approprié et suivez la tâche de l'avatar séparément. Conservez le texte de la narration et les paramètres vocaux afin que les révisions puissent reproduire la diffusion prévue.