
API IA per sviluppatori
API di sintesi vocale
Aggiungi la generazione vocale IA al tuo prodotto con l'API di sintesi vocale PoYo. Confronta modelli TTS, controlli vocali, lingue, formati audio, timestamp e prezzi per i flussi di lavoro di narrazione.
Modelli corrispondenti
4 modelli

$0.04 /1.000 caratteri
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1.000 caratteri
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1.000 caratteri
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1.000 caratteri
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
Sintesi vocale da testo API del modello: prezzi e adattamento del modello
Confronta fornitori, input supportati, formati di output e prezzi prima di scegliere un modello.
Corrispondenza esatta dell'attività
I modelli vengono visualizzati qui solo quando i metadati del loro catalogo includono Text to Speech.
Confronto tra provider
Esamina le famiglie di modelli tra i provider senza uscire dalla directory delle attività.
Percorsi pronti per l'API
Ogni scheda modello si collega ai prezzi PoYo, agli esempi, ai controlli del parco giochi e ai dettagli API.
| Model | Provider | Tipi di attività | Prezzo |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1.000 caratteri |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1.000 caratteri |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1.000 caratteri | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1.000 caratteri |
Domande frequenti
Che cos’è un’API di sintesi vocale?
+
Un'API di sintesi vocale genera audio parlato da testo scritto. Abilita le funzionalità di narrazione e voce in un'applicazione senza registrare manualmente ogni script. Il modello selezionato determina le voci, le lingue, i controlli vocali e i formati di output disponibili.
Come scelgo un modello API TTS?
+
Metti alla prova i tuoi script reali, inclusi nomi, numeri e frasi lunghe. Confronta pronuncia, naturalezza, controllo espressivo, coerenza vocale e costo. Conferma la lingua e il formato audio richiesti e controlla il flusso di richiesta documentato se il tempo di risposta è importante per il tuo prodotto.
Posso scegliere la voce, la velocità del discorso e l'emozione?
+
I controlli disponibili variano in base al modello. Un endpoint può offrire preimpostazioni vocali, velocità, stabilità, istruzioni di stile o tag audio. Utilizzare campi documentati e valori supportati; Non ci si dovrebbe aspettare che un modello senza controllo della velocità o delle emozioni interpreti un parametro arbitrario.
Quali lingue supporta l'API di sintesi vocale?
+
La copertura linguistica e la qualità della pronuncia dipendono dal modello e dalla voce. Controlla le opzioni della lingua documentate o il comportamento di rilevamento, quindi testa il testo nativo e i passaggi in lingue miste. Un'etichetta multilingue non garantisce la stessa qualità per ogni accento o nome proprio.
Come posso correggere nomi, abbreviazioni o numeri pronunciati male?
+
Riscrivi il passaggio per la lingua parlata, amplia le abbreviazioni ambigue e prova una frase breve. Utilizzare la pronuncia documentata o i controlli di normalizzazione, ove disponibili. Mantenere una versione testuale rivista per la narrazione anziché dare per scontato che una stringa di visualizzazione scritta sia sempre il miglior input vocale.
Posso generare una narrazione di lunga durata?
+
Controllare il limite del testo dell'endpoint e il comportamento di durata supportato. Dividi i copioni lunghi ai limiti naturali di paragrafi o frasi, riutilizza le impostazioni vocali e rivedi le transizioni dopo l'assemblaggio. Conserva i campi di contesto in cui il modello li supporta per favorire la continuità tra richieste separate.
Un'API TTS clona automaticamente una voce?
+
No. Selezionare una voce sintetica o un preset è diverso dalla creazione di un clone da una registrazione. La clonazione vocale richiede un flusso di lavoro specificamente supportato e l'autorizzazione appropriata. Controlla l'endpoint disponibile prima di progettare un prodotto basato su un'identità vocale personalizzata.
Posso ottenere timestamp delle parole o generare dialoghi?
+
Alcuni modelli forniscono timestamp o controlli per più altoparlanti, mentre altri no. Conferma i campi di output e richiedi le opzioni nella pagina del modello. Convalida l'allineamento sul tuo script prima di utilizzare i timestamp per i sottotitoli o l'evidenziazione del testo sincronizzato.
Quali formati audio posso richiedere?
+
Utilizzare i formati e le opzioni di qualità documentati per il modello TTS scelto. La riproduzione, la telefonia e l'editing possono richiedere codec o frequenze di campionamento diversi. Esamina l'output completato e convertilo in un passaggio multimediale separato quando la tua applicazione necessita di un formato non supportato.
Come posso recuperare il parlato generato tramite PoYo?
+
Utilizza l'endpoint di generazione del modello selezionato, salva task_id e recupera l'audio completato tramite query di stato o un callback_url supportato. Non dedurre un endpoint di streaming dalla frase TTS a bassa latenza; controllare l'esatta interfaccia PoYo documentata per quel modello.
Come viene calcolato il prezzo dell'API text-to-speech?
+
I prezzi TTS possono utilizzare caratteri, token, generazione o un'altra unità specifica del modello. Controlla in che modo il livello scelto conta l'utilizzo e in che modo le impostazioni opzionali lo influenzano. Stimare lo script completo e i tentativi previsti, anziché confrontare i prezzi grezzi con diverse unità di fatturazione.
Come posso connettere TTS con un'API avatar parlante?
+
Prima genera e rivedi il discorso, quindi conferma che il formato e la lunghezza soddisfino i requisiti dell'endpoint avatar. Fornisci all'audio un ritratto adatto e monitora separatamente l'attività dell'avatar. Mantieni le impostazioni del testo della narrazione e della voce in modo che le revisioni possano riprodurre la consegna prevista.