
KI-APIs für Entwickler
Text-to-Speech-API
Fügen Sie Ihrem Produkt KI-Sprachgenerierung mit der PoYo Text-to-Speech-API hinzu. Vergleichen Sie TTS-Modelle, Sprachsteuerungen, Sprachen, Audioformate, Zeitstempel und Preise für Erzählworkflows.
Passende Modelle
4 Modelle

$0.04 /1.000 Zeichen
elevenlabs-tts-turbo-2-5
Generate low-latency multilingual speech with ElevenLabs TTS Turbo v2.5. Supports voice selection, stability, similarity boost, style, speed, timestamps, language code, context text, and text normalization.

$0.08 /1.000 Zeichen
elevenlabs-v3-tts
Generate expressive text-to-speech audio with ElevenLabs V3 TTS. Supports audio tags, voice selection, stability, language code, text normalization, and optional timestamps for production speech workflows.

$0.12 /1.000 Zeichen
gemini-3-1-flash-tts
Generate expressive multilingual speech with Gemini 3.1 Flash TTS. Supports granular audio tags, natural-language style instructions, Gemini voice presets, two-speaker dialogue, and MP3, WAV, or OGG Opus output.

$0.012 /1.000 Zeichen
xai-tts-1
Generate low-latency expressive multilingual speech with xAI TTS 1. Supports speech tags, five voice presets, automatic language detection, and flexible MP3, WAV, PCM, mu-law, or A-law output.
Text zu Sprache Modell-APIs - Preise und Modell-Eignung
Vergleichen Sie Anbieter, unterstützte Eingaben, Ausgabeformate und Preise vor der Modellwahl.
Exakte Task-Übereinstimmung
Modelle erscheinen hier nur, wenn ihre Katalogmetadaten Text to Speech enthalten.
Provider-Vergleich
Vergleichen Sie Modellfamilien mehrerer Provider, ohne das Task-Verzeichnis zu verlassen.
API-fähige Pfade
Jede Modellkarte führt zu PoYo-Preisen, Beispielen, Playground und API-Details.
| Modell | Provider | Task-Typen | Preis |
|---|---|---|---|
| ElevenLabs TTS Turbo v2.5 elevenlabs-tts-turbo-2-5 | ElevenLabs | Text to Speech | $0.04/1.000 Zeichen |
| ElevenLabs V3 TTS elevenlabs-v3-tts | ElevenLabs | Text to Speech | $0.08/1.000 Zeichen |
| Gemini 3.1 Flash TTS gemini-3-1-flash-tts | Text to Speech | $0.12/1.000 Zeichen | |
| xAI TTS 1 xai-tts-1 | xAI | Text to Speech | $0.012/1.000 Zeichen |
Häufige Fragen
Was ist die Text-to-Speech-API?
+
Eine Text-to-Speech-API generiert gesprochenes Audio aus geschriebenem Text. Es ermöglicht Erzähl- und Sprachfunktionen in einer Anwendung, ohne jedes Skript manuell aufzeichnen zu müssen. Das ausgewählte Modell bestimmt die verfügbaren Stimmen, Sprachen, Sprachsteuerungen und Ausgabeformate.
Wie wähle ich ein TTS-API-Modell aus?
+
Testen Sie Ihre tatsächlichen Skripte, einschließlich Namen, Zahlen und langer Sätze. Vergleichen Sie Aussprache, Natürlichkeit, Ausdruckskontrolle, Stimmkonsistenz und Kosten. Bestätigen Sie die erforderliche Sprache und das Audioformat und überprüfen Sie den dokumentierten Anfrageablauf, wenn die Reaktionszeit für Ihr Produkt wichtig ist.
Kann ich Stimme, Sprechgeschwindigkeit und Emotion wählen?
+
Die verfügbaren Bedienelemente variieren je nach Modell. Ein Endpunkt kann Sprachvoreinstellungen, Geschwindigkeit, Stabilität, Stilanweisungen oder Audio-Tags anbieten. Verwenden Sie dokumentierte Felder und unterstützte Werte; Von einem Modell ohne Geschwindigkeits- oder Emotionskontrolle sollte nicht erwartet werden, dass es einen willkürlichen Parameter interpretiert.
Welche Sprachen unterstützt die Text-to-Speech-API?
+
Sprachabdeckung und Aussprachequalität hängen vom Modell und der Stimme ab. Überprüfen Sie die dokumentierten Sprachoptionen oder das Erkennungsverhalten und testen Sie dann native Texte und gemischtsprachige Passagen. Eine mehrsprachige Kennzeichnung garantiert nicht die gleiche Qualität für jeden Akzent oder Eigennamen.
Wie kann ich falsch ausgesprochene Namen, Abkürzungen oder Zahlen korrigieren?
+
Schreiben Sie die Passage für die gesprochene Sprache um, erweitern Sie mehrdeutige Abkürzungen und testen Sie einen kurzen Satz. Verwenden Sie dokumentierte Aussprache- oder Normalisierungskontrollen, sofern verfügbar. Behalten Sie eine überprüfte Textversion für die Erzählung bei, anstatt davon auszugehen, dass eine geschriebene Anzeigezeichenfolge immer die beste Spracheingabe ist.
Kann ich einen langen Kommentar erstellen?
+
Überprüfen Sie das Textlimit des Endpunkts und das unterstützte Dauerverhalten. Teilen Sie lange Skripte an natürlichen Absatz- oder Satzgrenzen auf, verwenden Sie Spracheinstellungen wieder und überprüfen Sie Übergänge nach dem Zusammenbau. Behalten Sie Kontextfelder dort bei, wo sie vom Modell unterstützt werden, um die Kontinuität über separate Anfragen hinweg zu gewährleisten.
Klont eine TTS-API automatisch eine Stimme?
+
Nein. Die Auswahl einer synthetischen Stimme oder Voreinstellung unterscheidet sich vom Erstellen eines Klons aus einer Aufnahme. Das Klonen von Stimmen erfordert einen speziell unterstützten Workflow und die entsprechende Berechtigung. Überprüfen Sie den verfügbaren Endpunkt, bevor Sie ein Produkt rund um eine benutzerdefinierte Sprachidentität entwerfen.
Kann ich Wortzeitstempel erhalten oder Dialoge generieren?
+
Einige Modelle bieten Zeitstempel oder die Steuerung mehrerer Lautsprecher, andere nicht. Bestätigen Sie die Ausgabefelder und Anfrageoptionen auf der Modellseite. Überprüfen Sie die Ausrichtung Ihres eigenen Skripts, bevor Sie Zeitstempel für Untertitel oder synchronisierte Texthervorhebungen verwenden.
Welche Audioformate kann ich anfordern?
+
Verwenden Sie die für das ausgewählte TTS-Modell dokumentierten Formate und Qualitätsoptionen. Für Wiedergabe, Telefonie und Bearbeitung können unterschiedliche Codecs oder Sampleraten erforderlich sein. Überprüfen Sie die fertige Ausgabe und konvertieren Sie sie in einem separaten Medienschritt, wenn Ihre Anwendung ein nicht unterstütztes Format benötigt.
Wie rufe ich über PoYo generierte Sprache ab?
+
Verwenden Sie den ausgewählten Modellgenerierungsendpunkt, speichern Sie task_id und rufen Sie das fertige Audio über Statusabfragen oder einen unterstützten callback_url ab. Leiten Sie aus der Formulierung „TTS mit geringer Latenz“ keinen Streaming-Endpunkt ab. Überprüfen Sie die genaue PoYo-Schnittstelle, die für dieses Modell dokumentiert ist.
Wie werden die Preise für die Text-to-Speech-API berechnet?
+
Die TTS-Preisgestaltung kann Zeichen, Token, Generation oder eine andere modellspezifische Einheit verwenden. Überprüfen Sie, wie die gewählte Stufe die Nutzung zählt und wie sich optionale Einstellungen darauf auswirken. Schätzen Sie das vollständige Skript und die erwarteten Wiederholungsversuche, anstatt die Rohpreise mit verschiedenen Abrechnungseinheiten zu vergleichen.
Wie kann ich TTS mit einer sprechenden Avatar-API verbinden?
+
Generieren und überprüfen Sie zunächst die Rede und bestätigen Sie dann, dass Format und Länge den Anforderungen des Avatar-Endpunkts entsprechen. Versorgen Sie den Ton mit einem passenden Porträt und verfolgen Sie die Avatar-Aufgabe separat. Behalten Sie die Text- und Spracheinstellungen des Erzähltexts bei, damit Überarbeitungen die beabsichtigte Wiedergabe wiedergeben können.