API chuyển văn bản thành giọng nói

API AI dành cho nhà phát triển

API chuyển văn bản thành giọng nói

Thêm tính năng tạo giọng nói AI vào sản phẩm của bạn bằng API chuyển văn bản thành giọng nói PoYo. So sánh các mô hình TTS, điều khiển bằng giọng nói, ngôn ngữ, định dạng âm thanh, dấu thời gian và mức giá cho quy trình tường thuật.

Bài viết cho bài phát biểu Model API - Giá cả và mô hình phù hợp

So sánh nhà cung cấp, đầu vào hỗ trợ, định dạng đầu ra và giá trước khi chọn mô hình.

Đúng phù hợp với nhiệm vụ

Các mô hình chỉ xuất hiện ở đây khi các metadata danh mục của họ bao gồm Text to Speech.

So sánh nhà cung cấp

Xem xét các gia đình mô hình trên các nhà cung cấp mà không rời khỏi thư mục nhiệm vụ.

Các đường dẫn sẵn sàng cho API

Mỗi thẻ mô hình liên kết đến giá PoYo, ví dụ, điều khiển sân chơi và chi tiết API.

Mô hìnhNhà cung cấpCác loại nhiệm vụGiá
ElevenLabs TTS Turbo v2.5

elevenlabs-tts-turbo-2-5

ElevenLabsText to Speech$0.04/1.000 ký tự
ElevenLabs V3 TTS

elevenlabs-v3-tts

ElevenLabsText to Speech$0.08/1.000 ký tự
Gemini 3.1 Flash TTS

gemini-3-1-flash-tts

GoogleText to Speech$0.12/1.000 ký tự
xAI TTS 1

xai-tts-1

xAIText to Speech$0.012/1.000 ký tự

Những câu hỏi thường được hỏi

API chuyển văn bản thành giọng nói là gì?

+

API chuyển văn bản thành giọng nói tạo âm thanh giọng nói từ văn bản viết. Nó cho phép các tính năng tường thuật và giọng nói trong một ứng dụng mà không cần ghi lại mọi tập lệnh theo cách thủ công. Mẫu đã chọn sẽ xác định giọng nói, ngôn ngữ, điều khiển giọng nói và định dạng đầu ra có sẵn.

Làm cách nào để chọn mô hình API TTS?

+

Kiểm tra tập lệnh thực tế của bạn, bao gồm tên, số và câu dài. So sánh cách phát âm, độ tự nhiên, khả năng kiểm soát biểu cảm, tính nhất quán của giọng nói và chi phí. Xác nhận ngôn ngữ và định dạng âm thanh được yêu cầu, đồng thời kiểm tra luồng yêu cầu được ghi lại nếu thời gian phản hồi là quan trọng đối với sản phẩm của bạn.

Tôi có thể chọn giọng nói, tốc độ nói và cảm xúc được không?

+

Các điều khiển khả dụng khác nhau tùy theo mẫu máy. Điểm cuối có thể cung cấp cài đặt trước bằng giọng nói, tốc độ, độ ổn định, hướng dẫn về kiểu hoặc thẻ âm thanh. Sử dụng các trường được ghi lại và các giá trị được hỗ trợ; một mô hình không có khả năng kiểm soát tốc độ hoặc cảm xúc sẽ không thể diễn giải một tham số tùy ý.

API chuyển văn bản thành giọng nói hỗ trợ những ngôn ngữ nào?

+

Độ bao phủ ngôn ngữ và chất lượng phát âm phụ thuộc vào kiểu máy và giọng nói. Kiểm tra các tùy chọn ngôn ngữ được ghi lại hoặc hành vi phát hiện, sau đó kiểm tra văn bản gốc và các đoạn ngôn ngữ hỗn hợp. Nhãn đa ngôn ngữ không đảm bảo chất lượng như nhau cho mọi giọng hoặc tên riêng.

Làm cách nào để sửa lỗi phát âm sai tên, chữ viết tắt hoặc số?

+

Viết lại đoạn văn nói, mở rộng các từ viết tắt mơ hồ và kiểm tra một câu ngắn. Sử dụng các biện pháp kiểm soát cách phát âm hoặc chuẩn hóa được ghi lại nếu có. Giữ một phiên bản văn bản đã được đánh giá để tường thuật thay vì cho rằng chuỗi hiển thị bằng văn bản luôn là đầu vào giọng nói tốt nhất.

Tôi có thể tạo bản tường thuật dài không?

+

Kiểm tra giới hạn văn bản điểm cuối và hành vi thời lượng được hỗ trợ. Chia các tập lệnh dài ở ranh giới đoạn văn hoặc câu tự nhiên, sử dụng lại cài đặt giọng nói và xem lại các chuyển tiếp sau khi lắp ráp. Giữ nguyên các trường ngữ cảnh mà mô hình hỗ trợ chúng để giúp duy trì tính liên tục giữa các yêu cầu riêng biệt.

API TTS có tự động sao chép giọng nói không?

+

Không. Việc chọn giọng nói tổng hợp hoặc cài đặt trước khác với việc tạo bản sao từ bản ghi âm. Nhân bản giọng nói yêu cầu quy trình làm việc được hỗ trợ cụ thể và sự cho phép phù hợp. Kiểm tra điểm cuối có sẵn trước khi thiết kế sản phẩm dựa trên nhận dạng giọng nói tùy chỉnh.

Tôi có thể lấy dấu thời gian của từ hoặc tạo hội thoại không?

+

Một số kiểu máy cung cấp dấu thời gian hoặc điều khiển nhiều loa, trong khi một số kiểu khác thì không. Xác nhận các trường đầu ra và các tùy chọn yêu cầu trên trang mô hình. Xác thực căn chỉnh trên tập lệnh của riêng bạn trước khi sử dụng dấu thời gian cho phụ đề hoặc đánh dấu văn bản được đồng bộ hóa.

Tôi có thể yêu cầu những định dạng âm thanh nào?

+

Sử dụng các định dạng và tùy chọn chất lượng được ghi lại cho mô hình TTS đã chọn. Phát lại, điện thoại và chỉnh sửa có thể yêu cầu các codec hoặc tốc độ mẫu khác nhau. Kiểm tra đầu ra đã hoàn thành và chuyển đổi nó trong một bước phương tiện riêng biệt khi ứng dụng của bạn cần định dạng không được hỗ trợ.

Làm cách nào để truy xuất giọng nói được tạo thông qua PoYo?

+

Sử dụng điểm cuối tạo mô hình đã chọn, lưu task_id và truy xuất âm thanh đã hoàn thành thông qua truy vấn trạng thái hoặc callback_url được hỗ trợ. Không suy ra điểm cuối phát trực tuyến từ cụm từ TTS có độ trễ thấp; kiểm tra giao diện PoYo chính xác được ghi lại cho kiểu máy đó.

Giá API chuyển văn bản thành giọng nói được tính như thế nào?

+

Giá TTS có thể sử dụng ký tự, mã thông báo, thế hệ hoặc đơn vị dành riêng cho mô hình khác. Kiểm tra xem cấp độ đã chọn tính mức sử dụng như thế nào và các cài đặt tùy chọn ảnh hưởng đến cấp độ đó như thế nào. Ước tính tập lệnh hoàn chỉnh và số lần thử dự kiến thay vì so sánh giá thô với các đơn vị thanh toán khác nhau.

Làm cách nào tôi có thể kết nối TTS với API hình đại diện biết nói?

+

Trước tiên hãy tạo và xem lại bài phát biểu, sau đó xác nhận rằng định dạng và độ dài của bài phát biểu đó đáp ứng các yêu cầu về điểm cuối của hình đại diện. Cung cấp âm thanh với chân dung phù hợp và theo dõi tác vụ hình đại diện riêng biệt. Giữ nguyên cài đặt văn bản tường thuật và giọng nói để các bản sửa đổi có thể tái tạo lại nội dung dự kiến.