GPT Image 2.5 API đã ra mắt. Tạo và chỉnh sửa hình ảnh ngay →
GPT Image 2.5 API đã ra mắt. Tạo và chỉnh sửa hình ảnh ngay →
PoYoPoYo
Thị trường
Bảng giá
Doanh nghiệp
Ctrl+K
poyo.ai

Một API. Tất cả các mô hình.

Được xây dựng cho các nhà phát triển

All systems operational

Tài nguyên

  • Trạm thay thế
  • Hub so sánh
  • Blog
  • Nhà cung cấp
  • Chương trình liên kết
  • Tính năng
  • Bản đồ địa điểm

© 2025 PoYo API Tất cả quyền được bảo lưu.

Những mô hình xe phổ biếnhot

  • Seedance 2.5
  • MiniMax H3 / Hailuo 03
  • FLUX 3
  • Nano Banana Pro
  • Seedance 2
  • GPT Image 2

Các bản phát hành mớinew

  • Nano Banana 2.1
  • Seedream 5.0 Flash
  • GPT-6.1 Sol
  • Claude Sonnet 5.5
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo

Lần tớisoon

  • Kling 4.0
  • Kling 4.0 Flash
  • Wan Animate 2

Tất cả các nhà cung cấp

Google

  • Nano Banana Pro
  • Gemini Omni 1.1 Flash
  • Gemini 3.7 Flash
  • Gemini 3.8 Flash
  • Gemini 3.1 Flash TTS
  • Nano Banana 2.1
  • Nano Banana
  • Veo 3.1
  • Veo 3.1 Official
  • Omni Flash
  • Nano Banana 2
  • Gemini 3.5 Flash
  • Nano Banana 2 Lite
  • Gemini 3 Series

Kling

  • Kling 3.0 Motion Control
  • Kling 3.0
  • Kling O3
  • Kling 4.0
  • Kling 4.0 Flash
  • Kling 1.6
  • Kling 2.1
  • Kling 2.6
  • Kling Avatar 2.0
  • Kling 2.5 Turbo Pro
  • Kling 3.0 Turbo
  • Kling 2.6 Motion Control
  • Kling O3 Image
  • Kling O1 Image

Anthropic

  • Claude Sonnet 5
  • Claude Fable 5.1
  • Claude Opus 5
  • Claude Opus 5.5
  • Claude Sonnet 5.5
  • Claude Opus 4.8
  • Claude Opus 4.7
  • Claude 4.6 API
  • Claude 4.5 Series

MiniMax

  • MiniMax H3 / Hailuo 03
  • MiniMax H3 Max
  • MiniMax H3 Max Turbo
  • MiniMax Music 2.6
  • Hailuo 02
  • Hailuo 2.3

Tripo3D

  • Tripo3D H3.1
  • Tripo3D P1

Moonshot AI

  • Kimi K3

OpenAI

  • GPT Image 2
  • Sora 2 Official
  • GPT-6 Astra
  • GPT-6 Sol
  • GPT Image 2.5
  • GPT-5.6
  • GPT-6 Luna
  • GPT-6.1 Sol
  • GPT Image 1.5
  • GPT-4o Image
  • GPT-5.5
  • GPT-5.4
  • GPT-5.2

Seedream

  • Seedream 5.0 Pro
  • Seedream 5.0 Flash
  • Seedream 4
  • Seedream 4.5
  • Seedream 5.0 Lite

Seedance

  • Seedance 2.5
  • Seedance 2
  • Seedance 2.0 Mini
  • Seedance 1.0 Pro
  • Seedance 1.5 Pro

DeepSeek

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • DeepSeek V4.1 Flash

Hunyuan

  • Hunyuan 3D v3.1

ElevenLabs

  • ElevenLabs Music
  • ElevenLabs TTS Turbo v2.5
  • ElevenLabs V3 TTS

Black Forest Labs

  • FLUX 3
  • FLUX.2
  • Flux Kontext
  • Flux Dev
  • Flux Schnell

Alibaba

  • Qwen Image 3.0
  • Happy Horse 1.1
  • Wan 2.7 Video
  • Wan 3.0
  • Wan 3.0 Video Prime
  • Qwen Image 2.1
  • Wan Animate 2
  • Wan 2.2 Fast
  • Z-Image
  • Wan 2.5
  • Wan 2.6
  • Wan 2.7 Image
  • Wan Animate
  • Happy Horse

xAI

  • Grok 4.6
  • Grok 4.7
  • Grok Imagine Image 2.0
  • xAI TTS 1
  • Grok Imagine
  • Grok Imagine Video 1.5
  • Grok Imagine Image Quality

Meshy

  • Meshy 6 3D

Runway

  • Runway Gen-4.5

PoYo

  • AI Video Background Removal
  • AI Video Upscaler
  • Image Translator
  • Video Translator
  • Suno Music
GitHubXInstagramYouTubeDiscordTelegramEmail
Hỗ trợ khách hàngTài liệu
Hình ảnhVideo3DÂm thanhAvatarCông cụ
Loading playground...
Hướng dẫn máy phát âm

Hướng dẫn đầy đủ về việc sử dụng Một máy phát âm hoàn chỉnh cho bài phát biểu và âm nhạc

Một máy phát âm hoàn chỉnh cho bài phát biểu và âm nhạc

PoYo Audio Generator mang lại các mô hình phát âm, giọng nói và âm nhạc hàng đầu vào một không gian làm việc tập trung. Thay vì chuyển đổi giữa các công cụ của nhà cung cấp riêng biệt, bạn có thể chọn ElevenLabs, Gemini, xAI, MiniMax, và các mô hình âm thanh thực thi khác trực tiếp bên trong bảng sao.

Mỗi mô hình giữ được điều khiển bản địa của nó, vì vậy ngôn ngữ, giọng nói, thẻ cảm xúc, tốc độ, lời bài hát, chế độ nhạc cụ, định dạng đầu ra, xem trước, JSON phản ứng, và các dòng công việc tải xuống chỉ xuất hiện khi mô hình được chọn hỗ trợ chúng.

Bắt đầu tạo ra

Các tính năng chính của máy phát âm PoYo

Tạo giọng nói, giọng nói và âm nhạc, sau đó xem trước, tải xuống và di chuyển các dòng công việc ổn định vào đường ống API của bạn.

01

Các ngôn ngữ đa ngôn ngữ biểu cảm văn bản nói

Turn kịch bản, bản sao sản phẩm, câu chuyện và đối thoại thành âm thanh tự nhiên. Các mô hình được hỗ trợ cho thấy sự lựa chọn giọng nói, kiểm soát ngôn ngữ, thẻ cảm xúc, bình thường hóa văn bản, tốc độ và dấu thời gian khi có sẵn.

  • Tạo lồng tiếng từ prompt văn bản và kịch bản
  • Sử dụng ngôn ngữ, giọng nói và điều khiển giao hàng khi hỗ trợ
  • Tạo bài phát biểu cho các ứng dụng, video, khóa học và đại lý
Phương trình làm việc văn bản-tiếng nói đa ngôn ngữ

02

Tạo nhạc và sáng tạo bài hát

Tạo âm nhạc từ các prompt, lời bài hát, cài đặt nhạc cụ và ý tưởng sáng tạo có cấu trúc. Sử dụng các mô hình văn bản sang âm nhạc cho các demo, móc, các bản nhạc hậu thuẫn và hướng sáng tạo trước khi chuyển sang sản xuất.

  • Tạo ra các bài hát, nhạc cụ và khái niệm âm nhạc
  • Kiểm soát tâm trạng, thể loại, sắp xếp, lời bài hát và giọng hát
  • Sử dụng các trường cấu trúc cụ thể cho mô hình khi có sẵn
Giai đoạn công việc tạo nhạc nhanh

03

Kiểm soát chất lượng, độ trễ và định dạng cụ thể cho mô hình

Switch giữa các gia đình mô hình âm thanh mà không mất kiểm soát bản địa của họ. TTS nhanh, mô hình giọng nói biểu cảm, máy phát âm, tỷ lệ mô hình, tỷ lệ bit, định dạng đầu ra và các tùy chọn chất lượng vẫn gắn liền với mô hình hoạt động.

  • So sánh các nhà cung cấp âm thanh từ một bộ chọn
  • Chỉ hiển thị các tham số được hỗ trợ bởi mô hình hoạt động
  • Chọn MP3, WAV, OGG, PCM hoặc định dạng cụ thể cho nhà cung cấp
Các tùy chọn định dạng và điều khiển mô hình âm thanh

04

Xem trước, tải xuống và chuyển giao API

L để nghe âm thanh được tạo trực tiếp trong trình duyệt, kiểm tra cấu trúc JSON và dấu thời gian khi trả về, tải xuống tệp cuối cùng và di chuyển các cài đặt xác nhận vào API hoặc luồng công việc của đại lý.

  • Xem thử đầu ra âm thanh trước khi tải về
  • Tải về các tệp sản xuất để chỉnh sửa và xuất bản
  • Xác nhận các yêu cầu và tham số trước khi thực hiện API Hệ thống tích hợp
Xem trước âm thanh và dòng công việc chuyển giao API

Bạn có thể tạo ra gì với máy phát âm PoYo?

01

Video voiceover và dubbing

Tạo câu chuyện, sản phẩm đi qua âm thanh, bản thảo dubbing đa ngôn ngữ, và các đoạn video âm thanh xã hội từ kịch bản.

02

Các podcast, sách nghe và kể chuyện

Tạo các bài học nói, bản xem trước chương, các phân đoạn podcast và các bài kiểm tra kể chuyện dài trước khi ghi lại hoặc làm chủ.

03

Các ứng dụng đa ngôn ngữ và khả năng tiếp cận

Các giọng nói ứng dụng nguyên mẫu, âm thanh kiểu đọc màn hình, kể chuyện trực tuyến và trải nghiệm nói chuyện địa phương.

04

Những bản demo âm nhạc, bài hát và các bài hát nhạc cụ

Tạo ý tưởng bài hát, giường nhạc cụ, móng, demo và các bài hát hậu thuẫn từ prompt, lời bài hát và hướng đi phong cách.

05

Khái niệm âm thanh xã hội, trò chơi và sáng tạo

Khám phá giọng nói nhân vật, âm thanh UI trò chơi, tài sản của người sáng tạo và khái niệm âm thanh cho phương tiện tương tác.

06

Nhà phát triển, API, và các dòng công việc của đại lý

Thiết lập các prompt, giọng nói, định dạng, xem trước và phản ứng JSON trước khi thêm hệ thống phát âm vào sản phẩm API.

Làm thế nào để sử dụng máy phát âm trên PoYo

1. Chọn mô hình âm thanh trong bảng sao. Chọn nhà cung cấp và mô hình thực thi phù hợp với dòng công việc nói chuyện hoặc âm nhạc của bạn.

2. Thêm văn bản, lời bài hát hoặc hướng nhạc. Tạo kịch bản, prompt, ngôn ngữ, phong cách giọng nói, tâm trạng, nhạc cụ hoặc lời bài hát được yêu cầu bởi mô hình được chọn.

3. Điều chỉnh các điều khiển cụ thể cho mô hình. Chỉ thiết lập các tùy chọn được hiển thị bởi mô hình hoạt động, chẳng hạn như giọng nói, thẻ cảm xúc, tốc độ, tỷ lệ mô hình, tỷ lệ bit, định dạng đầu ra, tối ưu hóa lời bài hát hoặc chế độ nhạc cụ.

4. Tiếp tục, xem trước và tải xuống. Gửi lần tạo, nghe xem trước âm thanh, kiểm tra JSON nếu cần thiết, và tải xuống tệp được tạo ra.

Những câu hỏi thường được hỏi về máy phát âm

Audio Generator có thể tạo ra gì?

PoYo Generator Audio có thể tạo văn bản nói chuyện, âm thanh phát âm, kể chuyện, Đối thoại, biểu diễn âm nhạc, những bài hát, và các đường dây nhạc cụ tùy thuộc vào mô hình được chọn. Các bảng sao chỉ hiển thị các trường được hỗ trợ bởi mô hình âm thanh hoạt động.

Tôi nên chọn mô hình âm thanh nào trước?

Bắt đầu với ElevenLabs V3 TTS cho các giọng nói biểu cảm, ElevenLabs TTS Turbo v2.5 hoặc xAI TTS 1 cho các xét nghiệm ngôn ngữ nhanh hơn, Gemini 3.1 Flash TTS cho lối nói hướng dẫn, ElevenLabs Âm nhạc cho lần tạo âm nhạc có cấu trúc, MiniMax Âm nhạc 2.6 cho các dòng công việc prompt và lời bài hát, và tạo nhạc cho việc tạo nhạc rộng.

Âm thanh được tạo ra thực tế hay tự nhiên đến mức nào?

Chất lượng phụ thuộc vào mô hình, prompt, ngôn ngữ, giọng nói và cài đặt đầu ra. Mô hình TTS hiện đại có thể nghe rất tự nhiên, nhưng sử dụng đầu ra vẫn có lợi từ kiểm tra nghe, chỉnh sửa phát âm, xem xét nhịp điệu và làm chủ cuối cùng.

Tôi có thể kiểm soát ngôn ngữ, cảm xúc, giọng nói, tốc độ hay phong cách âm nhạc không?

VÀ, khi mô hình được chọn hỗ trợ các điều khiển đó. Một số mô hình ngôn ngữ cho thấy ngôn ngữ, giọng nói, tốc độ, ổn định, phong cách, thẻ cảm xúc hoặc dấu thời gian. Các mô hình âm nhạc có thể phơi bày thể loại, tâm trạng, lời bài hát, chế độ nhạc cụ, cấu trúc phần và định dạng đầu ra.

Tôi có thể xem trước hoặc tải xuống các định dạng âm thanh nào?

Tài trưng bày xem trước các tệp âm thanh phổ biến trong trình duyệt. Tùy thuộc vào phản ứng của nhà cung cấp, tải xuống có thể bao gồm MP3, WAV, OGG, Opus, PCM, mu-law, A-law, timestamp, hoặc các tệp hỗ trợ.

Làm thế nào để cải thiện chất lượng âm thanh?

Use là các kịch bản sạch, gợi ý phát âm rõ ràng, hướng giọng nói cụ thể, nhịp độ thực tế và thẻ cảm xúc ngắn gọn. Đối với âm nhạc, mô tả thể loại, tâm trạng, nhịp điệu, nhạc cụ, giọng hát, cấu trúc, lời bài hát và những gì cần tránh.

Việc sản xuất mất bao lâu và giá cả được tính toán như thế nào?

Thời gian và chi phí tạo khác nhau theo mô hình, chiều dài văn bản, thời gian, định dạng, chiều dài âm nhạc, cài đặt chất lượng và nhà cung cấp. Kiểm tra chi phí mô hình hoạt động trong chân đầu vào trước khi chạy các mô hình kể chuyện hoặc âm nhạc dài hơn.

Tôi có thể sử dụng âm thanh được tạo ra thương mại không?

Sử dụng thương mại phụ thuộc vào mô hình được chọn, các điều khoản của nhà cung cấp, kế hoạch tài khoản của bạn, và các quyền gắn liền với kịch bản, lời bài hát, giọng nói, tham chiếu và tài liệu tải lên. Xem xét các điều khoản liên quan và tránh nội dung mà bạn không có quyền sử dụng.

Tại sao sử dụng PoYo để tạo âm thanh?

01

Một không gian làm việc cho các mô hình âm thanh

So sánh các máy phát âm, giọng nói và âm nhạc mà không xây dựng lại các prompt trên các công cụ của nhà cung cấp.

02

Các tham số âm thanh bản địa

Mỗi mô hình giữ lại giọng nói, ngôn ngữ, phong cách, lời bài hát, định dạng và kết quả của nó.

03

Xem trước âm thanh trình duyệt

Nghe âm thanh được tạo trực tiếp trong bộ sưu tập đầu ra trước khi tải xuống các tệp.

04

Khu chơi game và dòng công việc API

Các kịch bản thử nghiệm, prompt, giọng nói, định dạng và phản ứng JSON trước khi chuyển sang các sản phẩm chạy bằng API.