Model icon
gemini-3-1-flash-tts
Text to Speech
Mô hình:
Google Gemini 3.1 Flash TTS tạo ra ngôn ngữ đa ngôn ngữ biểu cảm với thẻ âm thanh chi tiết, điều khiển phong cách tự nhiên và đối thoại hai loa.
Input
270/50000
Two speakers
Speaker 1
Speaker 2
1.0
Output

Ví dụ về kết quả

Đây là dữ liệu mẫu. Tạo ra một kết quả mới để xem sản lượng thực.

ID nhiệm vụ:ZVT5QJYOGL1MQ2LWĐược tạo ra:2026-06-25 15:14:42
Trạng thái:finishedTiến bộ:100%
Examples
Chi tiết về giá

Giá cả minh bạch mà không có phí ẩn. Chọn tiền đi.

Googlegemini-3-1-flash-tts
Text to speech
Giá PoYo
$0.120
24 tín dụng
Giá chính thức
$0.150
Reference
Anh cứu
20%

* Các khoản phí thực tế được dựa trên kết quả cuối cùng.

Khởi đầu

Hướng dẫn đầy đủ về việc sử dụng Giá cả phải chăng Gemini 3.1 Flash TTS API cho điều khiển giọng nói âm thanh chính xác

Giá cả phải chăng Gemini 3.1 Flash TTS API cho điều khiển giọng nói âm thanh chính xác

Xây dựng các dòng công việc văn bản-những lời nói tự nhiên bằng Gemini 3.1 Flash TTS trên PoYo. Sử dụng thẻ âm thanh biểu cảm, hướng dẫn phong cách ngôn ngữ tự nhiên, cài đặt trước giọng nói Gemini, đối thoại hai loa và thăm dò tình trạng bất đồng bộ thông qua một API. Tạo các dòng podcast, giọng nói ứng dụng, kể chuyện học tập và phát biểu địa phương với giá cả rõ ràng cho mỗi nhân vật.

Có sẵn Gemini 3.1 Flash TTS API Mô hình trên PoYo

01

gemini-3-1-flash-tts

Tự diễn tả Google TTS tại 24 tín dụng mỗi 1000 chữ cái, bằng với $0.12 mỗi 1000 chữ cái trên PoYo, với điều khiển cho văn bản, hướng dẫn phong cách, giọng nói, ngôn ngữ, loa, nhiệt độ và định dạng đầu ra.
Hãy thử sân chơi

Tại sao Gemini 3.1 Flash TTS khác nhau

Gemini 3.1 Flash TTS được xây dựng cho giọng nói theo hướng, chuyển giao và hỗ trợ các dòng công việc sản phẩm đa ngôn ngữ mà không cần một đường ống thoại phức tạp.

01

Tags âm thanh hạt

Chỉ dẫn giao hàng bên trong kịch bản với các thẻ biểu cảm như [pháy thở], [cười], [phầm xơ] và [phơi ngắn]. Điều này làm cho một trường văn bản duy nhất hữu ích cho cả từ và hướng biểu diễn.
  • Kiểm soát cảm xúc, nhịp độ và tín hiệu truyền tải không bằng lời nói.
  • Sử dụng thẻ cho các câu chuyện, video sản phẩm, podcast và dòng nhân vật.
  • Giữ hướng phát biểu gần với kịch bản.
Gemini 3.1 Flash TTS điều khiển thẻ âm thanh

02

Đối thoại hai người nói

Đưa ra chính xác hai biệt danh loa cho các giọng nói Gemini khác nhau cho âm thanh trò chuyện. Đặt các dòng tiền trong văn bản với ID loa, sau đó lập bản đồ cho mỗi loa với một giọng nói riêng biệt trong yêu cầu API.
  • Tạo các phân đoạn podcast chủ nhà và khách.
  • Mô hình đối thoại nhân vật và cuộc trò chuyện trợ lý.
  • Cài đặt tên người nói và giọng nói cho mỗi vai trò đối thoại.
Gemini 3.1 Flash TTS hai loa đối thoại

Những gì bạn có thể xây dựng

01

Các podcast và câu chuyện

Tạo các bài đọc chủ thể biểu cảm, các đoạn giới thiệu, câu chuyện sách âm thanh và âm thanh biên tập với giao hàng hướng dẫn.

02

Nội dung học tập

Chuyển đổi các bản ghi, bài học và tài liệu đào tạo thành âm thanh nói rõ ràng bằng nhiều ngôn ngữ.

03

Đối thoại nhân vật

Các dòng trò chơi nguyên mẫu, dòng chảy trò chơi vai trò, cảnh kể chuyện và các cuộc trò chuyện hai loa với giọng nói khác nhau.

04

Hình ảnh sản phẩm địa phương

Tạo các đầu vào văn bản ứng dụng, tin nhắn hỗ trợ, trình bày sản phẩm và bài phát biểu tiếp cận bằng nhiều ngôn ngữ.

Gemini 3.1 Flash TTS Giá: PoYo so với fal.ai

PoYo phơi bày Gemini 3.1 Flash TTS thông qua cùng một dòng công việc tạo bất đồng bộ được sử dụng trên các mô hình âm thanh PoYo, với giá cả rõ ràng so với giá tham chiếu công cộng.
Tính năngPoYoFal.ai
ID mô hình công cộnggemini-3-1-flash-ttsKhông được phơi bày
Fal.ai$0.12 cho mỗi ký tự 1000$0.15 cho mỗi ký tự 1000
Các khoản tín dụng PoYoCác tín dụng 24 cho mỗi ký tự 1000N/A
Các điều khiển cốt lõivăn bản, style_instructions, voice, language_code, loa, nhiệt độ, output_formatĐăng văn bản với các điều khiển phong cách, giọng nói, ngôn ngữ, loa, nhiệt độ và định dạng
Phòng chảy công việcĐưa nhiệm vụ, tình trạng tiêu chuẩn cuộc thăm dò, tải xuống các tệp âm thanhGiai đoạn công việc hàng tham chiếu

Giá PoYo sử dụng tín dụng 24 cho mỗi ký tự 1000. Một tín dụng có giá tại $0.005.

Làm thế nào để sử dụng Gemini 3.1 Flash TTS trên PoYo

  1. Nhận cái của anh khóa API: Tạo một PoYo tính toán và tạo ra một khóa API từ bảng điều khiển. Đi nào. khóa API ->
  2. Hãy viết văn bản: Nhập văn bản bài phát biểu và thêm thẻ âm thanh như [cười], [nhục thở], [môn miệng] hoặc [phòng dừng ngắn] khi bạn cần phải nói một cách biểu cảm.
  3. Chọn cài đặt giọng nói: Chọn một Gemini giọng nói, ngôn ngữ_code tùy chọn, style_instructions, nhiệt độ, output_format, hoặc cấu hình chính xác hai loa với speaker_id và giọng nói.
  4. Đưa và lấy: Đưa qua PoYolà tạo ra API, sau đó khảo sát các điểm cuối trạng thái nhiệm vụ tiêu chuẩn cho đầu ra âm thanh. Xem API - Các tài liệu ->

Gemini 3.1 Flash TTS FAQ

Gemini 3.1 Flash TTS là gì?

Gemini 3.1 Flash TTS là mô hình văn bản nói chuyện biểu cảm của Google để tạo âm thanh đa ngôn ngữ tự nhiên từ các đầu vào văn bản. Nó hỗ trợ thẻ âm thanh, hướng phong cách ngôn ngữ tự nhiên, cài đặt trước giọng nói Gemini và đối thoại hai loa.

Tôi nên nhập gì vào trường văn bản?

Đặt những từ mà bạn muốn nói trong văn bản. Bạn cũng có thể bao gồm thẻ âm thanh trong dòng như [cười], [phím], [phầm] và [phơi ngắn]. Đối với tổng hợp nhiều loa, các đường tiền tố với biệt danh như Host: và Guest:.

Style_instructions hoạt động như thế nào?

Sử dụng style_instructions để hướng dẫn giao hàng nên áp dụng cho toàn bộ yêu cầu, chẳng hạn như ấm áp và chậm, phát sóng tin tức kịch tính, giọng Anh, giọng vui vẻ, hoặc thì thầm bí ẩn.

Gemini 3.1 Flash TTS hỗ trợ thẻ âm thanh?

Có. Các thẻ âm thanh là một điểm mạnh cốt lõi của mô hình và giúp kiểm soát cảm xúc, dừng lại, cười, thì thầm, nhịp điệu và các chi tiết giao hàng khác trực tiếp bên trong kịch bản.

Những giọng nói và ngôn ngữ nào được hỗ trợ?

API cho thấy các thiết lập âm thanh 30 Gemini như Kore, Puck, Charon, Zephyr và Aoede. Mô hình hỗ trợ tổng hợp đa ngôn ngữ trên các ngôn ngữ 70+, với điều khiển ngôn ngữ_ mã tùy chọn.

Tôi có thể tạo ra đối thoại đa loa không?

Có. Đưa chính xác hai loa, mỗi loa có một speaker_id và giọng nói. Sử dụng các tiền tố speaker_id tương tự trong văn bản để mô hình có thể định tuyến mỗi dòng đến giọng nói dự định. Khi loa được thiết lập, giọng nói cấp cao được phớt lờ.

Tôi có thể yêu cầu những định dạng đầu ra nào?

PoYo hỗ trợ mp3, wav và ogg_opus cho Gemini 3.1 Flash TTS. MP3 là mặc định và được khuyến cáo khi bạn muốn các tệp nhỏ gọn để phát lại web và ứng dụng.

Làm thế nào tính toán hóa đơn và làm thế nào tôi có được kết quả?

PoYo hóa đơn 24 tín dụng cho mỗi ký tự 1000, bằng với $0.12 cho mỗi ký tự 1000. Gửi yêu cầu tạo, sau đó sử dụng task_id trả lại với điểm cuối trạng thái task tiêu chuẩn của PoYo để lấy các tệp âm thanh.

Tại sao sử dụng PoYo

01

Giá cả rõ ràng cho mỗi nhân vật

Sử dụng Gemini 3.1 Flash TTS tại $0.12 cho mỗi ký tự 1000 với hóa đơn tín dụng dự đoán.

02

Phiên bản mô hình thống nhất

Sử dụng cùng một tài khoản PoYo, hóa đơn, thăm dò tình trạng và dòng công việc callback trên các mô hình văn bản, hình ảnh, video và âm thanh.

03

Phòng làm việc sản xuất

Gửi các công việc bất đồng bộ, khảo sát trạng thái nhiệm vụ ổn định, và lấy lại các tệp nói chuyện hoàn thành từ một bề mặt API.

04

Kiểm soát biểu hiện

Khám phá các điều khiển đầu ra thực tế cho văn bản, phong cách, giọng nói, ngôn ngữ, loa, nhiệt độ và định dạng đầu ra.