Gemini 3.5 Flash API Giá: Chi phí token, điểm chuẩn và ví dụ ngân sách thực
So sánh Gemini 3.5 Flash API chi phí đầu vào, đầu ra, suy nghĩ, lưu trữ trước mặt và đặt đất với các ví dụ về khối lượng công việc thực tế, bối cảnh chuẩn và các cách thực tế để kiểm soát chi tiêu.


Chi phí flash Gemini 3.5 $1.50 cho mỗi triệu token nhập 1 và $9 cho mỗi triệu token đầu ra 1 trên cấp độ trả tiền tiêu chuẩn của Google. Tỷ lệ đầu ra bao gồm các token suy nghĩ. Các bản ghi nhớ cache ngữ cảnh chi phí $0.15 cho mỗi triệu token 1, trong khi nội dung lưu trữ cache cũng mang theo phí lưu trữ dựa trên thời gian.
Trên Poyo.ai, Gemini 3.5 Flash hiện có giá $0.90 cho mỗi triệu token nhập 1 và $5.40 cho mỗi triệu token đầu ra 1Đó là 40% dưới tỷ lệ mã thông báo tiêu chuẩn của Google, với tín dụng trả theo thời gian và không yêu cầu đăng ký hàng tháng.
Giá tiêu đề rất đơn giản. Tài khoản thực sự không phải vậy. Các vòng tròn đại lý, mã thông báo suy nghĩ, ngữ cảnh lặp lại, câu trả lời dài, tìm kiếm đất và thử lại công cụ có thể làm cho đầu ra và đầu vào lặp lại quan trọng hơn tỷ lệ đầu vào quảng cáo.
Giá kiểm tra tháng 7 19, 2026. Google và Poyo.ai có thể cập nhật giá, tính năng hoặc tính sẵn có sau khi xuất bản.
Gemini 3.5 Flash API giá cả một cái nhìn
| Meter | Lớp thanh toán tiêu chuẩn Google | Poyo.ai |
|---|---|---|
| Đầu vào | Các mã thông báo $1.50 / 1M | Các mã thông báo $0.90 / 1M |
| Tạo ra, bao gồm suy nghĩ | Các mã thông báo $9.00 / 1M | Các mã thông báo $5.40 / 1M |
| Context-cache read | Các mã thông báo $0.15 / 1M | Kiểm tra các điều khoản API hiện tại |
| Tầm lưu trữ nội dung | Các mã thông báo $1.00 / 1M mỗi giờ | Kiểm tra các điều khoản API hiện tại |
| Google Địa điểm tìm kiếm | 5,000 yêu cầu được chia sẻ trên Gemini 3, sau đó dựa trên sử dụng | Tùy thuộc vào cấu hình điểm cuối và công cụ |
Google cũng liệt kê một cấp độ miễn phí cho Gemini 3.5 Flash. Nó hữu ích cho việc đánh giá, nhưng kế hoạch sản xuất nên sử dụng giá cấp trả, giới hạn giá, điều khoản dữ liệu và yêu cầu độ tin cậy.
Đối với giá Poyo hiện tại và các điểm cuối được hỗ trợ, xem Gemini 3.5 Flash API trang mô hình.
Điều gì có giá trị đối với một tờ giấy tờ flash Gemini 3.5?
Một công thức hữu ích cho lần đầu tiên là:
request cost =
input tokens × input rate
+ output and thinking tokens × output rate
+ cache storage
+ grounding or server-side tool charges
Các thông tin nhập có thể bao gồm hướng dẫn hệ thống, lịch sử trò chuyện, định nghĩa công cụ, tài liệu được lấy lại, hình ảnh, âm thanh và video. Kết quả bao gồm câu trả lời có thể nhìn thấy và các token suy nghĩ được tính toán. Do đó, một yêu cầu trông ngắn trong giao diện người dùng có thể chứa tải trọng hữu ích đo lớn hơn nhiều.
Các token nhập
Nhập là loại mã thông báo tiêu chuẩn rẻ nhất, nhưng nó có thể trở thành mục hàng lớn nhất khi ứng dụng liên tục gửi tài liệu dài hoặc lịch sử cuộc trò chuyện đầy đủ. Một cửa sổ ngữ cảnh 1 triệu token là năng lực, không phải là một khuyến nghị để lấp đầy mọi yêu cầu.
Các token đầu ra và suy nghĩ
Tỷ lệ đầu ra Google của $9 rõ ràng bao gồm các token suy nghĩ. Điều này quan trọng bởi vì đầu ra là sáu lần tốc độ đầu vào tiêu chuẩn. Một đại lý lập trình tìm hiểu nhiều cách tiếp cận, gọi các công cụ và viết câu trả lời dài có thể chi nhiều hơn cho lý luận và đầu ra so với lời yêu cầu ban đầu.
Caching ngữ cảnh
Caching ngữ cảnh có thể làm giảm giá đọc cho các tài liệu lặp lại như một prompt hệ thống ổn định, danh mục sản phẩm, hướng dẫn chính sách hoặc bản tóm tắt mã. Nó hữu ích nhất khi cùng một khối được lưu trữ trong cache được sử dụng lại đủ nhiều lần để bù đắp phí lưu trữ và phức tạp quản lý cache.
Địa điểm tìm kiếm và công cụ
Trang giá của Google liệt kê một khoản phí hàng tháng bao gồm cho việc đặt đất tìm kiếm, tiếp theo là phí cho mỗi truy vấn. Một yêu cầu mô hình có thể tạo ra nhiều hơn một truy vấn tìm kiếm. Các ứng dụng nặng công cụ nên ghi lại các cuộc gọi công cụ riêng biệt với việc sử dụng token để nguồn gốc của sự gia tăng chi phí có thể nhìn thấy.
Gemini 3.5 Flash thực tế có giá bao nhiêu?
Các ví dụ dưới đây sử dụng giá token tiêu chuẩn và không tính thuế, cấp độ xử lý đặc biệt và phí công cụ riêng biệt.
Ví dụ 1: một trợ lý mã hóa nhỏ
Giả sử một trợ lý mã hóa tiêu thụ 10 triệu mã thông báo đầu vào và 2 triệu mã thông báo đầu ra mỗi tháng.
| Nhà cung cấp | Chi phí nhập khẩu | Chi phí đầu ra | Tổng số hàng tháng |
|---|---|---|---|
| Tiêu chuẩn Google | $15.00 | $18.00 | $33.00 |
| Poyo.ai | $9.00 | $10.80 | $19.80 |
Tạo ra chỉ là một phần năm của khối lượng đầu vào, nhưng nó tốn kém hơn cả đầu vào trên cả hai tuyến. Đây là lý do tại sao giới hạn đầu ra và thiết lập lý luận xứng đáng được chú ý.
Ví dụ 2: một đại lý hỗ trợ với bối cảnh lặp lại
Hãy tưởng tượng cuộc trò chuyện hàng tháng của 100,000. Mỗi đầu tiên là các token chính sách và ngữ cảnh sản phẩm 8,000, sau đó tạo ra các token đầu ra 1,000.
Không lưu trữ hoặc lấy lại:
- Nhập: 800 triệu token
- Tạo ra: 100 triệu token
- Tiêu chuẩn Google: $1,200 đầu vào + $900 đầu ra = $2,100
- Tỷ lệ token Poyo.ai: $720 đầu vào + $540 đầu ra = $1,260
Thiết kế này liên tục trả tiền để gửi cùng một ngữ cảnh. Một kiến trúc tốt hơn sẽ lưu trữ tiền đề ổn định, lấy lại chỉ các phần chính sách có liên quan hoặc chuẩn bị một bản tóm tắt có cấu trúc nhỏ hơn.
Ví dụ 3: một dòng công việc tài liệu đa phương thức
Đối với các file PDF, hình ảnh, âm thanh và video, đừng ước tính chi phí chỉ dựa trên kích thước file. Đánh giá các mã thông báo nhập được trả về bởi API cho các tệp đại diện. Sau đó kiểm tra các trường hợp ngắn, trung bình và khó khăn vì chiều dài phương tiện và lý luận mô hình có thể thay đổi cả hai mặt của dự luật.
Một phi công thực tế nên ghi lại:
- Các token nhập theo loại phương tiện;
- các token đầu ra và suy nghĩ;
- Công cụ và các cuộc gọi đặt đất;
- thời gian trễ;
- thành công trong nhiệm vụ mà không cần sự sửa chữa của con người;
- thử lại cho mỗi nhiệm vụ thành công.
Tại sao một hóa đơn flash Gemini 3.5 có thể vượt quá ước tính
Tư duy được tính toán như sản lượng
Nếu một ứng dụng cho phép lý luận sâu hơn cho mỗi yêu cầu, nó trả tiền tốc độ đầu ra ngay cả khi phản ứng hiển thị ngắn. Sử dụng mức độ suy nghĩ nhẹ nhất vẫn đáp ứng thanh chất lượng của nhiệm vụ.
Các vòng tròn đại lý nhân cả đầu vào và đầu ra
Mỗi kết quả công cụ có thể trở lại mô hình như đầu vào mới. Các cuộc gọi thất bại, các kế hoạch công cụ không rõ ràng và không có điều kiện dừng lại có thể tạo ra các vòng đắt tiền. Đặt giới hạn lặp lại và nắm bắt lý do cho mỗi lần thử lại.
Toàn bộ bối cảnh là không cần thiết.
Việc gửi toàn bộ kho lưu trữ, cuộc trò chuyện hoặc bộ sưu tập tài liệu ở mỗi lượt hiếm khi là thiết kế kinh tế nhất. Kết luận, lấy lại, tiền đề có thể lưu trữ trong cache và trạng thái được lưu trữ bên ngoài mô hình có thể làm giảm nhập lặp đi lặp lại.
Những câu trả lời không giới hạn là đắt tiền
Output là loại token cao cấp. Đặt giá trị đầu ra tối đa thực tế, yêu cầu các phản ứng ngắn gọn có cấu trúc và tạo báo cáo dài chỉ khi người dùng thực sự cần chúng.
Địa ngục có thể lan rộng
Một yêu cầu duy nhất có thể kích hoạt nhiều truy vấn tìm kiếm. Các ứng dụng đòi hỏi kinh tế đơn vị có thể dự đoán nên thiết lập các chính sách công cụ và theo dõi số lượng truy vấn thay vì xử lý việc đặt đất như một bối cảnh tự do.
Gemini 3.5 Các tiêu chuẩn Flash trong bối cảnh
Google Vị trí Gemini 3.5 Flash như một mô hình hoạt động và mã hóa để duy trì tốc độ lớp Flash. 2026 báo cáo dữ liệu khởi động:
| Đánh giá | Gemini 3.5 Kết quả Flash | Điều nó kiểm tra |
|---|---|---|
| Terminal-Bench 2.1 | 76.2% | Thực hiện mã hóa lệnh và hành động |
| GDP-AA | 1,656 Elo | Hoạt động công việc kiến thức chuyên nghiệp |
| MCP Atlas | 83.6% | Khả năng sử dụng đại lý và công cụ |
| Lý luận CharXiv | 84.2% | Hình đồ đa phương và lý luận trực quan |
Google cũng báo cáo rằng Gemini 3.5 Flash đầu ra tốc độ đầu ra khoảng bốn lần so với tốc độ của các mô hình biên giới khác trong so sánh của nó. Những con số này là tín hiệu hữu ích, không thay thế cho các thử nghiệm ứng dụng. Thiết kế sử dụng, định nghĩa công cụ, cài đặt lý luận, mục tiêu trễ và chất lượng nhanh tất cả đều ảnh hưởng đến hiệu suất thực tế.
Câu hỏi kinh tế quan trọng không phải là “điều chuẩn nào cao nhất?”
Một nhiệm vụ thành công có giá bao nhiêu sau khi có token, công cụ, thử lại và sửa chữa của con người?
Gemini 3.5 Flash so với các mô hình thay thế
| Mô hình | Tích hợp tốt nhất | Câu hỏi chi phí chính |
|---|---|---|
| Gemini 3.5 Flash | Các tác nhân đa phương thức nhanh, mã hóa, dòng công cụ | Liệu suy nghĩ và lặp lại ngữ cảnh có được kiểm soát? |
| GPT-5.6 Terra | Định nghĩa lập trình và sản xuất cân bằng | Việc hoàn thành nhiệm vụ mạnh hơn có bù đắp cho mức cao hơn cho mỗi token không? |
| Claude Sonet 5 | Mã hóa đại lý, sử dụng máy tính, dòng công việc chuyên nghiệp dài | How does the newer tokenizer affect equivalent request cost? |
| Gemini 3.1 Flash-Lite | Phân biến đơn giản hơn với khối lượng lớn | Liệu nhiệm vụ này có thực sự đòi hỏi phải có sự suy luận ở cấp độ biên giới? |
Sử dụng đây như một danh sách ngắn về đường dẫn. Tiêu chuẩn công việc đại diện tương tự qua mỗi ứng viên trước khi chọn mặc định.
Bảy cách để giảm chi phí Gemini 3.5 Flash API
- Đặt một trần suất đầu ra. Tránh trả tiền cho các lời giải thích hoặc ngữ cảnh lặp lại mà sản phẩm không thể hiện.
- Điều chỉnh suy nghĩ theo khó khăn nhiệm vụ. Hãy dành một lý luận sâu sắc hơn cho những lời cầu xin có lợi từ nó.
- Cache stable prefixes. Sử dụng lại các prompt hệ thống hoặc vật liệu tham chiếu khi tỷ lệ hit biện minh cho việc lưu trữ.
- Tái lấy trước khi tạo. Gửi các phần tài liệu liên quan thay vì toàn bộ bộ.
- Giới hạn sự lặp lại của đại lý. Ngưng hoặc leo thang sau một số cố định của công cụ.
- Đặt các nhiệm vụ đơn giản xuống. Việc phân loại và khai thác có thể phù hợp với mô hình nhẹ hơn.
- Theo dõi chi phí cho mỗi nhiệm vụ thành công. Chỉ có chi phí token ẩn lại các thử nghiệm và sửa chữa.
Làm thế nào để gọi Gemini 3.5 Flash trên Poyo.ai
Poyo.ai hỗ trợ ID mô hình gemini-3.5-flashCác nhóm có thể sử dụng một điểm kết thúc trò chuyện tương thích với OpenAI hoặc định dạng bản địa Gemini được ghi lại cho mô hình.
curl https://api.poyo.ai/v1/chat/completions \
-H "Authorization: Bearer $POYO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [
{
"role": "user",
"content": "Review this agent plan and identify the three most expensive failure modes."
}
]
}'
Tạo một khóa API từ bảng điều khiển Poyo, sau đó kiểm tra Gemini 3.5 Trang mô hình Flash và các tài liệu API liên kết trước khi triển khai sản xuất.
Gemini 3.5 Flash có đáng giá không?
Gemini 3.5 Flash là ứng cử viên mạnh khi một ứng dụng cần mã hóa nhanh, sử dụng công cụ, đầu vào đa phương thức hoặc lý luận ngữ cảnh dài. Nó ít hấp dẫn hơn khi yêu cầu đủ dự đoán cho một mô hình nhỏ hơn.
Mô hình sản xuất tốt nhất thường là định tuyến chọn lọc:
- sử dụng mô hình nhẹ hơn cho các nhiệm vụ đơn giản, lặp đi lặp lại;
- sử dụng Gemini 3.5 Flash cho các yêu cầu cần lý luận mạnh mẽ hơn hoặc bối cảnh đa phương thức;
- chỉ tăng các trường hợp khó khăn nhất lên một cấp độ biên giới đắt tiền hơn.
Phương pháp này nắm bắt tốc độ và khả năng của mô hình mà không phải trả chi phí mô hình biên giới cho mỗi yêu cầu.
Những câu hỏi thường được hỏi
Gemini 3.5 Flash có giá bao nhiêu cho mỗi triệu token?
Tầng thanh toán tiêu chuẩn của Google là $1.50 cho mỗi triệu token đầu vào 1 và $9 cho mỗi triệu token đầu ra 1, bao gồm cả các token suy nghĩ. Poyo.ai hiện liệt kê các đầu vào $0.90 và đầu ra $5.40 cho mỗi triệu token 1.
Gemini 3.5 Flash API miễn phí?
Google liệt kê một cấp độ miễn phí, nhưng các ứng dụng sản xuất nên đánh giá giới hạn tỷ lệ và các điều khoản dữ liệu của nó. Poyo.ai sử dụng tín dụng trả theo thời gian.
Gemini 3.5 Flash Thinking token có được sạc không?
Có. Bảng giá của Google cho biết tỷ lệ đầu ra bao gồm các token suy nghĩ.
Gemini 3.5 Flash hỗ trợ lưu trữ nội dung?
Có. Google liệt kê mức đọc cache và lưu trữ trả tiền. Caching là kinh tế nhất cho bối cảnh ổn định được sử dụng lại trên đủ yêu cầu.
ID mô hình Flash Gemini 3.5 là gì?
Phản thức nhận dạng mô hình là gemini-3.5-flash.
Gemini 3.5 Flash có thể sử dụng một OpenAI tương thích với API không?
Có. Poyo.ai phơi bày một tuyến đường hoàn thành trò chuyện tương thích với OpenAI cũng như một tuyến đường tích hợp bản địa của Gemini.

