Semua artikel
panduan10 menit baca

Gemini 3.5 Flash API Harga: Biaya token, benchmark, dan contoh anggaran nyata

Bandingkan Gemini 3.5 Flash API input, output, berpikir, caching, dan biaya grounding dengan contoh beban kerja nyata, konteks benchmark, dan cara praktis untuk mengendalikan pengeluaran.

Gemini 3.5 Flash API Harga: Biaya token, benchmark, dan contoh anggaran nyata
panduan

Gemini 3.5 Flash API penentuan harga dan perencanaan biaya

Gemini 3.5 Biaya flash $1.50 per 1 juta token input dan $9 per 1 token output juta pada Googletingkat standar dibayar. Tingkat output termasuk token berpikir. Kontext-cache membaca biaya $0.15 per 1 juta token, sementara konten cache yang disimpan juga membawa biaya penyimpanan berbasis waktu.

Pada Poyo.ai, Gemini 3.5 Biaya flash saat ini $0.90 per 1 juta token input dan $5.40 per 1 token output juta. Itu adalah 40% di bawah GoogleTingkat token standar, dengan kredit bayar-as-you-go dan tidak ada persyaratan langganan bulanan.

Harga utama sederhana. Faktur yang sebenarnya tidak. Lops agen, token berpikir, konteks berulang, jawaban panjang, grounding pencarian, dan alat retry dapat membuat output dan input berulang lebih penting daripada tingkat input yang diiklankan.

Harga diperiksa Juli 19, 2026. Google dan Poyo.ai dapat memperbarui harga, fitur, atau ketersediaan setelah publikasi.

Gemini 3.5 Flash API harga pada sekejap

Meter Google Tingkat standar dibayar Poyo.ai
Input $1.50 / 1M token $0.90 / 1M token
Output, termasuk berpikir $9.00 / 1M token $5.40 / 1M token
Bacaan konteks cache $0.15 / 1M token Periksa arus API istilah
Kontext-cache storage $1.00 / 1M token per jam Periksa arus API istilah
Google Pencarian grounding 5,000 prompt yang dibagi Gemini 3, kemudian berdasarkan penggunaan Tergantung pada konfigurasi terminal dan alat

Google juga daftar tingkat gratis untuk Gemini 3.5 Flash. Hal ini berguna untuk evaluasi, tetapi perencanaan produksi harus menggunakan harga tingkat dibayar, batas tarif, istilah data, dan persyaratan keandalan.

Untuk arus Poyo harga dan titik akhir yang didukung, lihat Gemini 3.5 Flash API halaman model.

Apa yang dihitung untuk Gemini 3.5 Bill flash?

Rumus pertama yang berguna adalah:

request cost =
  input tokens × input rate
  + output and thinking tokens × output rate
  + cache storage
  + grounding or server-side tool charges

Input dapat mencakup instruksi sistem, riwayat percakapan, definisi alat, dokumen yang diunduh, gambar, audio, dan video. Output termasuk jawaban yang terlihat dan token berpikir yang dibilled. Permintaan yang terlihat pendek dalam antarmuka pengguna mungkin mengandung beban berguna yang jauh lebih besar.

Token input

Input adalah kategori token standar yang paling murah, tetapi bisa menjadi item baris terbesar ketika aplikasi berulang kali mengirim dokumen panjang atau riwayat percakapan lengkap. A. 1 jendela konteks juta token adalah kapasitas, bukan rekomendasi untuk mengisi setiap permintaan.

Output dan token berpikir

Google $9 output rate secara eksplisit termasuk token berpikir. Hal ini penting karena output adalah enam kali tingkat input standar. Agen pengkodean yang mengeksplorasi beberapa pendekatan, memanggil alat, dan menulis jawaban panjang dapat menghabiskan lebih banyak untuk penalaran dan output daripada pada prompt asli.

Caching konteks

Caching konteks dapat menurunkan harga membaca untuk materi berulang seperti prompt sistem yang stabil, katalog produk, manual kebijakan, atau ringkasan basis kode. Hal ini paling berguna ketika blok yang sama disimpen ulang digunakan kembali cukup kali untuk mengimbangi biaya penyimpanan dan kompleksitas manajemen cache.

Pencarian tanah dan alat

Googlehalaman harga daftar biaya bulanan yang termasuk untuk pencarian grounding, diikuti dengan biaya per pertanyaan. Satu permintaan model dapat menghasilkan lebih dari satu pencarian. Aplikasi berat alat harus mencatat panggilan alat terpisah dari penggunaan token sehingga sumber kenaikan biaya terlihat.

Berapa banyak Gemini 3.5 Biaya flash dalam prakteknya?

Contoh di bawah ini menggunakan harga token standar dan tidak termasuk pajak, tingkat pemrosesan khusus, dan biaya alat terpisah.

Contoh 1: asisten pengkodean kecil

Misalkan asisten pengkodean mengkonsumsi 10 juta token input dan 2 juta token output per bulan.

Penyedia Biaya input Biaya output Jumlah bulanan
Google standar $15.00 $18.00 $33.00
Poyo.ai $9.00 $10.80 $19.80

Output hanya seperlima dari volume input, namun biaya lebih dari input di kedua rute. Itulah mengapa batas output dan pengaturan penalaran layak perhatian.

Contoh 2: agen pendukung dengan konteks berulang

Bayangkan 100,000 percakapan bulanan. Setiap dimulai dengan 8,000 token kebijakan dan konteks produk, kemudian menghasilkan 1,000 token output.

Tanpa caching atau pengambilan:

  • Masukan: 800 juta token
  • Keluarnya: 100 juta token
  • Google standar: $1,200 input + $900 output = $2,100
  • Poyo.ai Tingkat token: $720 input + $540 output = $1,260

Desain ini berulang kali membayar untuk mengirim konteks yang sama. Arsitektur yang lebih baik akan menyimpan prefiks stabil, hanya mengambil bagian kebijakan yang relevan, atau menyiapkan ringkasan terstruktur yang lebih kecil.

Contoh 3: alur kerja dokumen multimodal

Untuk PDF, gambar, audio, dan video, jangan memperkirakan biaya dari ukuran file saja. Mengukur token input yang dikembalikan oleh API untuk file representatif. Kemudian uji kasus pendek, menengah, dan sulit karena panjang media dan alasan model dapat mengubah kedua sisi tagihan.

Pilot praktis harus mencatat:

  • token input menurut jenis media;
  • output dan token berpikir;
  • alat dan panggilan grounding;
  • latensi;
  • keberhasilan tugas tanpa koreksi manusia;
  • Percobaan ulang per tugas yang berhasil.

Mengapa Gemini 3.5 tagihan flash bisa melebihi perkiraan

Pikiran dibilangkan sebagai output

Jika aplikasi memungkinkan alasan yang lebih dalam untuk setiap permintaan, itu membayar tingkat output bahkan ketika respons yang terlihat pendek. Gunakan tingkat berpikir terendah yang masih memenuhi standar kualitas tugas.

Lops agen melipatgandakan baik input dan output

Setiap hasil alat dapat kembali ke model sebagai input baru. Telepon yang gagal, skema alat yang tidak jelas, dan kondisi berhenti yang hilang dapat menciptakan loop yang mahal. Tentukan batas iterasi dan menangkap alasan untuk setiap percobaan ulang.

Konteks penuh tidak perlu

Mengirim seluruh repositori, percakapan, atau koleksi dokumen di setiap gilirannya jarang merupakan desain yang paling ekonomis. Ringkasan, pengambilan, prefixes cacheable, dan negara yang disimpan di luar model dapat mengurangi input berulang.

Jawaban tak terbatas mahal

Output adalah kategori token premium. Tentukan nilai output maksimum yang realistis, minta jawaban ringkas terstruktur, dan menghasilkan laporan panjang hanya ketika pengguna benar-benar membutuhkannya.

Mengeringkan bisa menyebar

Satu permintaan dapat memicu beberapa pencarian. Aplikasi yang membutuhkan ekonomi unit yang dapat diprediksi harus menetapkan kebijakan alat dan memantau jumlah permintaan daripada memperlakukan grounding sebagai konteks bebas.

Gemini 3.5 Flash benchmark dalam konteks

Google Posisi Gemini 3.5 Flash sebagai agen dan kode model yang mempertahankan kecepatan kelas Flash. Bulan Mei 2026 laporan data peluncuran:

Evaluasi Gemini 3.5 Hasil flash Apa yang diuji
Terminal-Bench 2.1 76.2% Eksekusi kode command-line dan agentic
Nilai PDB-AA 1,656 Elo Kinerja kerja pengetahuan profesional
Atlas MCP 83.6% Kemampuan agen dan alat
Penjelasan CharXiv 84.2% Grafik multimodal dan penalaran visual

Google juga melaporkan bahwa Gemini 3.5 Flash menghasilkan output sekitar empat kali lebih prompt dari model perbatasan lainnya dalam perbandingan. Angka-angka ini adalah sinyal yang berguna, bukan pengganti pengujian aplikasi. Desain penggunan, definisi alat, pengaturan penalaran, target latensi, dan kualitas prompt semua mempengaruhi kinerja nyata.

Pertanyaan ekonomi yang penting bukan “Beberapa indikator yang paling tinggi?”

Berapa biaya satu tugas yang berhasil setelah token, alat, percobaan ulang, dan koreksi manusia?

Gemini 3.5 Flash dibandingkan dengan model alternatif

Model Cocok terbaik Pertanyaan biaya utama
Gemini 3.5 Flash Agen multimoda cepat, pengkodean, alur kerja alat Apakah pemikiran dan konteks berulang dikendalikan?
GPT-5.6 Terra Rasoning pengkodean dan produksi yang seimbang Apakah penyelesaian tugas yang lebih kuat mengimbangi tingkat per token yang lebih tinggi?
Claude Sonet 5 Pengkodean agen, penggunaan komputer, alur kerja profesional yang panjang Bagaimana tokenizer yang lebih baru mempengaruhi biaya permintaan setara?
Gemini 3.1 Flash-Lite Pengolahan volume tinggi yang lebih sederhana Apakah tugas ini benar-benar membutuhkan penalaran tingkat batas?

Gunakan ini sebagai daftar pendek routing. Jalankan beban kerja representatif yang sama melalui setiap kandidat sebelum memilih default.

Tujuh cara untuk mengurangi Gemini 3.5 Flash API Biaya

  1. Setellah langit-langit output. Hindari membayar penjelasan atau konteks berulang yang tidak ditunjukkan produk.
  2. Mengubah pemikiran menurut kesulitan tugas. Berpikirlah lebih dalam untuk meminta manfaat dari itu.
  3. Mendaftarkan prefiks stabil. Gunakan ulang sistem atau bahan referensi ketika tingkat hit membenarkan penyimpanan.
  4. Dapatkan sebelum menghasilkan. Kirim bagian dokumen yang relevan bukan seluruh corpus.
  5. Batasi iterasi agen. Hentikan atau meningkat setelah sejumlah kegagalan alat yang ditentukan.
  6. Mengurangi tugas sederhana. Klasifikasi dan ekstraksi dapat sesuai dengan model yang lebih ringan.
  7. Pelacakan biaya per tugas yang berhasil. Biaya token saja menyembunyikan upaya ulang dan pekerjaan koreksi.

Bagaimana untuk menelepon Gemini 3.5 Flash di Poyo.ai

Poyo.ai mendukung ID model gemini-3.5-flash. Tim dapat menggunakan OpenAI-compatible chat endpoint atau Gemini- format asli yang didokumentasikan untuk model.

curl https://api.poyo.ai/v1/chat/completions \
  -H "Authorization: Bearer $POYO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.5-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this agent plan and identify the three most expensive failure modes."
      }
    ]
  }'

Buat kunci API dari Poyo papan pemindai, lalu periksa Gemini 3.5 Halaman model flash dan terkait API dokumentasi sebelum produksi.

Apakah Gemini 3.5 Flash layak untuk harga?

Gemini 3.5 Flash adalah kandidat yang kuat ketika aplikasi membutuhkan pengkodean cepat, penggunaan alat, input multimodal, atau penalaran konteks panjang. Hal ini kurang menarik ketika permintaan cukup dapat diprediksi untuk model yang lebih kecil.

Pola produksi terbaik biasanya adalah routing selektif:

  • menggunakan model yang lebih ringan untuk tugas sederhana dan berulang;
  • penggunaan Gemini 3.5 Flash untuk permintaan yang membutuhkan penalaran yang lebih kuat atau konteks multimodal;
  • hanya meningkatkan kasus terberat ke tingkat perbatasan yang lebih mahal.

Pendekatan ini menangkap kecepatan dan kemampuan model tanpa membayar biaya model perbatasan untuk setiap permintaan.

Pertanyaan yang sering diajukan

Berapa banyak Gemini 3.5 Flash biaya per juta token?

GoogleTingkat standar dibayar adalah $1.50 per 1 juta token input dan $9 per 1 juta token output, termasuk token berpikir. Poyo.ai daftar saat ini $0.90 input dan $5.40 output per 1 jutaan token.

Apakah Gemini 3.5 Flash API bebas?

Google daftar tingkat bebas, tetapi aplikasi produksi harus mengevaluasi batas tarif dan persyaratan data. Poyo.ai menggunakan kredit bayar-seperti-Anda pergi.

Apakah Gemini 3.5 Flash thinking token diisi?

Ya. GoogleTabel harga menyatakan bahwa tingkat output termasuk token berpikir.

Apakah Gemini 3.5 Flash mendukung cache konteks?

Ya. Google daftar biaya caching dan penyimpanan yang dibayar. Caching paling ekonomis untuk konteks yang stabil digunakan kembali di permintaan yang cukup.

Apa itu Gemini 3.5 ID model flash?

ID model adalah gemini-3.5-flash.

Bisa Gemini 3.5 Flash menggunakan OpenAI- kompatibel API?

Ya. Poyo.ai mengekspos OpenAI- rute chat-kompleks yang kompatibel serta Gemini- jalur integrasi asli.

Sumber

Blog · PoYo.aiSemua artikel
HUBUNGI KAMI

Punya proyek?

Ceritakan apa yang Anda bangun. Tim kami akan membantu memilih API AI yang tepat.

Data Anda hanya digunakan untuk menanggapi pertanyaan ini.

PoYo AI

Siap menjelajahi model?

Jelajahi model gambar, video, audio, dan bahasa di PoYo.

Lihat model AI