guides

Prezzi dell'API Gemini 3.5 Flash: costi dei token, benchmark ed esempi di budget reale

Poyo.ai Team
11 min read
Share:

Gemini 3.5 Flash API prezzi e pianificazione dei costi

Gemini 3.5 Flash costa $1.50 per 1 milione di token di input e $9 per 1 milione di token di output sul livello a pagamento standard di Google. Il tasso di output include i token pensanti. Le letture della cache contestuale costano $0.15 per 1 milione di token, mentre il contenuto della cache archiviata comporta anche un addebito di archiviazione basato sul tempo.

Su Poyo.ai, Gemini 3.5 Flash attualmente costa $0.90 per 1 milione di token di input e $5.40 per 1 milione di token di output. Questo è 40% inferiore alle tariffe dei token standard di Google, con crediti a consumo e nessun obbligo di abbonamento mensile.

I prezzi principali sono semplici. Il vero conto non lo è. I loop degli agenti, i token di pensiero, il contesto ripetuto, le risposte lunghe, il fondamento della ricerca e i tentativi degli strumenti possono rendere l'output e l'input ripetuto più importanti della velocità di input pubblicizzata.

Prezzi controllati il 19 luglio 2026. Google e Poyo.ai potrebbero aggiornare prezzi, caratteristiche o disponibilità dopo la pubblicazione.

Prezzi dell'API Gemini 3.5 Flash in breve

VoceLivello a pagamento standard di GooglePoyo.ai
Ingresso$1.50 / 1M token$0.90 / 1M token
Output, compreso il pensiero$9.00 / 1M token$5.40 / 1M token
Lettura cache contestuale$0.15 / 1M tokenControlla i termini API attuali
Archiviazione della cache contestuale$1.00 / 1M token all'oraControlla i termini API attuali
Google Ricerca grounding5,000 richieste condivise tra Gemini 3, quindi basati sull'utilizzoDipende dalla configurazione dell'endpoint e dello strumento

Google elenca anche un livello gratuito per Gemini 3.5 Flash. È utile per la valutazione, ma la pianificazione della produzione dovrebbe utilizzare prezzi a livello di pagamento, limiti di tariffa, termini dei dati e requisiti di affidabilità.

Per i prezzi attuali di Poyo e gli endpoint supportati, vedere la pagina del modello Gemini 3.5 Flash API.

Cosa conta per una fattura Gemini 3.5 Flash?

Una formula utile di primo passaggio è:

request cost =
  input tokens × input rate
  + output and thinking tokens × output rate
  + cache storage
  + grounding or server-side tool charges

L'input può includere istruzioni di sistema, cronologia delle conversazioni, definizioni di strumenti, documenti recuperati, immagini, audio e video. L'output include la risposta visibile e i token di riflessione fatturati. Una richiesta che appare corta nell'interfaccia utente può quindi contenere un carico utile misurato molto più grande.

Token di input

L'input è la categoria di token standard meno costosa, ma può diventare la voce di riga più grande quando un'applicazione invia ripetutamente documenti lunghi o una cronologia completa delle conversazioni. Una finestra di contesto da 1 milione di token è una capacità, non una raccomandazione per soddisfare ogni richiesta.

Token di output e di pensiero

La tariffa di output di $9 di Google include esplicitamente i token pensanti. Ciò è importante perché l’output è sei volte il tasso di input standard. Un agente di codifica che esplora diversi approcci, chiama strumenti e scrive una lunga risposta può spendere di più nel ragionamento e nell'output che nel prompt originale.

Memorizzazione nella cache del contesto

La memorizzazione nella cache del contesto può ridurre il prezzo di lettura per materiale ripetuto come un prompt di sistema stabile, un catalogo di prodotti, un manuale delle policy o un riepilogo della base di codice. È particolarmente utile quando lo stesso blocco memorizzato nella cache viene riutilizzato un numero di volte sufficiente per compensare i costi di archiviazione e la complessità della gestione della cache.

Grounding di ricerca e strumenti

La pagina dei prezzi di Google elenca un'indennità mensile inclusa per la grounding della ricerca, seguita da un addebito per query. Una richiesta di modello può produrre più di una query di ricerca. Le applicazioni che utilizzano molti strumenti dovrebbero registrare le chiamate agli strumenti separatamente dall'utilizzo dei token in modo che la fonte di un aumento dei costi sia visibile.

Quanto costa in pratica Gemini 3.5 Flash?

Gli esempi seguenti utilizzano prezzi token standard ed escludono tasse, livelli di elaborazione speciali e addebiti per strumenti separati.

Esempio 1: un piccolo assistente di codifica

Supponiamo che un assistente di codifica consumi 10 milioni di token di input e 2 milioni di token di output al mese.

FornitoreCosto di inputCosto di produzioneTotale mensile
Google standard$15.00$18.00$33.00
Poyo.ai$9.00$10.80$19.80

L’output rappresenta solo un quinto del volume in input, ma costa più dell’input su entrambe le rotte. Questo è il motivo per cui i limiti di output e le impostazioni di ragionamento meritano attenzione.

Esempio 2: un agente di supporto con contesto ripetuto

Immagina 100,000 conversazioni mensili. Ciascuno inizia con 8,000 token delle policy e del contesto del prodotto, quindi produce 1,000 token di output.

Senza memorizzazione nella cache o recupero:

  • Ingresso: 800 milioni di token
  • Uscita: 100 milioni di token
  • Google standard: ingresso $1,200 + uscita $900 = $2,100
  • Tariffe token Poyo.ai: ingresso $720 + uscita $540 = $1,260

Questo design paga ripetutamente per inviare lo stesso contesto. Un'architettura migliore potrebbe memorizzare nella cache il prefisso stabile, recuperare solo le sezioni di policy rilevanti o preparare un riepilogo strutturato più piccolo.

Esempio 3: un flusso di lavoro documentale multimodale

Per PDF, immagini, audio e video, non stimare il costo solo in base alla dimensione del file. Misura i token di input restituiti da API per file rappresentativi. Quindi testa casi brevi, medi e difficili perché la lunghezza dei media e il ragionamento del modello possono cambiare entrambi i lati del conto.

Un pilota pratico dovrebbe registrare:

  • token di input per tipo di supporto;
  • token di output e pensiero;
  • chiamate allo strumento e alla grounding;
  • latenza;
  • successo del compito senza correzione umana;
  • tentativi per attività riuscita.

Perché una fattura Gemini 3.5 Flash può superare il preventivo

Il pensiero viene fatturato come output

Se un'applicazione consente un ragionamento più profondo per ogni richiesta, paga la tariffa di output anche quando la risposta visibile è breve. Utilizza il livello di pensiero più leggero che soddisfi comunque la barra di qualità dell'attività.

I loop degli agenti moltiplicano sia l'input che l'output

Ogni risultato dello strumento può tornare al modello come nuovo input. Chiamate non riuscite, schemi di strumenti ambigui e condizioni di arresto mancanti possono creare loop costosi. Imposta i limiti di iterazione e acquisisci il motivo di ogni nuovo tentativo.

Il contesto completo viene inviato nuovamente inutilmente

L'invio di un intero archivio, conversazione o raccolta di documenti a ogni turno è raramente la soluzione più economica. Riepiloghi, recupero, prefissi memorizzabili nella cache e stato archiviato all'esterno del modello possono ridurre l'input ripetuto.

Le risposte illimitate sono costose

L'output è la categoria dei token premium. Imposta valori di output massimi realistici, chiedi risposte concise e strutturate e genera report lunghi solo quando gli utenti ne hanno effettivamente bisogno.

La grounding può disperdersi

Una singola richiesta può attivare più query di ricerca. Le applicazioni che richiedono un'economia unitaria prevedibile dovrebbero impostare politiche sugli strumenti e monitorare il conteggio delle query piuttosto che trattare la grounding come un contesto libero.

Benchmark Gemini 3.5 Flash nel contesto

Google posiziona Gemini 3.5 Flash come modello di agente e di codifica che preserva la velocità di classe Flash. I dati di lancio di maggio 2026 riportano:

ValutazioneGemini 3.5 Flash risultatoCosa prova
Terminal-Bench 2.176.2%Esecuzione della riga di comando e della codifica degli agenti
GDPval-AA1,656 EloPrestazioni professionali di conoscenza-lavoro
MCP Atlas83.6%Funzionalità di utilizzo di agenti e strumenti
CharXiv Reasoning84.2%Carta multimodale e ragionamento visivo

Google riporta inoltre che Gemini 3.5 Flash produce un output a circa quattro volte la velocità di altri modelli di frontiera nel suo confronto. Questi dati sono segnali utili e non sostituiscono i test applicativi. La progettazione del framework dell'agente, le definizioni degli strumenti, le impostazioni del ragionamento, gli obiettivi di latenza e la qualità dei prompt influiscono tutti sulle prestazioni reali.

La questione economica importante non è “quale parametro di riferimento è il più alto?” È:

Quanto costa un'attività riuscita dopo token, strumenti, tentativi e correzioni umane?

Gemini 3.5 Flash rispetto ai modelli alternativi

ModelloCaso d'uso idealeDomanda principale sui costi
Gemini 3.5 FlashAgenti multimodali veloci, codifica, flussi di lavoro degli strumentiIl pensiero e il contesto ripetuto sono controllati?
GPT-5.6 TerraCodifica equilibrata e ragionamento produttivoIl completamento più efficace delle attività compensa un livello per token più elevato?
Claude Sonnet 5Codifica agentica, uso del computer, flussi di lavoro professionali lunghiIn che modo il tokenizzatore più recente influisce sul costo della richiesta equivalente?
Gemini 3.1 Flash-LiteElaborazione più semplice di grandi volumiIl compito richiede davvero un ragionamento a livello di frontiera?

Usalo come elenco di routing. Esegui lo stesso carico di lavoro rappresentativo su ciascun candidato prima di scegliere un valore predefinito.

Sette modi per ridurre i costi Gemini 3.5 Flash API

  1. Imposta un limite massimo di output. Evita di pagare per spiegazioni o contesti ripetuti che il prodotto non mostra.
  2. Adatta il pensiero in base alla difficoltà del compito. Riserva un ragionamento più profondo alle richieste che ne traggono beneficio.
  3. Prefissi stabili nella cache. Riutilizza i prompt del sistema o il materiale di riferimento quando la percentuale di successo giustifica l'archiviazione.
  4. Recupera prima di generare. Invia le sezioni pertinenti del documento anziché l'intero corpus.
  5. Limita le iterazioni dell'agente. Interrompi o esegui l'escalation dopo un numero definito di errori dello strumento.
  6. Indirizza le attività semplici verso il basso. La classificazione e l'estrazione potrebbero adattarsi a un modello più leggero.
  7. Monitora il costo per attività riuscita. Il solo costo del token nasconde i nuovi tentativi e il lavoro di correzione.

Come chiamare Gemini 3.5 Flash su Poyo.ai

Poyo.ai supporta l'ID modello gemini-3.5-flash. I team possono utilizzare un endpoint di chat compatibile con OpenAI o il formato nativo Gemini documentato per il modello.

curl https://api.poyo.ai/v1/chat/completions \
  -H "Authorization: Bearer $POYO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.5-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this agent plan and identify the three most expensive failure modes."
      }
    ]
  }'

Crea una chiave API dal dashboard Poyo, quindi controlla la pagina del modello Gemini 3.5 Flash e la documentazione API collegata prima della distribuzione in produzione.

Gemini 3.5 Flash vale il prezzo?

Gemini 3.5 Flash è un ottimo candidato quando un'applicazione necessita di codifica rapida, utilizzo di strumenti, input multimodale o ragionamento a lungo contesto. È meno convincente quando una richiesta è sufficientemente prevedibile per un modello più piccolo.

Il miglior modello di produzione è solitamente il routing selettivo:

  • utilizzare un modello più leggero per compiti semplici e ripetitivi;
  • utilizzare Gemini 3.5 Flash per richieste che necessitano di un ragionamento più forte o di un contesto multimodale;
  • trasferire solo i casi più difficili a un livello di frontiera più costoso.

Questo approccio cattura la velocità e la capacità del modello senza pagare i costi del modello di frontiera per ogni richiesta.

Domande frequenti

Quanto costa Gemini 3.5 Flash per milione di token?

Il livello a pagamento standard di Google è $1.50 per 1 milione di token di input e $9 per 1 milione di token di output, inclusi i token pensanti. Poyo.ai attualmente elenca l'input $0.90 e l'output $5.40 per 1 milione di token.

Gemini 3.5 Flash API è gratuito?

Google elenca un livello gratuito, ma le applicazioni di produzione dovrebbero valutarne i limiti di velocità e i termini dei dati. Poyo.ai utilizza crediti a consumo.

I token pensanti Gemini 3.5 Flash vengono addebitati?

Sì. La tabella dei prezzi di Google afferma che la tariffa di output include i token pensanti.

Gemini 3.5 Flash supporta la memorizzazione nella cache del contesto?

Sì. Google elenca le tariffe di lettura e archiviazione della cache a pagamento. La memorizzazione nella cache è più economica per un contesto stabile riutilizzato in un numero sufficiente di richieste.

Qual è l'ID del modello Gemini 3.5 Flash?

L'ID del modello è gemini-3.5-flash.

Gemini 3.5 Flash può utilizzare un'API compatibile con OpenAI?

Sì. Poyo.ai espone un percorso di completamento chat compatibile con OpenAI nonché un percorso di integrazione nativo di Gemini.

Fonti

Share: