Precios de la API de Gemini 3.5 Flash: costes de tokens, benchmarks y ejemplos reales de presupuesto
Compara los costes de entrada, salida, razonamiento, caché y grounding de la API de Gemini 3.5 Flash con ejemplos reales de cargas de trabajo, contexto de benchmarks y formas prácticas de controlar el gasto.


Gemini 3.5 Flash cuesta 1,50 $ por cada 1 millón de tokens de entrada y 9 $ por cada 1 millón de tokens de salida en el nivel estándar de pago de Google. La tarifa de salida incluye los tokens de razonamiento. Las lecturas de caché de contexto cuestan 0,15 $ por cada 1 millón de tokens, mientras que el contenido almacenado en caché también tiene un coste de almacenamiento basado en el tiempo.
En Poyo.ai, Gemini 3.5 Flash cuesta actualmente 0,90 $ por cada 1 millón de tokens de entrada y 5,40 $ por cada 1 millón de tokens de salida. Esto supone un 40 % menos que las tarifas estándar de tokens de Google, con créditos de pago por uso y sin necesidad de suscripción mensual.
Los precios principales son sencillos. La factura real no lo es. Los bucles de agentes, los tokens de razonamiento, el contexto repetido, las respuestas largas, el grounding de búsqueda y los reintentos de herramientas pueden hacer que la salida y las entradas repetidas sean más importantes que la tarifa de entrada anunciada.
Precios comprobados el 19 de julio de 2026. Google y Poyo.ai pueden actualizar precios, funciones o disponibilidad después de la publicación.
Precios de la API de Gemini 3.5 Flash de un vistazo
| Métrica | Nivel estándar de pago de Google | Poyo.ai |
|---|---|---|
| Entrada | 1,50 $ / 1M de tokens | 0,90 $ / 1M de tokens |
| Salida, incluidos tokens de razonamiento | 9,00 $ / 1M de tokens | 5,40 $ / 1M de tokens |
| Lectura de caché de contexto | 0,15 $ / 1M de tokens | Consulta los términos actuales de la API |
| Almacenamiento de caché de contexto | 1,00 $ / 1M de tokens por hora | Consulta los términos actuales de la API |
| Grounding con Google Search | 5.000 prompts compartidos entre Gemini 3 incluidos, después según uso | Depende del endpoint y la configuración de herramientas |
Google también ofrece un nivel gratuito para Gemini 3.5 Flash. Es útil para evaluación, pero la planificación de producción debe basarse en los precios del nivel de pago, los límites de uso, los términos de datos y los requisitos de fiabilidad.
Para consultar los precios actuales de Poyo y los endpoints compatibles, visita la página del modelo Gemini 3.5 Flash API.
¿Qué elementos cuentan en la factura de Gemini 3.5 Flash?
Una fórmula inicial útil es:
coste de la solicitud =
tokens de entrada × tarifa de entrada
+ tokens de salida y razonamiento × tarifa de salida
+ almacenamiento de caché
+ cargos de grounding o herramientas del servidor
La entrada puede incluir instrucciones del sistema, historial de conversaciones, definiciones de herramientas, documentos recuperados, imágenes, audio y vídeo. La salida incluye la respuesta visible y los tokens de razonamiento facturados. Por tanto, una solicitud que parece corta en la interfaz de usuario puede contener una carga medida mucho mayor.
Tokens de entrada
La entrada es la categoría estándar de tokens más económica, pero puede convertirse en la partida más grande cuando una aplicación envía repetidamente documentos extensos o el historial completo de una conversación. Una ventana de contexto de 1 millón de tokens es una capacidad, no una recomendación para llenar cada solicitud.
Tokens de salida y razonamiento
La tarifa de salida de 9 $ de Google incluye explícitamente los tokens de razonamiento. Esto importa porque la salida cuesta seis veces más que la entrada estándar. Un agente de programación que explora varios enfoques, llama a herramientas y escribe una respuesta extensa puede gastar más en razonamiento y salida que en el prompt original.
Caché de contexto
La caché de contexto puede reducir el precio de lectura para material repetido, como un prompt de sistema estable, un catálogo de productos, un manual de políticas o un resumen de una base de código. Es más útil cuando el mismo bloque almacenado en caché se reutiliza suficientes veces para compensar los costes de almacenamiento y la complejidad de gestión de la caché.
Grounding de búsqueda y herramientas
La página de precios de Google indica una cuota mensual incluida para el grounding con Search, seguida de un cargo por consulta. Una solicitud de modelo puede generar más de una consulta de búsqueda. Las aplicaciones con muchas herramientas deberían registrar las llamadas a herramientas por separado del uso de tokens para que sea visible el origen de un aumento de costes.
¿Cuánto cuesta Gemini 3.5 Flash en la práctica?
Los ejemplos siguientes usan precios estándar de tokens y excluyen impuestos, niveles de procesamiento especiales y cargos independientes de herramientas.
Ejemplo 1: un asistente de programación pequeño
Supongamos que un asistente de programación consume 10 millones de tokens de entrada y 2 millones de tokens de salida al mes.
| Proveedor | Coste de entrada | Coste de salida | Total mensual |
|---|---|---|---|
| Estándar de Google | 15,00 $ | 18,00 $ | 33,00 $ |
| Poyo.ai | 9,00 $ | 10,80 $ | 19,80 $ |
La salida es solo una quinta parte del volumen de entrada, pero cuesta más que la entrada en ambas opciones. Por eso los límites de salida y la configuración del razonamiento merecen atención.
Ejemplo 2: un agente de soporte con contexto repetido
Imagina 100.000 conversaciones mensuales. Cada una comienza con 8.000 tokens de políticas y contexto de producto, y después genera 1.000 tokens de salida.
Sin caché ni recuperación:
- Entrada: 800 millones de tokens
- Salida: 100 millones de tokens
- Estándar de Google: 1.200 $ de entrada + 900 $ de salida = 2.100 $
- Tarifas de tokens de Poyo.ai: 720 $ de entrada + 540 $ de salida = 1.260 $
Este diseño paga repetidamente por enviar el mismo contexto. Una arquitectura mejor almacenaría en caché el prefijo estable, recuperaría solo las secciones relevantes de las políticas o prepararía un resumen estructurado más pequeño.
Ejemplo 3: un flujo de trabajo multimodal con documentos
Para PDFs, imágenes, audio y vídeo, no estimes el coste solo por el tamaño del archivo. Mide los tokens de entrada devueltos por la API para archivos representativos. Después prueba casos cortos, medios y complejos, porque la duración del contenido multimedia y el razonamiento del modelo pueden cambiar ambos lados de la factura.
Un piloto práctico debería registrar:
- tokens de entrada por tipo de contenido multimedia;
- tokens de salida y razonamiento;
- llamadas a herramientas y grounding;
- latencia;
- éxito de la tarea sin corrección humana;
- reintentos por tarea completada correctamente.
Por qué una factura de Gemini 3.5 Flash puede superar la estimación
El razonamiento se factura como salida
Si una aplicación activa un razonamiento más profundo para cada solicitud, paga la tarifa de salida incluso cuando la respuesta visible es corta. Usa el nivel de razonamiento más ligero que siga cumpliendo el nivel de calidad necesario para la tarea.
Los bucles de agentes multiplican la entrada y la salida
Cada resultado de una herramienta puede volver al modelo como nueva entrada. Las llamadas fallidas, los esquemas de herramientas ambiguos y la ausencia de condiciones de parada pueden crear bucles costosos. Establece límites de iteración y registra el motivo de cada reintento.
Se reenvía contexto completo innecesariamente
Enviar un repositorio completo, una conversación o una colección de documentos en cada turno rara vez es el diseño más económico. Los resúmenes, la recuperación de información, los prefijos almacenables en caché y el estado guardado fuera del modelo pueden reducir la entrada repetida.
Las respuestas sin límite son caras
La salida es la categoría de tokens premium. Establece valores máximos de salida realistas, solicita respuestas estructuradas y concisas, y genera informes largos solo cuando los usuarios realmente los necesiten.
El grounding puede multiplicarse
Una sola solicitud puede activar varias consultas de búsqueda. Las aplicaciones que necesitan una economía por unidad predecible deberían establecer políticas de herramientas y supervisar el número de consultas en lugar de tratar el grounding como contexto gratuito.
Benchmarks de Gemini 3.5 Flash en contexto
Google presenta Gemini 3.5 Flash como un modelo de agentes y programación que mantiene la velocidad de la clase Flash. Sus datos de lanzamiento de mayo de 2026 indican:
| Evaluación | Resultado de Gemini 3.5 Flash | Qué evalúa |
|---|---|---|
| Terminal-Bench 2.1 | 76,2% | Ejecución de programación con línea de comandos y agentes |
| GDPval-AA | 1.656 Elo | Rendimiento en trabajo profesional basado en conocimiento |
| MCP Atlas | 83,6% | Capacidad de agentes y uso de herramientas |
| CharXiv Reasoning | 84,2% | Razonamiento multimodal con gráficos y elementos visuales |
Google también informa de que Gemini 3.5 Flash genera resultados aproximadamente cuatro veces más rápido que otros modelos frontera en su comparación. Estas cifras son señales útiles, pero no sustituyen las pruebas de aplicaciones reales. El diseño del entorno de pruebas, las definiciones de herramientas, la configuración del razonamiento, los objetivos de latencia y la calidad de los prompts afectan al rendimiento real.
La pregunta económica importante no es:
¿Qué benchmark tiene la puntuación más alta?
Sino:
¿Cuánto cuesta una tarea completada correctamente después de contar tokens, herramientas, reintentos y correcciones humanas?
Gemini 3.5 Flash comparado con modelos alternativos
| Modelo | Mejor uso | Principal cuestión de coste |
|---|---|---|
| Gemini 3.5 Flash | Agentes multimodales rápidos, programación y flujos con herramientas | ¿Están controlados el razonamiento y el contexto repetido? |
| GPT-5.6 Terra | Programación equilibrada y razonamiento para producción | ¿La finalización superior de tareas compensa una tarifa por token más alta? |
| Claude Sonnet 5 | Programación con agentes, uso del ordenador y flujos profesionales largos | ¿Cómo afecta el nuevo tokenizador al coste de solicitudes equivalentes? |
| Gemini 3.1 Flash-Lite | Procesamiento sencillo de alto volumen | ¿La tarea realmente necesita razonamiento de nivel frontera? |
Usa esto como una lista inicial de modelos candidatos. Ejecuta la misma carga de trabajo representativa en cada candidato antes de elegir un modelo predeterminado.
Siete formas de reducir los costes de la API de Gemini 3.5 Flash
- Establece un límite de salida. Evita pagar por explicaciones o contexto repetido que el producto no muestra.
- Ajusta el razonamiento según la dificultad de la tarea. Reserva un razonamiento más profundo para las solicitudes que realmente se beneficien de él.
- Almacena en caché los prefijos estables. Reutiliza prompts de sistema o material de referencia cuando la tasa de uso justifique el almacenamiento.
- Recupera antes de generar. Envía las secciones relevantes de los documentos en lugar del corpus completo.
- Limita las iteraciones del agente. Detén o escala después de un número definido de fallos de herramientas.
- Deriva las tareas simples a modelos inferiores. La clasificación y la extracción pueden encajar en un modelo más ligero.
- Mide el coste por tarea completada correctamente. El coste de tokens por sí solo oculta los reintentos y el trabajo de corrección.
Cómo llamar a Gemini 3.5 Flash en Poyo.ai
Poyo.ai admite el ID de modelo gemini-3.5-flash. Los equipos pueden usar un endpoint de chat compatible con OpenAI o el formato nativo de Gemini documentado para el modelo.
curl https://api.poyo.ai/v1/chat/completions \
-H "Authorization: Bearer $POYO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [
{
"role": "user",
"content": "Review this agent plan and identify the three most expensive failure modes."
}
]
}'
Crea una clave API desde el panel de Poyo, después consulta la página del modelo Gemini 3.5 Flash y la documentación de API enlazada antes de desplegar en producción.
¿Merece la pena Gemini 3.5 Flash por su precio?
Gemini 3.5 Flash es una opción sólida cuando una aplicación necesita programación rápida, uso de herramientas, entrada multimodal o razonamiento con contexto largo. Es menos atractivo cuando una solicitud es lo bastante predecible como para funcionar con un modelo más pequeño.
El patrón de producción más habitual suele ser un enrutamiento selectivo:
- usa un modelo más ligero para tareas simples y repetitivas;
- usa Gemini 3.5 Flash para solicitudes que necesitan un razonamiento más potente o contexto multimodal;
- escala solo los casos más complejos a un nivel frontera más caro.
Este enfoque permite aprovechar la velocidad y capacidad del modelo sin pagar costes de modelos frontera en cada solicitud.
Preguntas frecuentes
¿Cuánto cuesta Gemini 3.5 Flash por millón de tokens?
El nivel estándar de pago de Google cuesta 1,50 $ por cada 1 millón de tokens de entrada y 9 $ por cada 1 millón de tokens de salida, incluidos los tokens de razonamiento. Poyo.ai muestra actualmente 0,90 $ de entrada y 5,40 $ de salida por cada 1 millón de tokens.
¿La API de Gemini 3.5 Flash es gratuita?
Google ofrece un nivel gratuito, pero las aplicaciones de producción deben evaluar sus límites de uso y términos de datos. Poyo.ai utiliza créditos de pago por uso.
¿Los tokens de razonamiento de Gemini 3.5 Flash tienen coste?
Sí. La tabla de precios de Google indica que la tarifa de salida incluye los tokens de razonamiento.
¿Gemini 3.5 Flash admite caché de contexto?
Sí. Google muestra tarifas de lectura y almacenamiento de caché de pago. La caché resulta más económica para contextos estables reutilizados en suficientes solicitudes.
¿Cuál es el ID del modelo Gemini 3.5 Flash?
El ID del modelo es gemini-3.5-flash.
¿Puede Gemini 3.5 Flash usar una API compatible con OpenAI?
Sí. Poyo.ai ofrece una ruta de chat-completions compatible con OpenAI además de una vía de integración nativa de Gemini.


