Explicación de los benchmarks de GPT-5.6: Sol vs Terra vs Luna, precios y mejores casos de uso
Comprende los resultados de los benchmarks de GPT-5.6, los precios de la API y las diferencias prácticas entre Sol, Terra y Luna para programación, agentes, investigación y enrutamiento en producción.


La familia GPT-5.6 de OpenAI cuenta con tres niveles de capacidad principales: Sol para los trabajos más exigentes, Terra para cargas de producción equilibradas y Luna para tráfico rápido y sensible al coste. La historia de los benchmarks no es simplemente que Sol gane. Terra y Luna suelen conservar gran parte de la capacidad usando tokens con menor precio, por lo que el enrutamiento de modelos es más importante que elegir un único modelo para todas las solicitudes.
OpenAI lanzó la familia completa GPT-5.6 el 9 de julio de 2026. Esta guía explica los resultados de benchmarks publicados, qué miden y cómo combinar calidad, precio, latencia y tasas de reintento al seleccionar un modelo.
Datos y precios comprobados el 19 de julio de 2026. Los resultados de los benchmarks proceden de los materiales de lanzamiento de OpenAI y utilizan la configuración descrita allí. No son garantías directas para una aplicación o un sistema de agentes diferente.
Resumen de benchmarks de GPT-5.6
La siguiente tabla se centra en evaluaciones representativas de uso profesional y programación.
| Evaluación | Sol | Terra | Luna | GPT-5.5 | Qué mide |
|---|---|---|---|---|---|
| Agents’ Last Exam | 52.7% | 50.4% | 50.3% | 46.9% | Flujos de trabajo profesionales de larga duración |
| Artificial Analysis Intelligence Index | 58.9 | 55.0 | 51.2 | 54.8 | Inteligencia general en trabajo con agentes, programación y razonamiento |
| Coding Agent Index | 80.0 | 77.4 | 74.6 | 76.4 | Implementación, uso del terminal y bases de código reales |
| SWE-Bench Pro | 64.6% | 63.4% | 62.7% | 59.4% | Resolución de problemas de ingeniería de software |
| DeepSWE 1.1 | 72.7% | 69.6% | 67.2% | 67.0% | Ingeniería de larga duración en bases de código reales |
| Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% | 85.6% | Flujos de trabajo complejos desde la línea de comandos |
Sol lidera en estas evaluaciones seleccionadas. Terra se mantiene cerca en varias tareas de programación. Luna no es universalmente superior a GPT-5.5, pero sigue siendo competitiva mientras ocupa el nivel GPT-5.6 más rápido y económico.
La tabla también muestra por qué una única puntuación media no es suficiente. Un clasificador de soporte, un agente de revisión de código, un flujo de investigación financiera y un operador de navegador no valoran las mismas capacidades.
Qué miden realmente los benchmarks de GPT-5.6
Benchmarks de agentes de programación
Los benchmarks de programación varían mucho. Algunos comprueban si un modelo puede generar un parche. Otros incluyen exploración de repositorios, comandos de terminal, ejecución de pruebas y corrección iterativa.
OpenAI informa de que GPT-5.6 Sol alcanzó 80 en el Artificial Analysis Coding Agent Index utilizando menos tokens y menos tiempo que varias alternativas avanzadas incluidas en su comparación. Terra obtuvo 77.4 y Luna 74.6. Para un agente de programación en producción, las preguntas importantes son:
- ¿Encuentra los archivos correctos?
- ¿Mantiene las convenciones del proyecto?
- ¿Ejecuta e interpreta las pruebas?
- ¿Se recupera después de un enfoque fallido?
- ¿Cuántos turnos del modelo necesita antes de obtener un resultado verificado?
Un modelo con una puntuación de parche ligeramente superior puede seguir siendo menos rentable si genera trazas de razonamiento largas, repite llamadas a herramientas o necesita una revisión humana costosa.
Benchmarks de agentes de larga duración
Agents’ Last Exam evalúa flujos de trabajo profesionales más largos en muchos dominios. Sol obtuvo 52.7%, mientras que Terra y Luna lograron 50.4% y 50.3%. La diferencia reducida es destacable: sugiere que muchas tareas profesionales pueden no necesitar el nivel insignia.
Las evaluaciones de larga duración son especialmente sensibles al sistema que rodea al modelo. El diseño de herramientas, la memoria, las políticas de reintento, los permisos y los pasos de verificación pueden cambiar los resultados tanto como el modelo base.
Navegación y uso del ordenador
OpenAI informa de un 92.2% para GPT-5.6 Sol en BrowseComp y un 62.6% en OSWorld 2.0. Estos resultados respaldan agentes de investigación, flujos de navegación y aplicaciones que deben inspeccionar sus propios resultados.
Los benchmarks de uso del ordenador no deben interpretarse como una promesa de fiabilidad sin supervisión. Los sistemas en producción siguen necesitando permisos limitados, confirmación para acciones importantes, tiempos de espera y mecanismos de recuperación.
Trabajo de conocimiento y artefactos
GPT-5.6 también está orientado a documentos, hojas de cálculo, presentaciones, informes de investigación y trabajo frontend. Estos resultados son difíciles de capturar con un único benchmark porque la corrección, la fidelidad de las fuentes, la calidad visual y la capacidad de edición son importantes.
Para estas cargas de trabajo, crea una rúbrica interna. Evalúa la precisión factual, la estructura, el cumplimiento de una plantilla de referencia, el número de correcciones manuales y el tiempo necesario para obtener un resultado aceptable.
GPT-5.6 Sol vs Terra vs Luna
Elige GPT-5.6 Sol para problemas difíciles de alto valor
Sol es el nivel insignia. Es el mejor punto de partida para:
- programación a escala de repositorio y depuración compleja;
- agentes de larga duración con múltiples herramientas;
- análisis científico y de ciberseguridad dentro de usos autorizados;
- investigación compleja y artefactos profesionales;
- tareas donde un resultado fallido cuesta mucho más que la factura de tokens.
Sol no es automáticamente la mejor opción predeterminada para tráfico de gran volumen. Sus tarifas oficiales de tokens son el doble que las de Terra y cinco veces las de Luna.
Elige GPT-5.6 Terra como opción equilibrada predeterminada
Terra está diseñado para el trabajo diario en producción. Encaja en:
- copilotos de programación y revisión de código;
- análisis de documentos y apoyo a la investigación;
- asistentes internos;
- flujos con herramientas que necesitan más fiabilidad que un modelo ligero;
- productos que quieren capacidad GPT-5.6 sin el precio de Sol.
Las puntuaciones de Terra en benchmarks se mantienen cerca de Sol en varias evaluaciones de programación, lo que lo convierte en un candidato razonable para las primeras pruebas en producción.
Elige GPT-5.6 Luna para rendimiento y tareas predecibles
Luna es el nivel más rápido y económico. Está pensado para:
- extracción y clasificación;
- procesamiento de contenido estructurado;
- soporte ligero;
- automatización de gran volumen;
- una primera fase de enrutamiento que escale solicitudes difíciles.
Luna también puede encargarse de algunas tareas de programación y profesionales, pero las medias de los benchmarks no deberían decidir ese límite. Prueba dónde su tasa de fallos o reintentos empieza a eliminar el ahorro de tokens.
Precios de la API de GPT-5.6
OpenAI establece el precio de GPT-5.6 por cada 1 millón de tokens. Poyo.ai ofrece actualmente los tres niveles mediante la Responses API con las siguientes tarifas.
| Modelo | Entrada OpenAI | Salida OpenAI | Entrada Poyo.ai | Salida Poyo.ai |
|---|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | $0.056 | $0.336 |
| GPT-5.6 Terra | $2.00 | $12.00 | $0.56 | $3.36 |
| GPT-5.6 Sol | $5.00 | $30.00 | $1.40 | $8.40 |
OpenAI también documenta puntos de almacenamiento en caché explícitos, una vida mínima de caché de 30 minutos, escrituras en caché a 1.25 veces la tarifa de entrada sin caché y lecturas de caché con un descuento del 90% respecto a la entrada sin caché.
Consulta la página del modelo GPT-5.6 API para conocer los precios actuales de Poyo, los IDs de modelos compatibles y el acceso a la API.
Comparación de costes con cargas de trabajo reales
Considera una carga mensual con 10 millones de tokens de entrada sin caché y 2 millones de tokens de salida.
| Modelo y ruta | Coste de entrada | Coste de salida | Total |
|---|---|---|---|
| Luna en OpenAI | $10.00 | $12.00 | $22.00 |
| Luna en Poyo.ai | $2.80 | $3.36 | $6.16 |
| Terra en OpenAI | $25.00 | $30.00 | $55.00 |
| Terra en Poyo.ai | $7.00 | $8.40 | $15.40 |
| Sol en OpenAI | $50.00 | $60.00 | $110.00 |
| Sol en Poyo.ai | $14.00 | $16.80 | $30.80 |
Este cálculo es útil, pero incompleto. Supone que todos los modelos completan las mismas tareas con el mismo número de intentos.
Puntuación del benchmark frente a coste por tarea completada correctamente
La métrica de producción más útil es:
effective task cost =
average API cost per attempt
× average attempts per successful task
+ human correction cost
Supongamos que Luna cuesta una quinta parte que Sol por token, pero un flujo de trabajo difícil solo tiene éxito en uno de cada tres intentos. Terra podría completar la misma tarea una vez, con menos llamadas a herramientas y menos revisión humana. En ese caso, Terra sería la opción de producción más económica aunque su tarifa de tokens sea superior.
Mide al menos:
- tasa de éxito;
- intentos por éxito;
- tokens de entrada y salida;
- tiempo transcurrido;
- llamadas a herramientas;
- minutos de corrección humana;
- tasa de errores graves.
La última métrica importa en flujos donde una respuesta incorrecta es más costosa que una solicitud fallida.
Una estrategia práctica de enrutamiento para GPT-5.6
Una familia de tres niveles es más valiosa cuando la aplicación distribuye el trabajo de forma deliberada.
Is the task repetitive and easy to verify?
├── Yes: start with Luna
└── No
├── Is it normal production coding, analysis, or tool use?
│ └── Start with Terra
└── Is failure expensive or the task unusually difficult?
└── Use Sol
Un enrutador de producción puede utilizar el tipo de tarea, el valor de la solicitud, fallos anteriores, señales de confianza o resultados de evaluación. Un patrón habitual es:
- Enviar solicitudes estructuradas y de bajo riesgo a Luna.
- Usar Terra como modelo predeterminado para razonamiento general en producción.
- Escalar casos fallidos o de alto valor a Sol.
- Comparar el coste final por tarea completada correctamente según la ruta.
No enrutes únicamente según la longitud del prompt. Un problema corto de seguridad puede ser más difícil que una solicitud larga de extracción.
Cómo evaluar GPT-5.6 en tu aplicación
Crea un conjunto de evaluación a partir de tráfico real en lugar de prompts genéricos.
- Selecciona entre 30 y 100 tareas representativas.
- Etiqueta el resultado esperado y los modos de fallo inaceptables.
- Ejecuta la misma tarea en Luna, Terra y Sol con configuraciones comparables.
- Registra calidad, latencia, tokens, herramientas, reintentos y correcciones humanas.
- Segmenta los resultados por tipo de tarea.
- Elige reglas de enrutamiento a partir de los resultados segmentados.
- Repite el proceso después de actualizar prompts, herramientas o modelos.
Para agentes, incluye casos difíciles: respuestas incorrectas de herramientas, datos ambiguos, archivos ausentes y tareas que requieren autocorrección. Las demostraciones sencillas suelen ocultar la diferencia entre niveles de modelo.
Cómo usar GPT-5.6 en Poyo.ai
Poyo.ai expone los IDs de modelo gpt-5-6-luna, gpt-5-6-terra y gpt-5-6-sol mediante /v1/responses.
curl https://api.poyo.ai/v1/responses \
-H "Authorization: Bearer $POYO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5-6-terra",
"input": "Review this migration plan and identify the highest-risk assumptions.",
"reasoning": {"effort": "medium"}
}'
Crea una clave en el panel de Poyo y revisa la página del modelo GPT-5.6 antes de usarlo en producción.
¿Qué modelo GPT-5.6 deberías elegir?
Empieza con Luna cuando importen el rendimiento y una verificación sencilla. Empieza con Terra para programación general, análisis y agentes en producción. Usa Sol cuando el problema sea especialmente difícil o un fallo tenga un coste empresarial elevado.
La mejor respuesta rara vez es elegir un único modelo de forma permanente. GPT-5.6 está estructurado como una familia, y el diseño económico más sólido utiliza los distintos niveles conjuntamente.
Preguntas frecuentes
¿Qué modelo GPT-5.6 es el mejor?
Sol es el nivel con más capacidad, pero Terra puede ofrecer un mejor equilibrio para producción y Luna es considerablemente más barato para tareas sencillas y de gran volumen.
¿Es GPT-5.6 Luna bueno para programación?
Luna puede realizar tareas de programación, pero los resultados publicados quedan por detrás de Terra y Sol en las evaluaciones de programación seleccionadas. Pruébalo con tu repositorio real y escala las tareas que no superen la verificación.
¿Cuánto cuesta la API de GPT-5.6?
Las tarifas oficiales de OpenAI van desde $1 de entrada y $6 de salida por 1 millón de tokens para Luna hasta $5 de entrada y $30 de salida para Sol. Poyo.ai ofrece actualmente tarifas de pago por uso más bajas para los tres niveles.
¿GPT-5.6 utiliza la Responses API?
Sí. Poyo.ai expone los tres IDs de modelo GPT-5.6 mediante /v1/responses.
¿Debería sustituir GPT-5.5 por GPT-5.6 Terra?
Terra es un candidato sólido para la migración, pero compara el éxito de las tareas, la latencia, los tokens y las llamadas a herramientas en un conjunto de evaluación representativo antes de cambiar todo el tráfico.


