guides

Benchmark di GPT-5.6 spiegati: Sol vs Terra vs Luna, prezzi e casi d'uso migliori

Poyo.ai Team
11 min read
Share:

GPT-5.6 Confronto benchmark Sol, Terra e Luna

La famiglia GPT-5.6 di OpenAI dispone di tre livelli di capacità durevoli: Sol per il lavoro più duro, Terra per carichi di lavoro di produzione bilanciati e Luna per traffico veloce e sensibile ai costi. La storia di riferimento non è semplicemente che Sol vince. Terra e Luna spesso mantengono gran parte delle capacità pur utilizzando token a basso prezzo, rendendo il routing del modello più importante rispetto alla scelta di un modello per ogni richiesta.

OpenAI ha rilasciato l'intera famiglia GPT-5.6 il 9 luglio 2026. Questa guida spiega i risultati dei benchmark pubblicati, cosa misurano e come combinare qualità, prezzo, latenza e frequenza di tentativi quando si seleziona un modello.

Dati e prezzi controllati il 19 luglio 2026. I risultati del benchmark provengono dai materiali di lancio di OpenAI e utilizzano le impostazioni ivi descritte. Non costituiscono garanzie dirette per un'applicazione o un framework dell'agente diverso.

La tabella seguente si concentra sulle valutazioni professionali e di codifica rappresentative.

ValutazioneSolTerraLunaGPT-5.5Cosa misura
Agent's Last Exam52.7%50.4%50.3%46.9%Flussi di lavoro professionali di lunga durata
Artificial Analysis Intelligence Index58.955.051.254.8Ampia intelligenza nel lavoro degli agenti, nella codifica e nel ragionamento
Coding Agent Index80.077.474.676.4Implementazione, utilizzo del terminale e basi di codice reali
SWE-Bench Pro64.6%63.4%62.7%59.4%Risoluzione dei problemi di ingegneria del software
DeepSWE 1.172.7%69.6%67.2%67.0%Ingegneria a lungo orizzonte in basi di codice reali
Terminal-Bench 2.188.8%87.4%84.7%85.6%Flussi di lavoro complessi da riga di comando

Sol guida attraverso queste valutazioni selezionate. Terra rimane vicina a diverse attività di codifica. Luna non è universalmente più forte di GPT-5.5, ma rimane competitivo pur occupando il livello GPT-5.6 più veloce e meno costoso.

La tabella illustra anche perché un singolo punteggio medio non è sufficiente. Un classificatore di supporto, un agente di revisione del codice, un flusso di lavoro di ricerca finanziaria e un operatore del browser non apprezzano le stesse funzionalità.

Cosa misurano effettivamente i benchmark GPT-5.6

Benchmark degli agenti di codifica

I parametri di riferimento della codifica variano sostanzialmente. Alcuni testano se un modello può produrre una patch. Altri includono l'esplorazione del repository, i comandi del terminale, l'esecuzione dei test e la correzione iterativa.

OpenAI segnala che GPT-5.6 Sol ha raggiunto 80 nell'indice dell'agente di codifica dell'analisi artificiale utilizzando meno token e meno tempo rispetto a diverse alternative di frontiera nel suo confronto. Terra ha ottenuto 77.4 e Luna 74.6. Per un agente di codifica di produzione, le domande di follow-up importanti sono:

  • Trova i file corretti?
  • Conserva le convenzioni del progetto?
  • Esegue e interpreta i test?
  • Si riprende dopo un approccio fallito?
  • Quanti giri del modello sono necessari prima di ottenere un risultato verificato?

Un modello con un punteggio di patch leggermente più alto può comunque essere meno economico se produce lunghe tracce di ragionamento, ripete chiamate a strumenti o necessita di costose revisioni umane.

Benchmark degli agenti a lungo orizzonte

L'ultimo esame degli agenti valuta i flussi di lavoro professionali più lunghi in molti domini. Sol ha ottenuto 52.7%, mentre Terra e Luna hanno ottenuto 50.4% e 50.3%. Il differenziale ristretto è notevole: suggerisce che molte attività professionali potrebbero non richiedere il livello di punta.

Le valutazioni a lungo orizzonte sono particolarmente sensibili al sistema circostante. La progettazione dello strumento, la memoria, le policy di ripetizione, le autorizzazioni e i passaggi di verifica possono modificare i risultati tanto quanto il modello di base.

Navigazione e utilizzo del computer

OpenAI segnala 92.2% per GPT-5.6 Sol su BrowseComp e 62.6% su OSWorld 2.0. Questi risultati supportano gli agenti di ricerca, i flussi di lavoro dei browser e le applicazioni che devono controllare il proprio output.

I benchmark sull’uso del computer non dovrebbero essere interpretati come una promessa di affidabilità incustodita. I sistemi di produzione necessitano ancora di autorizzazioni mirate, conferma di azioni importanti, timeout e comportamento di ripristino.

Lavoro di conoscenza e artefatti

GPT-5.6 è posizionato anche per documenti, fogli di calcolo, presentazioni, brief di ricerca e lavoro frontend. Questi risultati sono difficili da acquisire con un benchmark perché la correttezza, la fedeltà della fonte, la qualità visiva e la modificabilità sono tutte cose importanti.

Per questi carichi di lavoro, crea una rubrica interna. Assegna un punteggio all'accuratezza fattuale, alla struttura, all'aderenza a un modello di riferimento, al numero di correzioni manuali e al tempo necessario per ottenere un risultato finale accettabile.

GPT-5.6 Sol vs Terra vs Luna

Scegli GPT-5.6 Sol per problemi difficili di alto valore

Sol è il livello di punta. È il miglior punto di partenza per:

  • codifica su scala di repository e debug difficile;
  • agenti di lunga durata con più strumenti;
  • sicurezza informatica e analisi scientifiche nell'ambito degli usi autorizzati;
  • ricerche complesse e artefatti professionali;
  • attività in cui un risultato fallito costa molto di più della costo dei token.

Sol non è automaticamente l'impostazione predefinita migliore per il traffico ad alto volume. I suoi tassi ufficiali di token sono due volte quelli di Terra e cinque volte quelli di Luna.

Scegli GPT-5.6 Terra come impostazione predefinita bilanciata

Terra è progettata per il lavoro produttivo quotidiano. Si adatta:

  • codifica dei copiloti e revisione del codice;
  • analisi documentale e supporto alla ricerca;
  • assistenti interni;
  • flussi di lavoro che utilizzano strumenti che richiedono maggiore affidabilità rispetto a un modello leggero;
  • prodotti che richiedono la funzionalità GPT-5.6 senza prezzo Sol.

I punteggi dei benchmark di Terra rimangono vicini a Sol in diverse valutazioni di codifica, rendendolo un primo candidato sensato per i test di produzione.

Scegli GPT-5.6 Luna per produttività e attività prevedibili

Luna è il livello più veloce e conveniente. È adatto a:

  • estrazione e classificazione;
  • elaborazione strutturata dei contenuti;
  • supporto leggero;
  • automazione ad alto volume;
  • una prima fase di routing che intensifica le richieste difficili.

Luna può anche gestire alcune attività di codifica e professionali, ma le medie dei benchmark non dovrebbero decidere questo limite. Testa il punto in cui il tasso di errore o di tentativi inizia a cancellare il risparmio del token.

Prezzi GPT-5.6 API

OpenAI valuta GPT-5.6 per 1 milione di token. Poyo.ai attualmente fornisce tutti e tre i livelli tramite la Responses API alle tariffe seguenti.

ModelloIngresso OpenAIOutput OpenAIInput Poyo.aiOutput Poyo.ai
GPT-5.6 Luna$0.20$1.20$0.056$0.336
GPT-5.6 Terra$2.00$12.00$0.56$3.36
GPT-5.6 Sol$5.00$30.00$1.40$8.40

OpenAI documenta inoltre punti di interruzione della cache espliciti, una durata minima della cache di 30 minuti, scritture nella cache a 1.25 volte la velocità di input non nella cache e letture nella cache con uno sconto 90% da input non nella cache.

Controlla la pagina del modello GPT-5.6 API per i prezzi attuali di Poyo, gli ID dei modelli supportati e l'accesso all'API.

Confronto dei costi reali del carico di lavoro

Considera un carico di lavoro mensile con 10 milioni di token di input non memorizzati nella cache e 2 milioni di token di output.

Modello e percorsoCosto di inputCosto di outputTotale
Luna su OpenAI$10.00$12.00$22.00
Luna su Poyo.ai$2.80$3.36$6.16
Terra su OpenAI$25.00$30.00$55.00
Terra su Poyo.ai$7.00$8.40$15.40
Sol su OpenAI$50.00$60.00$110.00
Sol su Poyo.ai$14.00$16.80$30.80

Questo calcolo è utile ma incompleto. Si presuppone che ogni modello completi lo stesso numero di attività con lo stesso numero di tentativi.

Punteggio di riferimento rispetto al costo per attività riuscita

La metrica di produzione più utile è:

effective task cost =
  average API cost per attempt
  × average attempts per successful task
  + human correction cost

Supponiamo che Luna costi un quinto del Sol per token, ma un flusso di lavoro difficile abbia successo solo in uno dei tre tentativi. Terra potrebbe completare la stessa attività una volta, con meno interventi sugli strumenti e meno revisioni umane. Terra sarebbe quindi la scelta di produzione più economica anche se il suo tasso di token è più alto.

Misura almeno:

  • tasso di superamento;
  • tentativi per passaggio;
  • token di ingresso e di uscita;
  • tempo trascorso;
  • chiamate agli strumenti;
  • minuti di correzione umana;
  • tasso di errore grave.

L'ultima metrica è importante per i flussi di lavoro in cui una risposta errata è più costosa di una richiesta non riuscita.

Una pratica strategia di routing GPT-5.6

Una famiglia a tre livelli è più preziosa quando i percorsi applicativi funzionano deliberatamente.

Is the task repetitive and easy to verify?
├── Yes: start with Luna
└── No
    ├── Is it normal production coding, analysis, or tool use?
    │   └── Start with Terra
    └── Is failure expensive or the task unusually difficult?
        └── Use Sol

Un router di produzione può utilizzare il tipo di attività, il valore della richiesta, gli errori precedenti, i segnali di confidenza o l'output del valutatore. Uno schema comune è:

  1. Invia richieste strutturate e a basso rischio a Luna.
  2. Usa Terra come impostazione predefinita per il ragionamento generale sulla produzione.
  3. Inoltra i casi falliti o di alto valore a Sol.
  4. Confronta il costo finale per attività riuscita per percorso.

Non instradare esclusivamente sulla lunghezza richiesta. Un breve problema di sicurezza può essere più difficile di una lunga richiesta di estrazione.

Come valutare GPT-5.6 nella tua applicazione

Costruisci un set di valutazione dal traffico reale anziché da prompt generici.

  1. Seleziona le attività rappresentative da 30 a 100.
  2. Etichetta il risultato atteso e le modalità di fallimento inaccettabili.
  3. Esegui la stessa attività su Luna, Terra e Sol con impostazioni comparabili.
  4. Registra qualità, latenza, token, strumenti, tentativi e correzioni umane.
  5. Segmenta i risultati per tipo di attività.
  6. Scegli le regole di routing dai risultati del segmento.
  7. Ripeti dopo gli aggiornamenti di prompt, strumenti o modelli.

Per gli agenti, includi casi difficili: risposte dello strumento non funzionanti, dati ambigui, file mancanti e attività che richiedono l'autocorrezione. Le demo semplici tendono a nascondere la differenza tra i livelli di modello.

Come utilizzare GPT-5.6 su Poyo.ai

Poyo.ai espone gli ID modello gpt-5-6-luna, gpt-5-6-terra e gpt-5-6-sol tramite /v1/responses.

curl https://api.poyo.ai/v1/responses \
  -H "Authorization: Bearer $POYO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5-6-terra",
    "input": "Review this migration plan and identify the highest-risk assumptions.",
    "reasoning": {"effort": "medium"}
  }'

Crea una chiave nel dashboard Poyo ed esaminare la pagina del modello GPT-5.6 prima dell'uso in produzione.

Quale modello GPT-5.6 dovresti scegliere?

Inizia con Luna quando la produttività e la facilità di verifica sono importanti. Inizia con Terra per agenti generali di codifica, analisi e produzione. Utilizza Sol quando il problema è insolitamente difficile o il fallimento ha un costo aziendale elevato.

La risposta migliore è raramente la scelta permanente di un unico modello. GPT-5.6 è strutturato come una famiglia e il design economico più forte utilizza i livelli insieme.

Domande frequenti

Quale modello GPT-5.6 è il migliore?

Sol è il livello più capace, ma Terra può offrire un migliore equilibrio di produzione e Luna è sostanzialmente più economica per compiti semplici e ad alto volume.

GPT-5.6 Luna è adatto alla codifica?

Luna è in grado di codificare il lavoro, ma i risultati pubblicati seguono Terra e Sol nelle valutazioni di codifica selezionate. Testalo sul tuo repository attuale e intensifica le attività che non superano la verifica.

Quanto costa GPT-5.6 API?

Le tariffe ufficiali OpenAI vanno dall'input $1 e l'output $6 per 1 milione di token per Luna all'input $5 e l'output $30 per Sol. Poyo.ai attualmente elenca tariffe a consumo inferiori per tutti e tre i livelli.

GPT-5.6 utilizza la Responses API?

Sì. Poyo.ai espone i tre ID modello GPT-5.6 tramite /v1/responses.

Dovrei sostituire GPT-5.5 con GPT-5.6 Terra?

Terra è un ottimo candidato alla migrazione, ma confronta il successo delle attività, la latenza, i token e le chiamate agli strumenti su un set di valutazione rappresentativo prima di modificare tutto il traffico.

Fonti

Share: