live
10 labs · 30 models
Tutti gli articoli
9 min di letturaChatPlus Team

Claude Opus 5.5, GPT-6 Sol e Grok 4.7: tre uscite in due giorni e quale modello scegliere

In due giorni, a fine settembre, sono arrivate tre grandi novità: Grok 4.7 di xAI, Claude Opus 5.5 di Anthropic e GPT-6 Sol e Luna di OpenAI. Ecco uno sguardo chiaro a cosa li distingue, dove ciascuno dà davvero il meglio e quale scegliere per il tuo lavoro. Tutti e quattro sono già disponibili in ChatPlus.

ModelliAnthropicOpenAIxAINotizie
La mascotte Max fluttua nello spazio sopra il bordo di un pianeta, allungandosi verso tre schede olografiche con i loghi e le etichette "Anthropic — Claude Opus 5.5", "OpenAI — GPT-6 Sol · Luna" e "xAI — Grok 4.7". Immagine di copertina per un articolo sui nuovi modelli
Ascolta l’articolo00:00

Il 21 settembre, xAI ha rilasciato Grok 4.7. Il giorno dopo, Anthropic ha presentato Claude Opus 5.5, mentre OpenAI ha lanciato GPT-6 Sol e GPT-6 Luna. Tre laboratori, quattro modelli, due giorni. Difficile definirla una coincidenza: la corsa è così serrata che nessuno vuole lasciare un concorrente da solo sulle prime pagine nemmeno per una settimana.

La versione breve: Opus 5.5 è il più forte tra i nuovi rilasci e, secondo misurazioni indipendenti, al momento è il miglior modello sul mercato in assoluto. GPT-6 Sol è migliorato pochissimo in intelligenza grezza, ma costa la metà e commette meno errori fattuali. Luna è leggero e molto conveniente. Grok 4.7 è un grande passo avanti per xAI, ma per ora resta ancora nella seconda fascia, anche se a un prezzo interessante. Ecco i dettagli e le cautele oneste per ciascuno.

Quattro modelli in sintesi

Per orientarti, ecco le specifiche principali. I prezzi sono indicati per milione di token API, così puoi vedere quali modelli sono costosi; ChatPlus non addebita i token separatamente, perché è tutto incluso nell’abbonamento.

ModelloSviluppatoreInput / output, $ContestoIdeale per
Claude Opus 5.5Anthropic4 / 201MProgrammazione su progetti lunghi, documenti, scrittura chiara
GPT-6 SolOpenAI2 / 101.05MCodice, agenti, accuratezza fattuale
GPT-6 LunaOpenAI0.10 / 0.501.05MAttività veloci e semplici
Grok 4.7xAI2 / 6500KCodice, ingegneria, diritto

Claude Opus 5.5: prestazioni da Fable senza il prezzo del flagship

Opus 5.5 inaugura la nuova famiglia Claude 5.5. Anthropic riassume il suo vantaggio principale in una frase: il modello offre prestazioni al livello di Claude Fable 5.1 — il modello più capace e più costoso dell’azienda — ma costa il 40% in meno rispetto a Opus 5. I prezzi dei token sono scesi del 20%, e il resto arriva dall’efficienza: il modello usa meno passaggi e meno token per la stessa attività. Genera anche testo oltre il 30% più velocemente del predecessore.

I test indipendenti lo confermano. Nell’indice aggregato di Artificial Analysis, Opus 5.5 ha ottenuto 58 punti alle impostazioni massime: il miglior risultato mai misurato lì, con diversi punti di vantaggio. È in testa quasi ovunque: programmazione agentica (66,4% su Terminal-Bench 4.0 contro il 55,8% di Fable 5.1 e il 57,9% di GPT-6 Astra), lavoro d’ufficio e domande complesse con uso di strumenti.

Ma i numeri dei benchmark dicono poco su come si comporta davvero un modello nel lavoro reale. I racconti dei primi tester sono più illuminanti. Uno ha migrato un progetto da 680.000 righe di codice in meno di un giorno, un’attività che avrebbe richiesto settimane a un team di ingegneri. Un altro ha auditato e riparato una codebase da 200.000 righe in tre ore, mentre Opus 5 aveva impiegato più di venti ore per lo stesso lavoro. In un’altra azienda, Opus 5.5 ha completato in 11 prompt e tre ore un’attività complessa che in precedenza aveva richiesto 38 prompt e quattro giorni. Anthropic ha anche condotto un esperimento interno: ha chiesto a Opus 5.5 e Fable 5.1 di riscrivere HAProxy, un popolare load balancer, da C a Rust. Entrambi ci sono riusciti, ma Opus 5.5 ha finito in 9,5 ore invece di 12 e con un costo dimezzato.

Il secondo grande cambiamento riguarda il modo in cui il modello scrive. Opus 5 veniva spesso criticato per la prolissità: lunghe introduzioni, tono aziendale e il punto principale sepolto al terzo paragrafo. Opus 5.5 mette prima l’idea centrale, scivola meno spesso nel gergo e segue con più affidabilità le regole di stile che gli dai. Un tester l’ha detta semplice: "Scrive come scrivo io." Quando lavori sui testi, te ne accorgi subito: dopo il modello c’è meno da ripulire.

C’è una caratteristica da conoscere in anticipo: non puoi disattivare il reasoning in Opus 5.5. Prima ragiona sempre, poi risponde. Sulle attività complesse è un vantaggio. Per una domanda tipo "come si dice davanzale in inglese?" significa qualche secondo in più di attesa. Per compiti piccoli come questo, un modello più semplice è una scelta migliore.

Su ChatPlus, Claude Opus 5.5 è già disponibile in chat — nel piano Max, insieme ad altri modelli di fascia alta.

GPT-6 Sol: la stessa asticella, a metà prezzo

All’inizio di settembre, OpenAI ha rilasciato il suo flagship GPT-6 Astra, e ora la famiglia GPT-6 si presenta così: Astra in alto, Sol al centro, Luna alla base. Sol è pensato come un modello da lavoro: prende la precisione di Astra e la capacità di portare a termine un’attività, ma costa molto meno.

OpenAI vende Sol puntando sull’affidabilità più che sui record. L’azienda ha preso conversazioni reali in cui gli utenti avevano segnalato errori del modello e ha testato la nuova versione su quelle: Sol sbaglia circa la metà delle volte rispetto a GPT-5.6 Sol e raggiunge l’affidabilità di Astra. Un test indipendente sulle allucinazioni lo conferma, anche se con una precisazione. La quota di risposte inventate è scesa dal 92% al 60%, soprattutto perché il modello rifiuta più spesso di rispondere quando non è sicuro. La quota complessiva di risposte corrette è persino calata leggermente, dal 59% al 54%. Per il lavoro quotidiano, è più una buona notizia che una cattiva: un onesto "non lo so" è meglio di un’invenzione detta con sicurezza.

Nella programmazione, Sol tiene il passo con modelli molto più costosi. Su DeepSWE, un test di lunghe attività ingegneristiche in repository reali, ottiene il 68,8%. Claude Fable 5 ha il punteggio migliore con il 69,9%, ma costa circa cinque volte di più per attività. Su Terminal-Bench 4.0, Sol è passato dal 37% al 43%.

Ora, quello che il comunicato stampa non dice. Nell’indice aggregato di intelligenza, Sol è quasi invariato rispetto al predecessore: 48 punti contro 47. È persino arretrato nel lavoro su documenti d’ufficio e resta dietro sia ad Astra sia al Sol precedente nel controllo del computer. Quindi non è un salto in avanti, ma la stessa soglia di capacità a metà prezzo. Per la maggior parte delle attività è esattamente ciò che serve: coding, ricerca, corrispondenza e analisi. Se ti serve un modello che clicchi da solo dentro le interfacce, scegli Astra.

GPT-6 Sol è disponibile con il nostro abbonamento PRO e, dato che costa la metà del Sol precedente, il tuo allowance dura sensibilmente di più nelle conversazioni lunghe. Apri una chat con GPT-6 Sol.

GPT-6 Luna: il modello più piccolo con le conoscenze più aggiornate

OpenAI descrive Luna in modo semplice: un modello per attività ad alto volume con un obiettivo chiaro. Riassumere un documento, estrarre numeri e nomi da un testo, rispondere rapidamente a una domanda. Non c’è nulla di marginale in tutto questo: sono attività che costituiscono gran parte di ciò che le persone fanno ogni giorno con l’AI.

Il prezzo è quasi simbolico: dieci centesimi per milione di token in input e cinquanta centesimi per milione di token in output. È la metà del prezzo in input di GPT-5.6 Luna e quasi due volte e mezzo più economico in output. Nell’indice aggregato di intelligenza, il modello resta al livello del predecessore. È calato leggermente nel coding agentico, ma su DeepSWE alle impostazioni massime arriva al 66,6% per soli 22 centesimi ad attività. Secondo OpenAI, è paragonabile a Claude Opus 5 e Fable 5 con impostazioni medie, costando però il 93–96% in meno.

Un dettaglio interessante: il modello più piccolo della famiglia ha le conoscenze più aggiornate. Luna è stato addestrato su dati fino a maggio 2026, mentre Sol e Astra si fermano ad aprile.

In ChatPlus, GPT-6 Luna è disponibile con l’abbonamento PRO e non consuma il tuo allowance — il limite di 5 ore da cui vengono scalate le richieste ai modelli costosi. Puoi usarlo quanto vuoi senza tenere d’occhio il contatore. Non è la scelta migliore per codice complesso su più file, ma puoi passare a Sol o Opus nella stessa conversazione.

Grok 4.7: grande, in ritardo e sorprendentemente conveniente

Grok 4.7 è arrivato prima degli altri, nonostante fosse atteso da più tempo: Elon Musk ne ha rinviato il rilascio almeno cinque volte, a partire da fine luglio. Il ritardo è comprensibile. Non è un aggiornamento cosmetico, ma un nuovo modello base sostanzialmente più grande: secondo i media, circa 2,1 trilioni di parametri. Ha ricevuto un addestramento di reinforcement learning più lungo, con enfasi su attività che richiedono ore agli esseri umani. xAI ha anche migliorato l’autoverifica: il modello controlla con più attenzione le proprie risposte e gestisce meglio i contesti lunghi. Per inciso, nei materiali ufficiali l’azienda ora si chiama SpaceXAI, anche se i modelli si chiamano ancora Grok.

Il miglioramento rispetto a Grok 4.6 è notevole. Su CursorBench 4.0, un test di lunghe attività di programmazione, il punteggio è salito dal 40,4% al 46,3%. Su Terminal-Bench 4.0 è quasi raddoppiato, dal 20,3% al 37,6%. Nel lavoro d’ufficio su più ore — report, fogli di calcolo, presentazioni — il modello ha guadagnato oltre cento punti Elo. Le prestazioni in ambito legale sono particolarmente sorprendenti: sul benchmark legale Harvey, Grok 4.7 ottiene il 19,6%, quasi tre volte il 6,7% di Claude Fable 5.1. Sul benchmark di ingegneria elettrica EEBench arriva al 64% contro il 56,4% di Fable.

La sua posizione nelle classifiche complessive è più modesta. Nella maggior parte dei confronti, Grok 4.7 è secondo: resta dietro a Fable 5.1 nel lavoro d’ufficio, a GPT-6 Astra nelle attività ingegneristiche e ancora molto lontano da Opus 5.5. I test indipendenti lo collocano a 46 punti nell’indice di intelligenza. È bastato a xAI per entrare tra i primi quattro laboratori, ma non oltre. Musk stesso promette la "classe Astra e Fable" solo con Grok 4.9. Un’altra cautela: alle impostazioni massime, il modello usa più del doppio dei token per attività rispetto a Grok 4.6, quindi lo stesso prezzo per token non significa lo stesso costo per risultato.

Il vantaggio chiave di Grok 4.7 è il rapporto qualità-prezzo. Costa quanto Grok 4.6 — due dollari per milione di token in input e sei per milione di token in output — ed è sensibilmente più economico dei flagship di Anthropic e OpenAI. Grok 4.7 è disponibile su ChatPlus con l’abbonamento PRO.

Quindi quale dovresti scegliere?

Noi la vedremmo così.

Se l’attività è grande e importante — codice complesso, audit di un progetto, report analitico o un documento lungo che richiede ragionamento chiaro — scegli Claude Opus 5.5. Al momento è il modello disponibile più forte e scrive sensibilmente meglio dei Claude precedenti.

Per il lavoro quotidiano in cui serve equilibrio, GPT-6 Sol è una scelta eccellente: codice, ricerca, email e fogli di calcolo. È prudente, allucina meno spesso e consuma meno del tuo allowance.

Per attività piccole come riassunti, traduzioni, risposte brevi di consultazione e bozze, scegli GPT-6 Luna. È veloce e non consuma affatto il tuo allowance.

Grok 4.7 vale la pena provarlo per domande legali e ingegneristiche, dove è sorprendentemente forte, e come secondo parere quando vuoi confrontare la risposta di un altro modello.

Il modo più semplice per confrontarli è farlo sul tuo compito. In ChatPlus puoi cambiare modello a metà conversazione: fai una domanda a Opus, passa a Sol o Grok, invia di nuovo lo stesso prompt e vedi subito chi la gestisce meglio. Sono disponibili pagine dettagliate per Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna e Grok 4.7.

In breve

Quattro nuovi modelli sono arrivati in due giorni. Claude Opus 5.5 è il nuovo leader: capacità al livello di Fable 5.1 al 40% in meno rispetto a Opus 5, coding agentico al vertice della categoria e scrittura sensibilmente più chiara. GPT-6 Sol è migliorato pochissimo in intelligenza, ma costa la metà e commette errori fattuali due volte meno spesso. GPT-6 Luna è un modello molto conveniente per attività semplici, con le conoscenze più aggiornate della famiglia. Grok 4.7 ha fatto un grande balzo in avanti, soprattutto in codice, diritto e ingegneria, ma per ora resta nella seconda fascia — a un prezzo accessibile. Tutti e quattro sono già disponibili in ChatPlus.

Prova i migliori modelli AI su ChatPlus

GPT, Claude, Gemini, GLM e altri modelli AI in un’unica finestra.