xAI ha pubblicato Grok 4.6, un riaddestramento di Grok 4.5 orientato alla programmazione e ai compiti lunghi. Nei confronti indipendenti raggiunge per la prima volta il livello di GPT-5.6 Sol. Su ChatX costa però solo circa un terzo. L’articolo mostra i numeri, spiega la particolarità del ragionamento e dice quando il più piccolo Grok 4.3 resta la scelta migliore.
Grok 4.5 contro 4.6 in numeri
Grok 4.6 non è una nuova generazione di modelli. È un addestramento più lungo di Grok 4.5 con dati scelti per ragionamento, sviluppo software e argomenti tecnici. I progressi si misurano in diversi test:
| Test | Grok 4.5 | Grok 4.6 | Che cosa misura |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 | punteggio complessivo di dieci test |
| DeepSWE | 54,0 % | 65,9 % | compiti software svolti in autonomia |
| FrontierCode | 56,6 % | 61,3 % | problemi di programmazione difficili |
| CursorBench | 66,7 % | 69,9 % | modifiche al codice in progetti reali |
| GDPval | 1.526 | 1.753 | lavoro professionale della conoscenza |
Il salto più grande è su DeepSWE, cioè sui compiti che il modello porta avanti da solo per molti passaggi. Proprio lì Grok 4.5 era debole.
Dove si colloca Grok 4.6
Nell’Intelligence Index, Grok 4.6 è alla pari con GPT-5.6 Sol. Non arriva a GPT-6 Astra, Claude Opus 5.5 o Fable 5.1, ma per molti compiti la distanza è abbastanza piccola da giustificare la differenza di prezzo. Secondo i listini dei fornitori, l’output di Grok 4.6 costa circa un terzo di quello di Sol e circa un terzo anche di quello di Opus 5.5. ChatX conteggia con gli stessi prezzi, quindi a parità di lunghezza della risposta il rapporto vale anche per i tuoi token.
Questo rende Grok 4.6 interessante per chi finora usava Sol per programmare o per ricerche tecniche. Nei testi che richiedono stile e tono, Sol resta avanti. Nel codice, nello sviluppo web e nelle analisi a più passaggi, nei nostri confronti la differenza si nota appena.
Il modello ragiona sempre
Grok 4.6 è un modello di puro ragionamento. Pensa prima di ogni risposta, con profondità bassa, media o alta, ma sempre. Su ChatX questo modello offre quindi esattamente questi tre livelli. Non esiste un «Disattivato», perché xAI non permette di spegnere il ragionamento sulla 4.6. I passaggi di ragionamento restano invisibili, però contano come token di output e pesano sul consumo.
Per domande brevi significa un po’ più di attesa e qualche token in più rispetto a un modello che risponde subito. Per la maggior parte dei compiti basta «Bassa». «Alta» conviene con errori intricati o con compiti che ammettono più soluzioni.
Grok 4.6 o Grok 4.3
- Grok 4.3: risponde senza passaggi di ragionamento, costa meno della metà di Grok 4.6 e su ChatX è accessibile anche agli ospiti. Con un milione di token ha una finestra di contesto doppia. La scelta giusta per traduzioni, testi brevi, riassunti e domande con una risposta univoca.
- Grok 4.6: per utenti registrati, con comprensione delle immagini e profondità di ragionamento selezionabile. La scelta giusta per programmazione, sviluppo web, domande tecniche e tutto ciò che richiede più passaggi.
- La prova: un compito che Grok 4.3 risolve in modo diverso al secondo tentativo rispetto al primo è un compito per Grok 4.6.
Con Grok 4.6 l’offerta di xAI diventa per la prima volta una vera alternativa per il lavoro, a patto di accettare che il modello ragioni sempre prima di rispondere.
