Grok 4.6 holt bei Coding zu Sol auf

Grok 4.6 raggiunge Sol nella programmazione

xAI ha pubblicato Grok 4.6, un riaddestramento di Grok 4.5 orientato alla programmazione e ai compiti lunghi. Nei confronti indipendenti raggiunge per la prima volta il livello di GPT-5.6 Sol. Su ChatX costa però solo circa un terzo. L’articolo mostra i numeri, spiega la particolarità del ragionamento e dice quando il più piccolo Grok 4.3 resta la scelta migliore.

Grok 4.5 contro 4.6 in numeri

Grok 4.6 non è una nuova generazione di modelli. È un addestramento più lungo di Grok 4.5 con dati scelti per ragionamento, sviluppo software e argomenti tecnici. I progressi si misurano in diversi test:

Test Grok 4.5 Grok 4.6 Che cosa misura
Artificial Analysis Intelligence Index 56 61 punteggio complessivo di dieci test
DeepSWE 54,0 % 65,9 % compiti software svolti in autonomia
FrontierCode 56,6 % 61,3 % problemi di programmazione difficili
CursorBench 66,7 % 69,9 % modifiche al codice in progetti reali
GDPval 1.526 1.753 lavoro professionale della conoscenza

Il salto più grande è su DeepSWE, cioè sui compiti che il modello porta avanti da solo per molti passaggi. Proprio lì Grok 4.5 era debole.

Dove si colloca Grok 4.6

Nell’Intelligence Index, Grok 4.6 è alla pari con GPT-5.6 Sol. Non arriva a GPT-6 Astra, Claude Opus 5.5 o Fable 5.1, ma per molti compiti la distanza è abbastanza piccola da giustificare la differenza di prezzo. Secondo i listini dei fornitori, l’output di Grok 4.6 costa circa un terzo di quello di Sol e circa un terzo anche di quello di Opus 5.5. ChatX conteggia con gli stessi prezzi, quindi a parità di lunghezza della risposta il rapporto vale anche per i tuoi token.

Questo rende Grok 4.6 interessante per chi finora usava Sol per programmare o per ricerche tecniche. Nei testi che richiedono stile e tono, Sol resta avanti. Nel codice, nello sviluppo web e nelle analisi a più passaggi, nei nostri confronti la differenza si nota appena.

Il modello ragiona sempre

Grok 4.6 è un modello di puro ragionamento. Pensa prima di ogni risposta, con profondità bassa, media o alta, ma sempre. Su ChatX questo modello offre quindi esattamente questi tre livelli. Non esiste un «Disattivato», perché xAI non permette di spegnere il ragionamento sulla 4.6. I passaggi di ragionamento restano invisibili, però contano come token di output e pesano sul consumo.

Per domande brevi significa un po’ più di attesa e qualche token in più rispetto a un modello che risponde subito. Per la maggior parte dei compiti basta «Bassa». «Alta» conviene con errori intricati o con compiti che ammettono più soluzioni.

Grok 4.6 o Grok 4.3

  • Grok 4.3: risponde senza passaggi di ragionamento, costa meno della metà di Grok 4.6 e su ChatX è accessibile anche agli ospiti. Con un milione di token ha una finestra di contesto doppia. La scelta giusta per traduzioni, testi brevi, riassunti e domande con una risposta univoca.
  • Grok 4.6: per utenti registrati, con comprensione delle immagini e profondità di ragionamento selezionabile. La scelta giusta per programmazione, sviluppo web, domande tecniche e tutto ciò che richiede più passaggi.
  • La prova: un compito che Grok 4.3 risolve in modo diverso al secondo tentativo rispetto al primo è un compito per Grok 4.6.

Con Grok 4.6 l’offerta di xAI diventa per la prima volta una vera alternativa per il lavoro, a patto di accettare che il modello ragioni sempre prima di rispondere.


Posted

in

by

Tags: