xAI heeft Grok 4.6 uitgebracht, een hertraining van Grok 4.5 met de nadruk op programmeren en langlopende taken. In onafhankelijke vergelijkingen haalt het model voor het eerst het niveau van GPT-5.6 Sol. Op ChatX kost het daarbij maar ongeveer een derde. Dit artikel laat de cijfers zien, legt de eigenaardigheid rond het denken uit en vertelt wanneer het kleinere Grok 4.3 de betere keuze blijft.
Grok 4.5 tegenover 4.6 in cijfers
Grok 4.6 is geen nieuwe modelgeneratie. Het is een langere trainingsronde op Grok 4.5 met data die gericht is gekozen voor redeneren, softwareontwikkeling en technische onderwerpen. De vooruitgang is in meerdere tests meetbaar:
| Test | Grok 4.5 | Grok 4.6 | Wat er gemeten wordt |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 | totaalscore uit tien losse tests |
| DeepSWE | 54,0 % | 65,9 % | softwaretaken die het model zelf afhandelt |
| FrontierCode | 56,6 % | 61,3 % | moeilijke programmeeropgaven |
| CursorBench | 66,7 % | 69,9 % | codewijzigingen in echte projecten |
| GDPval | 1.526 | 1.753 | professioneel kenniswerk |
De grootste sprong zit bij DeepSWE, dus bij taken die het model over veel stappen zelfstandig uitvoert. Precies daar was Grok 4.5 zwak.
Waar Grok 4.6 staat
In de Intelligence Index staat Grok 4.6 gelijk met GPT-5.6 Sol. Aan GPT-6 Astra, Claude Opus 5.5 of Fable 5.1 komt het niet, maar voor veel taken is het verschil klein genoeg om het prijsverschil te rechtvaardigen. Volgens de prijzen van de aanbieders kost de uitvoer van Grok 4.6 ongeveer een derde van die van Sol en ook ongeveer een derde van die van Opus 5.5. ChatX rekent met dezelfde prijzen, dus bij een even lang antwoord geldt die verhouding ook voor jouw tokens.
Daarmee wordt Grok 4.6 interessant voor iedereen die Sol tot nu toe gebruikte om te programmeren of voor technisch opzoekwerk. Bij teksten met stijl en toon blijft Sol voorop. Bij code, webontwikkeling en analyses met meerdere stappen is het verschil in onze vergelijkingen nauwelijks te zien.
Het model denkt altijd
Grok 4.6 is een zuiver redeneermodel. Het denkt voor elk antwoord na, met lage, gemiddelde of hoge diepte, maar altijd. Op ChatX staan bij dit model daarom precies die drie niveaus. Een «Uit» is er niet, omdat xAI het denken bij 4.6 niet laat uitschakelen. De denkstappen zelf blijven onzichtbaar, maar ze tellen mee als uitvoertokens en zijn terug te zien in het verbruik.
Bij korte vragen betekent dat iets meer wachttijd en wat meer tokens dan bij een model dat meteen antwoordt. Voor de meeste taken is «Laag» genoeg. «Hoog» loont bij lastige fouten of bij taken met meerdere mogelijke oplossingen.
Grok 4.6 of Grok 4.3
- Grok 4.3: antwoordt zonder denkstappen, kost minder dan de helft van Grok 4.6 en is op ChatX ook voor gasten beschikbaar. Met een miljoen tokens is het contextvenster twee keer zo groot. De juiste keuze voor vertalingen, korte teksten, samenvattingen en vragen met één duidelijk antwoord.
- Grok 4.6: voor geregistreerde gebruikers, met beeldbegrip en instelbare denkdiepte. De juiste keuze voor programmeren, webontwikkeling, technische vragen en alles wat meerdere stappen kost.
- De test: een taak die Grok 4.3 bij de tweede poging anders oplost dan bij de eerste, is een taak voor Grok 4.6.
Met Grok 4.6 wordt het aanbod van xAI voor het eerst een echt alternatief voor werk, zolang je accepteert dat het model altijd eerst nadenkt.
