GPT-6 Astra is sinds begin september de opvolger van GPT-5.6 Sol en kost ongeveer tweeënhalf keer zoveel. De vraag is dus niet of Astra beter is, maar waar het verschil groot genoeg is om de meerprijs te rechtvaardigen. We hebben de officiële cijfers vergeleken met de andere topmodellen op ChatX en er een paar regels uit afgeleid voor wanneer de overstap loont.
Astra naast Sol, Opus 5.5 en Fable 5.1
| GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Prijs per token bij de aanbieder (Sol = 1) | ≈ 2,5× | 1× | 1× | ≈ 2,5× |
| Denkdiepte | instelbaar, standaard «Laag» | instelbaar, standaard «Uit» | instelbaar vanaf «Laag», geen «Uit» | instelbaar vanaf «Laag», geen «Uit» |
| Zoeken op het web / afbeeldingen | ja / ja | ja / ja | ja / ja | nee / ja |
| Sterk punt | wiskunde, lange taken met veel stappen, betrouwbaarheid | dagelijks werk en veeleisende teksten | programmeren, analyse | de moeilijkste losse gevallen |
De prijsregel geeft de verhouding tussen de officiële tarieven van de aanbieders voor invoer en uitvoer. ChatX geeft die verschillen door, dus bij een even lang antwoord geldt de verhouding ook voor de afgeschreven tokens. Astra en Fable 5.1 liggen op één niveau, Sol en Opus 5.5 samen duidelijk daaronder.
Waar Astra meetbaar voorop ligt
OpenAI noemt drie resultaten die het gat met Sol beschrijven: 98 procent bij FrontierMath Tier 4 (onderzoekswiskunde), 99,9 procent bij ARC-AGI-3 (abstract probleemoplossen) en de koppositie bij Terminal-Bench 4.0, een test voor programmeertaken die over veel stappen lopen. Sol lag bij alle drie duidelijk achter.
Belangrijker dan de records zijn voor gebruikers twee punten uit de system card:
- Minder verzonnen feiten: in de gemelde foutgevallen hallucineert Astra minder vaak dan Sol. Bij opzoekwerk, samenvattingen van vakteksten en werken met cijfers is dat het duidelijkste verschil.
- Beter bestand tegen ingeslopen instructies (prompt injections): wie webpagina’s, pdf’s of e-mails in de chat zet, krijgt minder vaak antwoorden die door verborgen opdrachten in dat materiaal worden gestuurd. In programmeersimulaties telt OpenAI ongeveer half zoveel kritieke misstappen als bij Sol.
Onafhankelijke testers melden wel dat Astra bij heel lange taken nieuwe fouten inbouwt waarvan het opsporen tijd kost. Het resultaat controleren blijft verplicht, juist omdat het model zo zelfverzekerd formuleert.
Wanneer Astra de meerprijs waard is
Uit de vergelijking volgen op ChatX een paar eenvoudige regels:
- Lange documenten: bij contracten, studies of hele codebases van enkele honderdduizenden tokens houdt Astra alles in één aanvraag, met ongeveer een miljoen tokens context. Sol kapt eerder af.
- Cijfers en logica: financiële modellen, statistiek, bewijzen en alles waar een rekenfout duur uitpakt. Het verschil bij FrontierMath is hier in de praktijk merkbaar.
- Niet voor korte taken: e-mails, vertalingen, samenvattingen en feitenvragen beantwoordt Sol net zo goed, en vaak volstaan Luna en Terra, tegen een fractie van de kosten.
- Kies de denkdiepte bewust: Astra start op «Laag». «Hoog» loont alleen als de taak meerdere oplossingen kent. Bij eenvoudige vragen kost het wachttijd en tokens zonder een beter resultaat.
- Benut de antwoordlengte: op ChatX mag een antwoord tot 15.000 tokens lang zijn. Wil je een volledige uitwerking, zeg dat dan in de prompt («volledig, niet inkorten»), anders vat Astra net als Sol graag samen.
Een praktische test: geef dezelfde taak één keer aan Sol en één keer aan Astra en lees de antwoorden naast elkaar. Springt het verschil niet meteen in het oog, dan was Sol de juiste keuze.
