Desde o começo de setembro, o GPT-6 Astra é o sucessor do GPT-5.6 Sol e custa cerca de duas vezes e meia mais. A pergunta para quem usa não é, portanto, se o Astra é melhor, mas onde a diferença é grande o suficiente para justificar o acréscimo. Comparamos os números oficiais com os outros modelos de ponta disponíveis no ChatX e tiramos algumas regras sobre quando a troca compensa.
Astra ao lado de Sol, Opus 5.5 e Fable 5.1
| GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Preço por token no fornecedor (Sol = 1) | ≈ 2,5× | 1× | 1× | ≈ 2,5× |
| Profundidade do raciocínio | ajustável, padrão «Baixa» | ajustável, padrão «Desativado» | ajustável a partir de «Baixa», sem «Desativado» | ajustável a partir de «Baixa», sem «Desativado» |
| Busca na web / imagens | sim / sim | sim / sim | sim / sim | não / sim |
| Ponto forte | matemática, tarefas longas de vários passos, confiabilidade | dia a dia e textos exigentes | programação, análise | os casos isolados mais difíceis |
A linha de preços mostra a relação entre os preços oficiais dos fornecedores para entrada e saída. O ChatX repassa essas diferenças, então, com respostas do mesmo tamanho, a proporção vale também para os tokens descontados. Astra e Fable 5.1 estão no mesmo patamar, com Sol e Opus 5.5 bem abaixo.
Onde o Astra está mensuravelmente à frente
A OpenAI cita três resultados que descrevem a distância para o Sol: 98 por cento no FrontierMath Tier 4 (matemática de pesquisa), 99,9 por cento no ARC-AGI-3 (resolução abstrata de problemas) e o primeiro lugar no Terminal-Bench 4.0, um teste de tarefas de programação que se estendem por muitos passos. O Sol ficou claramente atrás em todos.
Mais importantes que os recordes são dois pontos do system card:
- Menos fatos inventados: nos casos de erro registrados, o Astra alucina menos que o Sol. Em pesquisas, resumos de textos técnicos e trabalho com números, essa é a diferença mais perceptível.
- Mais resistente a instruções embutidas (prompt injections): quando você joga páginas da web, PDFs ou e-mails no chat, recebe com menos frequência respostas guiadas por comandos escondidos nesse material. Em simulações de programação, a OpenAI conta cerca de metade dos comportamentos críticos em relação ao Sol.
Testadores independentes relatam, porém, que em tarefas muito longas o Astra introduz novos erros cuja localização custa tempo. Conferir o resultado continua obrigatório, justamente porque o modelo escreve com muita segurança.
Quando o Astra vale o acréscimo
Da comparação saem algumas regras simples no ChatX:
- Documentos longos: em contratos, estudos ou bases de código inteiras que passam de várias centenas de milhares de tokens, o Astra mantém tudo em uma única solicitação, com cerca de um milhão de tokens de contexto. O Sol corta antes.
- Números e lógica: modelos financeiros, estatística, demonstrações e tudo em que um erro de cálculo sai caro. A distância no FrontierMath aparece aqui na prática.
- Para tarefas curtas, não: e-mails, traduções, resumos e perguntas factuais o Sol resolve igualmente bem, e muitas vezes Luna e Terra já bastam, por uma fração do custo.
- Escolha a profundidade com critério: o Astra começa em «Baixa». «Alta» só compensa quando a tarefa tem vários caminhos de solução. Em perguntas simples, custa espera e tokens sem melhorar o resultado.
- Use o tamanho da resposta: no ChatX uma resposta pode chegar a 15.000 tokens. Se você quer um texto completo, diga isso no prompt («completo, sem encurtar»), senão o Astra resume, assim como o Sol.
Um teste prático: dê a mesma tarefa uma vez ao Sol e uma vez ao Astra e leia as respostas lado a lado. Se a diferença não salta aos olhos, o Sol era a escolha certa.
