Was GPT-6 Astra besser macht als Sol

O que o GPT-6 Astra faz melhor que o Sol

Desde o começo de setembro, o GPT-6 Astra é o sucessor do GPT-5.6 Sol e custa cerca de duas vezes e meia mais. A pergunta para quem usa não é, portanto, se o Astra é melhor, mas onde a diferença é grande o suficiente para justificar o acréscimo. Comparamos os números oficiais com os outros modelos de ponta disponíveis no ChatX e tiramos algumas regras sobre quando a troca compensa.

Astra ao lado de Sol, Opus 5.5 e Fable 5.1

GPT-6 Astra GPT-5.6 Sol Claude Opus 5.5 Claude Fable 5.1
Preço por token no fornecedor (Sol = 1) ≈ 2,5× ≈ 2,5×
Profundidade do raciocínio ajustável, padrão «Baixa» ajustável, padrão «Desativado» ajustável a partir de «Baixa», sem «Desativado» ajustável a partir de «Baixa», sem «Desativado»
Busca na web / imagens sim / sim sim / sim sim / sim não / sim
Ponto forte matemática, tarefas longas de vários passos, confiabilidade dia a dia e textos exigentes programação, análise os casos isolados mais difíceis

A linha de preços mostra a relação entre os preços oficiais dos fornecedores para entrada e saída. O ChatX repassa essas diferenças, então, com respostas do mesmo tamanho, a proporção vale também para os tokens descontados. Astra e Fable 5.1 estão no mesmo patamar, com Sol e Opus 5.5 bem abaixo.

Onde o Astra está mensuravelmente à frente

A OpenAI cita três resultados que descrevem a distância para o Sol: 98 por cento no FrontierMath Tier 4 (matemática de pesquisa), 99,9 por cento no ARC-AGI-3 (resolução abstrata de problemas) e o primeiro lugar no Terminal-Bench 4.0, um teste de tarefas de programação que se estendem por muitos passos. O Sol ficou claramente atrás em todos.

Mais importantes que os recordes são dois pontos do system card:

  • Menos fatos inventados: nos casos de erro registrados, o Astra alucina menos que o Sol. Em pesquisas, resumos de textos técnicos e trabalho com números, essa é a diferença mais perceptível.
  • Mais resistente a instruções embutidas (prompt injections): quando você joga páginas da web, PDFs ou e-mails no chat, recebe com menos frequência respostas guiadas por comandos escondidos nesse material. Em simulações de programação, a OpenAI conta cerca de metade dos comportamentos críticos em relação ao Sol.

Testadores independentes relatam, porém, que em tarefas muito longas o Astra introduz novos erros cuja localização custa tempo. Conferir o resultado continua obrigatório, justamente porque o modelo escreve com muita segurança.

Quando o Astra vale o acréscimo

Da comparação saem algumas regras simples no ChatX:

  • Documentos longos: em contratos, estudos ou bases de código inteiras que passam de várias centenas de milhares de tokens, o Astra mantém tudo em uma única solicitação, com cerca de um milhão de tokens de contexto. O Sol corta antes.
  • Números e lógica: modelos financeiros, estatística, demonstrações e tudo em que um erro de cálculo sai caro. A distância no FrontierMath aparece aqui na prática.
  • Para tarefas curtas, não: e-mails, traduções, resumos e perguntas factuais o Sol resolve igualmente bem, e muitas vezes Luna e Terra já bastam, por uma fração do custo.
  • Escolha a profundidade com critério: o Astra começa em «Baixa». «Alta» só compensa quando a tarefa tem vários caminhos de solução. Em perguntas simples, custa espera e tokens sem melhorar o resultado.
  • Use o tamanho da resposta: no ChatX uma resposta pode chegar a 15.000 tokens. Se você quer um texto completo, diga isso no prompt («completo, sem encurtar»), senão o Astra resume, assim como o Sol.

Um teste prático: dê a mesma tarefa uma vez ao Sol e uma vez ao Astra e leia as respostas lado a lado. Se a diferença não salta aos olhos, o Sol era a escolha certa.


Publicado

em

por

Tags: