A xAI lançou o Grok 4.6, um novo treinamento do Grok 4.5 voltado para programação e tarefas longas. Em comparações independentes ele alcança pela primeira vez o nível do GPT-5.6 Sol. No ChatX, custa apenas cerca de um terço disso. Este artigo mostra os números, explica a particularidade do raciocínio e diz quando o Grok 4.3, menor, continua sendo a melhor escolha.
Grok 4.5 contra 4.6 em números
O Grok 4.6 não é uma nova geração de modelos. É um treinamento mais longo do Grok 4.5 com dados escolhidos para raciocínio, desenvolvimento de software e temas técnicos. O avanço aparece em vários testes:
| Teste | Grok 4.5 | Grok 4.6 | O que mede |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 | nota geral de dez testes individuais |
| DeepSWE | 54,0 % | 65,9 % | tarefas de software resolvidas sozinho |
| FrontierCode | 56,6 % | 61,3 % | problemas difíceis de programação |
| CursorBench | 66,7 % | 69,9 % | alterações de código em projetos reais |
| GDPval | 1.526 | 1.753 | trabalho profissional de conhecimento |
O maior salto está no DeepSWE, ou seja, nas tarefas que o modelo conduz sozinho ao longo de muitos passos. Era exatamente aí que o Grok 4.5 ficava devendo.
Onde o Grok 4.6 se encaixa
No Intelligence Index, o Grok 4.6 empata com o GPT-5.6 Sol. Ele não alcança o GPT-6 Astra, o Claude Opus 5.5 nem o Fable 5.1, mas para muitas tarefas a distância é pequena o bastante para justificar a diferença de preço. Pelos preços dos fornecedores, a saída do Grok 4.6 custa cerca de um terço da do Sol e também cerca de um terço da do Opus 5.5. O ChatX cobra pelos mesmos preços, então, com respostas do mesmo tamanho, essa proporção também vale para os seus tokens.
Isso torna o Grok 4.6 interessante para quem vinha usando o Sol em programação ou em pesquisas técnicas. Em textos que pedem estilo e tom, o Sol continua na frente. Em código, desenvolvimento web e análises de vários passos, a diferença quase não aparece nas nossas comparações.
O modelo sempre raciocina
O Grok 4.6 é um modelo de raciocínio puro. Ele pensa antes de cada resposta, com profundidade baixa, média ou alta, mas sempre. Por isso, no ChatX esse modelo oferece exatamente esses três níveis. Não existe «Desativado», porque a xAI não permite desligar o raciocínio na 4.6. Os passos de raciocínio ficam invisíveis, mas contam como tokens de saída e aparecem no consumo.
Para perguntas curtas, isso significa um pouco mais de espera e alguns tokens a mais do que em um modelo que responde direto. Para a maioria das tarefas, «Baixa» já basta. «Alta» compensa em erros complicados ou em tarefas com vários caminhos de solução.
Grok 4.6 ou Grok 4.3
- Grok 4.3: responde sem passos de raciocínio, custa menos da metade do Grok 4.6 e no ChatX também está liberado para visitantes. Com um milhão de tokens, tem o dobro de janela de contexto. A escolha certa para traduções, textos curtos, resumos e perguntas com resposta única.
- Grok 4.6: para usuários cadastrados, com compreensão de imagens e profundidade de raciocínio ajustável. A escolha certa para programação, desenvolvimento web, questões técnicas e tudo o que exige vários passos.
- O teste: uma tarefa que o Grok 4.3 resolve de um jeito na segunda tentativa e de outro na primeira é tarefa para o Grok 4.6.
Com o Grok 4.6, a oferta da xAI vira pela primeira vez uma alternativa de verdade para o trabalho, desde que você aceite que o modelo sempre pensa antes de responder.
