xAI ha publicado Grok 4.6, un reentrenamiento de Grok 4.5 centrado en programación y tareas largas. En comparativas independientes alcanza por primera vez el nivel de GPT-5.6 Sol. En ChatX cuesta solo alrededor de un tercio. Este artículo muestra las cifras, explica la particularidad del razonamiento y dice cuándo el Grok 4.3 más pequeño sigue siendo la mejor opción.
Grok 4.5 frente a 4.6 en cifras
Grok 4.6 no es una nueva generación de modelos. Es un entrenamiento más largo sobre Grok 4.5 con datos elegidos para razonamiento, desarrollo de software y temas técnicos. El avance se mide en varias pruebas:
| Prueba | Grok 4.5 | Grok 4.6 | Qué mide |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 | valor global de diez pruebas individuales |
| DeepSWE | 54,0 % | 65,9 % | tareas de software resueltas de forma autónoma |
| FrontierCode | 56,6 % | 61,3 % | problemas de programación difíciles |
| CursorBench | 66,7 % | 69,9 % | cambios de código en proyectos reales |
| GDPval | 1.526 | 1.753 | trabajo profesional del conocimiento |
El mayor salto está en DeepSWE, es decir, en las tareas que el modelo resuelve solo a lo largo de muchos pasos. Ahí era justo donde Grok 4.5 flojeaba.
Dónde se sitúa Grok 4.6
En el Intelligence Index, Grok 4.6 empata con GPT-5.6 Sol. No llega a GPT-6 Astra, Claude Opus 5.5 ni Fable 5.1, pero para muchas tareas la diferencia es lo bastante pequeña como para justificar la diferencia de precio. Según los precios del proveedor, la salida de Grok 4.6 cuesta alrededor de un tercio de la de Sol y también alrededor de un tercio de la de Opus 5.5. ChatX factura con esos mismos precios, así que con respuestas de la misma longitud esa proporción vale igual para tu consumo de tokens.
Eso convierte a Grok 4.6 en una opción interesante para quien venía usando Sol para programar o para búsquedas técnicas. En textos con estilo y tono, Sol sigue por delante. En código, desarrollo web y análisis de varios pasos, la diferencia apenas se aprecia en nuestras comparativas.
El modelo siempre razona
Grok 4.6 es un modelo de razonamiento puro. Piensa antes de cada respuesta, con profundidad baja, media o alta, pero siempre. Por eso en ChatX este modelo ofrece exactamente esos tres niveles. No hay «Desactivado», porque xAI no permite apagar el razonamiento en 4.6. Los pasos de razonamiento no se ven, pero cuentan como tokens de salida y se notan en el consumo.
Para preguntas cortas eso significa algo más de espera y algunos tokens más que con un modelo que responde directo. Para la mayoría de las tareas basta con «Baja». «Alta» merece la pena con errores enrevesados o con tareas que admiten varias soluciones.
Grok 4.6 o Grok 4.3
- Grok 4.3: responde sin pasos de razonamiento, cuesta menos de la mitad que Grok 4.6 y en ChatX también está disponible para invitados. Con un millón de tokens tiene el doble de ventana de contexto. La opción correcta para traducciones, textos breves, resúmenes y preguntas con una respuesta clara.
- Grok 4.6: para usuarios registrados, con comprensión de imágenes y profundidad de razonamiento seleccionable. La opción correcta para programación, desarrollo web, cuestiones técnicas y todo lo que requiera varios pasos.
- La prueba: una tarea que Grok 4.3 resuelve de forma distinta en el segundo intento que en el primero es una tarea para Grok 4.6.
Con Grok 4.6, la oferta de xAI se convierte por primera vez en una alternativa real para el trabajo, siempre que aceptes que el modelo piensa antes de responder.
