Grok 4.6 holt bei Coding zu Sol auf

Grok 4.6 alcanza a Sol en programación

xAI ha publicado Grok 4.6, un reentrenamiento de Grok 4.5 centrado en programación y tareas largas. En comparativas independientes alcanza por primera vez el nivel de GPT-5.6 Sol. En ChatX cuesta solo alrededor de un tercio. Este artículo muestra las cifras, explica la particularidad del razonamiento y dice cuándo el Grok 4.3 más pequeño sigue siendo la mejor opción.

Grok 4.5 frente a 4.6 en cifras

Grok 4.6 no es una nueva generación de modelos. Es un entrenamiento más largo sobre Grok 4.5 con datos elegidos para razonamiento, desarrollo de software y temas técnicos. El avance se mide en varias pruebas:

Prueba Grok 4.5 Grok 4.6 Qué mide
Artificial Analysis Intelligence Index 56 61 valor global de diez pruebas individuales
DeepSWE 54,0 % 65,9 % tareas de software resueltas de forma autónoma
FrontierCode 56,6 % 61,3 % problemas de programación difíciles
CursorBench 66,7 % 69,9 % cambios de código en proyectos reales
GDPval 1.526 1.753 trabajo profesional del conocimiento

El mayor salto está en DeepSWE, es decir, en las tareas que el modelo resuelve solo a lo largo de muchos pasos. Ahí era justo donde Grok 4.5 flojeaba.

Dónde se sitúa Grok 4.6

En el Intelligence Index, Grok 4.6 empata con GPT-5.6 Sol. No llega a GPT-6 Astra, Claude Opus 5.5 ni Fable 5.1, pero para muchas tareas la diferencia es lo bastante pequeña como para justificar la diferencia de precio. Según los precios del proveedor, la salida de Grok 4.6 cuesta alrededor de un tercio de la de Sol y también alrededor de un tercio de la de Opus 5.5. ChatX factura con esos mismos precios, así que con respuestas de la misma longitud esa proporción vale igual para tu consumo de tokens.

Eso convierte a Grok 4.6 en una opción interesante para quien venía usando Sol para programar o para búsquedas técnicas. En textos con estilo y tono, Sol sigue por delante. En código, desarrollo web y análisis de varios pasos, la diferencia apenas se aprecia en nuestras comparativas.

El modelo siempre razona

Grok 4.6 es un modelo de razonamiento puro. Piensa antes de cada respuesta, con profundidad baja, media o alta, pero siempre. Por eso en ChatX este modelo ofrece exactamente esos tres niveles. No hay «Desactivado», porque xAI no permite apagar el razonamiento en 4.6. Los pasos de razonamiento no se ven, pero cuentan como tokens de salida y se notan en el consumo.

Para preguntas cortas eso significa algo más de espera y algunos tokens más que con un modelo que responde directo. Para la mayoría de las tareas basta con «Baja». «Alta» merece la pena con errores enrevesados o con tareas que admiten varias soluciones.

Grok 4.6 o Grok 4.3

  • Grok 4.3: responde sin pasos de razonamiento, cuesta menos de la mitad que Grok 4.6 y en ChatX también está disponible para invitados. Con un millón de tokens tiene el doble de ventana de contexto. La opción correcta para traducciones, textos breves, resúmenes y preguntas con una respuesta clara.
  • Grok 4.6: para usuarios registrados, con comprensión de imágenes y profundidad de razonamiento seleccionable. La opción correcta para programación, desarrollo web, cuestiones técnicas y todo lo que requiera varios pasos.
  • La prueba: una tarea que Grok 4.3 resuelve de forma distinta en el segundo intento que en el primero es una tarea para Grok 4.6.

Con Grok 4.6, la oferta de xAI se convierte por primera vez en una alternativa real para el trabajo, siempre que aceptes que el modelo piensa antes de responder.


Posted

in

by

Tags: