GPT-6 Astra es desde principios de septiembre el sucesor de GPT-5.6 Sol y cuesta unas dos veces y media más. La pregunta para los usuarios no es, por tanto, si Astra es mejor, sino dónde la diferencia es lo bastante grande como para justificar el sobreprecio. Hemos comparado las cifras oficiales con los demás modelos de primera línea en ChatX y sacado algunas reglas sobre cuándo compensa el cambio.
Astra junto a Sol, Opus 5.5 y Fable 5.1
| GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Precio por token según el proveedor (Sol = 1) | ≈ 2,5× | 1× | 1× | ≈ 2,5× |
| Profundidad de razonamiento | seleccionable, por defecto «Baja» | seleccionable, por defecto «Desactivado» | seleccionable desde «Baja», sin «Desactivado» | seleccionable desde «Baja», sin «Desactivado» |
| Búsqueda web / imágenes | sí / sí | sí / sí | sí / sí | no / sí |
| Punto fuerte | matemáticas, tareas largas de varios pasos, fiabilidad | día a día y textos exigentes | programación, análisis | los casos más difíciles |
La fila de precios es la relación entre los precios oficiales de los proveedores para entrada y salida. ChatX traslada esas diferencias, así que con respuestas de la misma longitud la proporción vale también para el consumo de tokens. Astra y Fable 5.1 están al mismo nivel, y Sol junto con Opus 5.5 claramente por debajo.
Dónde Astra va por delante de forma medible
OpenAI menciona tres resultados que describen la distancia con Sol: 98 por ciento en FrontierMath Tier 4 (matemáticas de investigación), 99,9 por ciento en ARC-AGI-3 (resolución abstracta de problemas) y el primer puesto en Terminal-Bench 4.0, una prueba de tareas de programación que se extienden por muchos pasos. Sol quedó claramente por detrás en las tres.
Para los usuarios pesan más que los récords dos puntos de la system card:
- Menos datos inventados: en los casos de error registrados, Astra alucina menos que Sol. En búsquedas, resúmenes de textos técnicos y trabajo con cifras, esa es la diferencia más perceptible.
- Más resistente a instrucciones coladas (prompt injections): si metes páginas web, PDF o correos en el chat, recibes con menos frecuencia respuestas dirigidas por órdenes ocultas en ese material. En simulaciones de programación, OpenAI cuenta alrededor de la mitad de comportamientos críticos que con Sol.
Los probadores independientes señalan, eso sí, que en tareas muy largas Astra introduce errores nuevos cuya búsqueda cuesta tiempo. Revisar el resultado sigue siendo obligatorio, justamente porque el modelo se expresa con mucha seguridad.
Cuándo Astra vale el sobreprecio
De la comparación salen en ChatX unas reglas sencillas:
- Documentos largos: con contratos, estudios o bases de código completas que superan varios cientos de miles de tokens, Astra lo mantiene todo en una sola consulta gracias a su contexto de alrededor de un millón de tokens. Sol se corta antes.
- Números y lógica: modelos financieros, estadística, demostraciones y todo aquello donde un error de cálculo sale caro. La distancia en FrontierMath se nota aquí en la práctica.
- Para tareas cortas, no: correos, traducciones, resúmenes y preguntas de datos los resuelve Sol igual de bien, y a menudo basta con Luna o Terra, por una fracción del coste.
- Elige la profundidad a conciencia: Astra arranca en «Baja». «Alta» solo compensa cuando la tarea admite varias soluciones. En preguntas sencillas cuesta espera y tokens sin mejorar el resultado.
- Aprovecha la longitud: en ChatX una respuesta puede llegar a 15.000 tokens. Si quieres un desarrollo completo, dilo en el prompt («completo, sin acortar»), porque si no Astra resume igual que Sol.
Una prueba práctica: plantea la misma tarea una vez con Sol y otra con Astra y lee las respuestas en paralelo. Si la diferencia no salta a la vista, Sol era la opción correcta.
