Estás leyendo
Grok 4.6 iguala a GPT-5.6 Sol con menor coste

Grok 4.6 iguala a GPT-5.6 Sol con menor coste

  • SpaceXAI lanza Grok 4.6 con mejoras en agentes, programación y trabajo de largo recorrido, mientras mantiene precios inferiores a otros modelos frontera.
xAI - Grok - La Ecuación Digital

SpaceXAI lanzó el 12 de agosto Grok 4.6, una actualización orientada a agentes capaces de mantener tareas durante secuencias largas, trabajar sobre repositorios de código y convertir instrucciones relativamente abiertas en aplicaciones o entregables completos. El modelo llega apenas unas semanas después de Grok 4.5 y mantiene una ventana de contexto de 500.000 tokens. El avance más relevante para las empresas aparece, sin embargo, cuando se cruzan rendimiento y coste: Grok 4.6 alcanza a algunos de los modelos mejor situados en evaluaciones independientes con tarifas sensiblemente inferiores.

Artificial Analysis le asigna 61 puntos en su Intelligence Index, cinco más que Grok 4.5 y la misma puntuación que GPT-5.6 Sol en su configuración máxima. Claude Fable 5 obtiene 62 puntos y Claude Opus 5 alcanza 63, de modo que el lanzamiento coloca a SpaceXAI dentro del grupo de cabeza sin establecer un liderazgo general. La fotografía cambia además según el tipo de trabajo analizado: sus mejores resultados aparecen en tareas agénticas y profesionales de varias etapas, mientras otros modelos conservan ventajas apreciables en determinadas pruebas de programación.

Grok 4.6 gana terreno en agentes de larga duración

La orientación hacia agentes explica buena parte de los cambios introducidos tras Grok 4.5. SpaceXAI señala que amplió el entrenamiento suplementario con datos sintéticos seleccionados para razonamiento y conceptos técnicos, datos de ingeniería y modificaciones en el optimizador y la receta de entrenamiento. Después utilizó Grok 4.5 para regenerar trayectorias de ajuste supervisado en software, STEM, trabajo del conocimiento y distintos entornos de agentes, antes de aplicar aprendizaje por refuerzo a escenarios que incluyen desarrollo web, optimización de kernels y diseño asistido por ordenador.

La consecuencia perseguida es operativa. Un agente que investiga información, modifica código y utiliza herramientas durante decenas de pasos plantea problemas distintos a los de un chatbot que responde a una consulta aislada. La conservación del estado, los errores acumulados, las llamadas innecesarias a herramientas o una mala decisión intermedia pueden elevar con rapidez la latencia y el consumo de tokens.

SpaceXAI afirma haber observado más conductas de comprobación automática durante ejecuciones prolongadas, con el modelo revisando parte de su trabajo antes de continuar. También atribuye a Grok 4.6 mejores primeras versiones en proyectos visuales e interactivos. Son observaciones realizadas por el propio desarrollador y todavía requieren validación en cargas de producción, donde la arquitectura del agente, las herramientas disponibles y las políticas de reintento pueden modificar considerablemente el resultado.

Los benchmarks ofrecen algunas señales a favor de esa orientación. En GDPVal-AA v2, una evaluación centrada en trabajo profesional realizado mediante agentes, Grok 4.6 obtiene un Elo de 1.753. Supera los 1.728 de GPT-5.6 Sol Max y los 1.741 de Fable 5 Max en la tabla publicada por SpaceXAI. Artificial Analysis sitúa además sus intervalos de confianza en una zona comparable a otros modelos de primer nivel.

Grok 4.6 avanza en código, pero los resultados son desiguales

La programación presenta una distribución menos uniforme. Grok 4.6 consigue un 69,9% en CursorBench 3.2, frente al 66,7% de Grok 4.5 y el 67,2% atribuido a GPT-5.6 Sol Max, aunque Fable 5 Max alcanza el 70,5%. En FrontierCode 1.1 Extended registra un 61,3%, ligeramente por encima del 60,6% de GPT-5.6 Sol Max y por debajo del 63,6% de Fable 5 Max.

DeepSWE 1.1 deja una distancia mayor. Grok pasa del 54% al 65,9%, un incremento considerable dentro de una sola generación, pero GPT-5.6 Sol Max llega al 73% y Fable 5 Max al 70%. Terminal-Bench 3.0 mantiene una separación similar: Grok 4.6 sube hasta el 26%, desde el 15,7% de su antecesor, mientras GPT-5.6 Sol Max y Fable 5 Max obtienen un 34,6% y un 34,1%, respectivamente.

La propia tabla de SpaceXAI incorpora una cautela metodológica relevante. Las puntuaciones de terceros proceden del mejor resultado publicado por sus desarrolladores o de leaderboards públicos, por lo que el conjunto no equivale a una evaluación controlada bajo una única configuración. La mejora frente a Grok 4.5 aparece de forma bastante consistente; las comparaciones exactas entre proveedores requieren más prudencia.

El coste de Grok 4.6 cambia la comparación empresarial

El precio introduce otra variable. Para solicitudes con menos de 200.000 tokens de contexto, la API de Grok 4.6 cuesta 2 dólares por millón de tokens de entrada, 0,50 dólares por millón en caché y 6 dólares por millón de tokens de salida. Al alcanzar 200.000 tokens de prompt, las tarifas pasan a 4, 1 y 12 dólares, respectivamente. El procesamiento prioritario aplica un multiplicador de dos sobre los precios estándar.

Te puede interesar
Meta Muse Spark

Artificial Analysis compara la tarifa básica de 2 y 6 dólares con los 5 y 30 dólares de GPT-5.6 Sol y los 5 y 25 dólares de Claude Opus 5. En sus mediciones, Grok 4.6 tuvo un coste medio de 0,84 dólares por tarea dentro del Intelligence Index y quedó situado en la frontera de Pareto entre inteligencia y coste por tarea. La cifra importa más que una comparación aislada del precio por token, porque una ejecución agéntica puede consumir enormes cantidades de contexto mediante ciclos sucesivos de razonamiento y uso de herramientas.

AA-Briefcase, el benchmark privado de Artificial Analysis para trabajo profesional de largo recorrido, refuerza esa lectura. Grok 4.6 alcanza un Elo de 1.577 y completa las tareas en unas 53 interacciones y alrededor de 500 millones de tokens de entrada de media. Claude Opus 5 Max empleó aproximadamente 103 interacciones y 2.000 millones de tokens en esa misma medición. Las cifras no pueden trasladarse directamente a cualquier agente empresarial, pero muestran hasta qué punto la eficiencia de la trayectoria puede alterar la factura final.

SpaceXAI distribuye ya Grok 4.6 mediante su API, Grok Build y Cursor, además de socios como OpenRouter, Vercel y Cloudflare. Durante la primera semana ofrece el doble de uso incluido en Cursor y Grok Build. La disponibilidad inmediata reduce el intervalo entre el benchmark y la prueba sobre cargas reales, un terreno donde las diferencias de unos pocos puntos suelen perder peso frente a otros factores: frecuencia de errores, supervisión humana necesaria, número de llamadas a herramientas y coste completo de finalizar cada proceso.

Para los departamentos tecnológicos, esa combinación puede desplazar parte de la comparación entre modelos hacia una métrica más cercana al negocio. Grok 4.6 todavía queda por detrás de sus principales rivales en algunas pruebas exigentes de software, mientras compite en la zona superior en trabajo agéntico y ofrece una estructura de precios más baja en contextos cortos. La decisión de adopción dependerá así menos de una clasificación general y más de cuánto cuesta mantener un agente trabajando durante decenas de pasos sin que una intervención humana termine absorbiendo el ahorro obtenido en la API.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad