SpaceXAI, la empresa de IA que Elon Musk dirigía antes con el nombre de xAI, ha presentado su nuevo modelo insignia, Grok 4.6. Llega alrededor de un mes después de Grok 4.5 y apunta a agentes de larga duración, programación, trabajo de conocimiento y desarrollo de aplicaciones visuales.
La noticia real: la base no creció
Lo más llamativo de este lanzamiento no es lo que hace, sino cómo se hizo. Grok 4.6 no es un modelo base mayor. SpaceXAI mantuvo la base constante y dedicó toda la mejora al post-entrenamiento: una tanda suplementaria más larga que la de Grok 4.5, trayectorias de ajuste fino supervisado regeneradas y aprendizaje por refuerzo en entornos de agentes.
Esa tanda suplementaria empleó datos generados por modelos y seleccionados para el razonamiento y los conceptos técnicos avanzados. Se incorporaron datos de ingeniería de alta calidad y se actualizaron tanto el optimizador como la receta de entrenamiento.
Después llega un paso interesante: la compañía usó el propio Grok 4.5 para regenerar las trayectorias de ajuste fino supervisado en distintos niveles de esfuerzo de razonamiento, andamiajes de agentes y dominios que abarcan STEM, ingeniería de software y trabajo de conocimiento. Los rastros problemáticos se filtraron mediante comprobaciones basadas en modelos. Siguió el aprendizaje por refuerzo, con tareas de agente en áreas como la optimización de núcleos de GPU, el desarrollo web y el diseño asistido por ordenador.
Medición y acceso
El modelo obtiene 61 puntos en el Artificial Analysis Intelligence Index: cinco por encima de Grok 4.5 y empatado con GPT-5.6 Sol Max.
- Ventana de contexto: 500.000 tokens
- Nombre en la API:
grok-4.6, con precios desde 2 dólares - Modelo por defecto en Grok Build; disponible en Cursor en todos los planes
- Enrutable a través de OpenRouter, Vercel y Cloudflare
- Un nuevo nivel de esfuerzo de razonamiento,
xhigh, por encima de la escala de Grok 4.5
No hay versión de pesos abiertos ni forma de alojarlo en infraestructura propia. Eso significa que los despliegues aislados de internet no pueden usar este modelo.
Qué cambió en las tareas largas
Según la empresa, Grok 4.6 supera a su predecesor a la hora de convertir una idea general de producto en una primera versión funcional. Puede investigar un ámbito que desconoce, montar la estructura de una aplicación, desarrollar las interacciones básicas y refinar el resultado a lo largo de varias rondas de comentarios. En proyectos visuales e interactivos los primeros resultados son mejores, y puede fijar la estructura y el lenguaje visual de una aplicación de una sola pasada.
En tareas de larga duración, el modelo debe mantener su contexto y probar y verificar su propio trabajo antes de seguir adelante. Eso apunta directamente al fallo más frecuente del trabajo con agentes de varios pasos: desviarse a mitad de camino.
Todas estas afirmaciones se apoyan en el relato de la propia empresa. La verificación independiente se limita por ahora a la puntuación del índice de inteligencia.