OpenAI ha añadido dos modelos a la familia GPT-6: GPT-6 Sol y GPT-6 Luna. Ambos se sitúan por debajo de GPT-6 Astra, presentado a principios de septiembre, y se entrenaron con métodos similares. El titular no es la capacidad, sino el precio: el coste por token de los dos se ha reducido a la mitad.
La lectura de The Decoder es más dura: los precios caen a la mitad, pero el rendimiento apenas se mueve. Los modelos rinden como sus predecesores, por la mitad de dinero.
Los nuevos precios
| Modelo | Entrada (por millón de tokens) | Salida (por millón de tokens) |
|---|---|---|
| GPT-6 Sol | 4 → 2 dólares | 20 → 10 dólares |
| GPT-6 Luna | 0,20 → 0,10 dólares | 1,20 → 0,50 dólares |
El recorte en la salida de Luna es en realidad cercano al 58 %, no al 50 %. OpenAI lo atribuye a mejoras en el almacenamiento en caché y en la inferencia, y dice trasladar el ahorro a los usuarios. Terra, hasta ahora el modelo más barato, ya no está disponible.
Qué modelo para qué
- Astra: el modelo superior para el trabajo más difícil.
- Sol: tareas complejas y repetidas como crear funciones, revisar código, depurar y analizar datos.
- Luna: trabajo de gran volumen y bien definido: resumir documentos, extraer información, responder preguntas cortas.
Las pruebas: la ganancia está en el coste
Los resultados publicados por OpenAI se apoyan menos en las puntuaciones absolutas que en el coste por tarea. En AutomationBench, que evalúa flujos de trabajo con 47 herramientas, Sol obtiene un 33,2 % con un coste de 0,27 dólares por tarea, mientras Claude Opus 5 al máximo esfuerzo logra un 26,9 % con un coste 11 veces mayor. En OSWorld 2.0, sobre uso del ordenador, Sol marca un 60,5 % frente al 60,3 % de Opus 5, con un coste por tarea un 80 % menor.
En programación, en DeepSWE, Sol obtiene un 68,8 %, 1,1 puntos por detrás de Claude Fable 5, con un coste por tarea un 80 % inferior. Luna logra un 66,6 % en la misma prueba y funciona entre un 93 % y un 96 % más barato que los modelos con los que se compara.
Conviene recordar que todas estas cifras son del fabricante. Las mediciones independientes pueden cambiar el cuadro: un día antes, en el lanzamiento de Grok 4.7 de xAI, la tabla de la empresa y la medición independiente diferían claramente.
Precisión y caché
La prueba interna de precisión de OpenAI parte de conversaciones reales de ChatGPT en las que los usuarios marcaron errores. Según la empresa, Sol comete alrededor de la mitad de errores que su predecesor. Otro cambio importa a los agentes: la entrada leída desde caché tiene un 90 % de descuento, hay un nuevo panel de caché y cambiar el nivel de esfuerzo ya no invalida la caché.
Los modelos están en la API como gpt-6-sol y gpt-6-luna; al no publicarse los pesos, no se pueden alojar por cuenta propia. En ChatGPT acceden los usuarios de Work y Codex, y Luna llega a los usuarios gratuitos a través de la app de escritorio.
El calendario resume la competencia: según TechCrunch, Anthropic publicó Claude Opus 5.5 solo 90 minutos antes del anuncio de OpenAI.