El nivel anunciado

OpenAI ha abierto una vista previa de Ultrafast, un modo que ejecuta el modelo GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento estándar. Ofrecido primero a través de la API de OpenAI, el nuevo nivel de servicio puede producir hasta 750 tokens de salida por segundo.

El objetivo declarado es reducir la necesidad de recurrir a modelos más pequeños o especializados en tareas concretas solo para obtener una respuesta más rápida. Es decir, se busca que la elección deje de ser un intercambio entre velocidad y capacidad: OpenAI afirma que la latencia se reduce notablemente mientras se conservan las capacidades de GPT-5.6 Sol.

El lado de la infraestructura

La infraestructura del nuevo modo la aporta Cerebras, que desarrolla chips para IA. En ese sentido Ultrafast no es solo un nivel de servicio sino una nueva etapa de la colaboración en inferencia de baja latencia entre OpenAI y Cerebras.

La distinción importa técnicamente. 750 tokens por segundo es un ritmo de generación difícil de alcanzar en clústeres de GPU de propósito general; cifras de ese nivel se asocian normalmente con hardware especializado en inferencia. Ultrafast es por tanto el resultado de una decisión tomada no en el modelo sino en el hardware sobre el que se ejecuta.

Dónde se usa

OpenAI sitúa Ultrafast en ámbitos donde la velocidad es crítica:

  • Respuesta a incidentes: durante fallos del sistema se pueden examinar en tiempo real los registros de la aplicación y los cambios de código.
  • Comercio electrónico: la comprobación de existencias, las recomendaciones de producto y los problemas en el pago pueden atenderse antes de que el usuario abandone la compra.
  • Investigación financiera, seguridad, atención al cliente y aplicaciones de voz: otros terrenos donde el tiempo de respuesta se traslada directamente a la experiencia.

Los propios desarrolladores de la compañía usan el modo para examinar registros y trazas durante incidentes del sistema. En investigación, algunos experimentos que antes se prolongaban toda la noche ahora pueden repetirse varias veces dentro de la misma jornada laboral.

Acceso e incógnitas

Ultrafast se ofrece por ahora a un grupo limitado de usuarios, que incluye empresas de programación, investigación financiera, comercio electrónico y atención al cliente. OpenAI planea ampliar el acceso a medida que aumente la capacidad. La compañía todavía no ha anunciado el precio del modo ni cuándo estará disponible de forma general.

Por qué importa

El sentido del anuncio es que toca una costumbre asentada desde hace tiempo en el sector. Cuando la velocidad de respuesta es crítica, los equipos suelen pasarse a un modelo más pequeño y más débil, de modo que baja la latencia pero también la precisión. La promesa de Ultrafast es eliminar ese intercambio.

Comprobar esa promesa, sin embargo, exige dos datos. El primero es el precio: ¿cuánto cuesta por token la ganancia de velocidad? El segundo es la capacidad: si un nivel apoyado en hardware especializado puede mantener la misma velocidad cuando se abra de forma amplia solo se verá conforme se amplíe el acceso. Que la empresa mencione la capacidad como condición para ampliarlo sugiere que ese límite se reconoce.

Otra cuestión es qué cargas de trabajo se benefician realmente de esa velocidad. En una aplicación que produce una única respuesta larga, los tokens por segundo se traducen directamente en tiempo de espera; pero en flujos de agentes de varios pasos el total suele fijarlo la latencia de las llamadas a herramientas y a servicios externos. Cómo se refleja una aceleración de 14 veces en la experiencia completa variará por tanto mucho según la forma de la aplicación.