Qué se anunció

Durante todo el mes de agosto NVIDIA mantiene una serie de publicaciones dedicada a la IA local. En la entrada fechada el 14 de agosto de 2026, la compañía anunció soporte desde el primer día en GPU RTX para el modelo abierto Qwen3.8-27B.

El modelo se presenta como el acompañante local de Qwen3.8-Max. Este modelo abierto de 27.000 millones de parámetros está dimensionado para caber en una sola GPU y construido para flujos de programación ágiles con archivos locales, herramientas y contexto de proyecto. La ventaja que subraya NVIDIA es directa: los desarrolladores pueden mantener el código sensible, los datos propietarios y el contexto del proyecto en sus propios sistemas mientras usan asistencia de IA competente durante todo el desarrollo.

Rendimiento y soporte

En el plano técnico destacan dos puntos. El primero es la cobertura: el soporte inmediato se aplica a GPU RTX, incluidas las tarjetas NVIDIA RTX PRO y la GeForce RTX 5090. El segundo es la velocidad: optimizado con predicción de múltiples tokens, el modelo alcanza 131 tokens por segundo en una sola GeForce RTX 5090 con esa función activada. Eso supone inferencia local rápida para programación agéntica, uso de herramientas y tareas de desarrollo largas.

El anuncio enumera además las herramientas donde el modelo puede usarse de inmediato:

  • llama.cpp, un motor de inferencia portátil y de bajo nivel,
  • Ollama, la herramienta extendida que empaqueta la ejecución local de modelos,
  • Unsloth, una biblioteca que acelera el ajuste fino,
  • LM Studio Bionic, un entorno de escritorio para ejecutar modelos locales.

Las cuatro admiten Qwen3.8-27B en GPU RTX de NVIDIA. La compañía lo presenta como la combinación del rendimiento RTX con el ecosistema de software CUDA.

Por qué importa

La cuestión de fondo es la decisión de tamaño. Hoy la mayoría de los agentes de programación dependen de modelos muy grandes que se ejecutan en la nube, lo que implica que el código y el contexto del proyecto salen de la máquina. Un modelo de 27.000 millones de parámetros que funciona a una velocidad razonable en una sola tarjeta de consumo cambia ese equilibrio también para desarrolladores fuera de las grandes organizaciones.

La cifra de 131 tokens por segundo es simbólica en ese sentido. Un agente de programación no produce una sola respuesta: da muchos pasos, llama herramientas y lee resultados, así que la velocidad de generación se traduce directamente en tiempo de espera. A ese nivel de velocidad, un agente local se vuelve comparable a una alternativa en la nube en el uso diario.

Salvedades

Aun así, conviene no leer el cuadro mejor de lo que es. La cifra de rendimiento procede del propio anuncio de NVIDIA y no está confirmada por evaluaciones independientes. Los tokens por segundo varían además de forma notable según el nivel de cuantización, la longitud de contexto y la forma de la carga de trabajo; un único número no representa todos los escenarios.

En calidad del modelo cabe una salvedad parecida: no se espera que un modelo de 27.000 millones de parámetros iguale a los mayores modelos en la nube en todas las tareas. La propia redacción de NVIDIA lo describe como acompañante local de Qwen3.8-Max y no como sustituto. La decisión depende de cuánto pese el deseo de no sacar de casa el código sensible.