Un agente de programación que cabe en una GPU: Qwen3.8-27B alcanza 131 tokens por segundo en tarjetas RTX
NVIDIA anunció soporte desde el primer día en RTX para Qwen3.8-27B, un modelo abierto de 27.000 millones de parámetros. Está dimensionado para una sola GPU y alcanza 131 tokens por segundo en una GeForce RTX 5090.
Modelos