El equipo Qwen de Alibaba ha presentado Qwen3.8-Flash-Next, un modelo multimodal de mezcla de expertos que se presenta como una vista previa arquitectónica del futuro Qwen4. Su objetivo es explícito: igualar a modelos mucho mayores con una fracción del coste de entrenamiento.
La arquitectura
El modelo tiene 125.000 millones de parámetros totales pero activa solo 6.000 millones por token. Esa es la idea central de una arquitectura de mezcla de expertos: el modelo entero reside en memoria, pero para cada token solo se ejecutan los expertos pertinentes.
La verdadera novedad está en otro punto. El modelo incluye una nueva capa de incrustación de n-gramas con 51.000 millones de parámetros, una de las innovaciones previstas para Qwen4. Esa capa almacena grupos de palabras frecuentes como entradas independientes en una especie de "diccionario de frases". El detalle decisivo: puede residir en la memoria normal del sistema en lugar de en la tarjeta gráfica, con un "coste adicional relativamente bajo".
En la práctica, eso retira 51.000 millones de parámetros del recurso más caro del modelo: la memoria de la tarjeta gráfica.
La afirmación sobre el coste
Según el equipo Qwen, el modelo obtiene mejores resultados que su antecesor Qwen3.7-Plus con cerca de la novena parte del coste de entrenamiento, con las mayores ganancias en programación y tareas de oficina.
La comparación tiene sentido porque Qwen3.7-Plus cuenta con 397.000 millones de parámetros y activa 17.000 millones por token, casi el triple de los activos del nuevo modelo.
Resultados comparativos
Las cifras publicadas por Alibaba enfrentan al modelo con rivales mucho mayores o mucho más caros, y encabeza la mayoría de las tareas evaluadas. El peso recae claramente en la programación con agentes: pruebas que exigen que una inteligencia artificial encuentre y corrija errores por su cuenta en proyectos reales de software.
- Programación con agentes: en dos pruebas distintas supera tanto a un modelo chino mayor como a un modelo occidental de frontera.
- Oficina y productividad: la diferencia es aún mayor. En una prueba de flujos de trabajo casi duplica la puntuación de su antecesor.
- Razonamiento científico y programación competitiva: aquí los modelos quedan parejos, sin ventaja clara.
Ese reparto no es casual. El modelo parece afinado explícitamente para cargas con agentes; en tareas que exigen conocimiento general amplio la distancia se cierra.
Acceso y precio
El informe técnico y los pesos ya están publicados. La versión de producción se ofrece como Qwen3.8-Flash a través del servicio en la nube de la compañía, con un precio de 0,16 dólares por millón de tokens de entrada y 0,47 por millón de salida.
Por qué importa
El mensaje real de este lanzamiento no está en la tabla comparativa sino en el lado del coste. Durante dos años el sector ha seguido un mismo camino: modelo más grande, más datos, más cómputo. Obtener mejores resultados con la novena parte del coste de entrenamiento muestra que ese camino no es el único.
Las decisiones de arquitectura apuntan en la misma dirección: pocos parámetros activos, una capa que puede pasar a la memoria del sistema, cómputo controlable. Todo orientado a rebajar el coste de inferencia.
Esto encaja con la estrategia reciente de los laboratorios chinos. En lugar de construir el mejor modelo en la frontera, ofrecer un modelo suficientemente bueno mucho más barato. Para ganar cuota de mercado, el segundo movimiento suele resultar más eficaz.