Por qué la destilación es cara
La destilación de conocimiento, entrenar a un modelo alumno más pequeño para igualar el rendimiento de un profesor mayor, es una técnica asentada en aprendizaje automático. Con la reciente oleada de modelos de lenguaje abiertos ha vuelto a ser un tema central. La razón es sencilla: desplegar estos modelos es caro. El modelo Kimi-K3 tiene 2,8 billones de parámetros y necesita unos 3 TB de VRAM solo para cargarse.
Por eso comprimir modelos grandes en otros más pequeños y recuperar sus capacidades mediante destilación se ha vuelto práctica habitual. El Nemotron 3 Puzzle 75B de NVIDIA y el Hypernova 60B de Multiverse Computing están entre los modelos comprimidos de calidad producidos así. Pero el paso de destilación, que decide buena parte de la calidad final, es también el más caro de la cadena.
Adónde se va la memoria
La configuración estándar es la destilación en línea con la pérdida de divergencia de Kullback-Leibler, que mantiene cargados a la vez al profesor y al alumno. En cada paso de entrenamiento el profesor ejecuta una pasada completa hacia delante para producir su distribución de salida, y el alumno se entrena para igualarla. Es la configuración más expresiva, ya que la distribución completa del profesor está disponible, pero también la más intensiva en memoria y cómputo. Hay que sostener dos tensores de vocabulario completo por posición de token, y el profesor se recalcula en cada paso aunque su comportamiento no cambie durante la ejecución.
El ejemplo que dan los autores concreta la escala: gpt-oss-120b tiene un vocabulario de 201.088 tokens. Con una longitud de secuencia de 32K y un lote de 4, el tensor de probabilidades del profesor tiene forma 4 por 201.088 por 32.768. En bfloat16 eso ya son unos 50 GB de VRAM para un solo tensor. Si se añaden gradientes, activaciones, pesos del modelo y estados del optimizador, incluso una única iteración exige cientos de GPU y estrategias cuidadosas de paralelismo tensorial.
Los dos cambios propuestos
El trabajo que Multiverse Computing presentó el 10 de agosto de 2026 aborda el problema con dos intervenciones a nivel de sistema:
- Caché de los primeros K logits fuera de línea: los K logits más altos de la salida del profesor se calculan una vez y se guardan. Como el comportamiento del profesor no cambia durante la ejecución, ese registro puede reutilizarse y el profesor ya no tiene que ocupar memoria junto al alumno.
- Una pérdida KL fusionada por bloques: una pérdida de divergencia KL eficiente en memoria que nunca materializa por completo la matriz de tamaño vocabulario por longitud de secuencia. Según los autores, reduce el uso de VRAM muy por debajo de lo que logran las implementaciones por defecto de bibliotecas como PyTorch o NVIDIA Megatron-Bridge.
Por qué importa
Juntos, los dos cambios prometen bajar el coste de entrenamiento hasta el punto de hacer posible la reparación de contexto largo en una sola GPU. Eso significa que recuperar la capacidad de contexto largo que pierde un modelo comprimido no exigiría un clúster de cientos de GPU.
La ganancia real no es solo el ahorro, sino la libertad para experimentar. Cuando el paso de destilación es un trabajo que dura horas en un clúster grande y cuesta en consecuencia, probar distintos emparejamientos de profesor y alumno o distintas mezclas de datos no resulta práctico. Si el coste cae lo suficiente, la experimentación a gran escala sí lo es. Estas afirmaciones todavía necesitan réplicas independientes, pero la dirección es clara: un trabajo que empujaría la compresión de modelos abiertos más allá de los laboratorios más grandes.