Dos cambios de sistema que abaratan la destilación de conocimiento: sacar al profesor de la memoria
Multiverse Computing propone dos cambios para la destilación, el paso más caro al reducir modelos de lenguaje: almacenar una sola vez los primeros K logits del profesor y una nueva pérdida KL que nunca materializa la matriz completa del vocabulario.
Investigación