Cuando un modelo escribe que está pensando paso a paso, ¿esos pasos tienen algún correlato en su interior? Un estudio publicado por investigadores de KAIST y Naver AI Lab, en Corea del Sur, da una respuesta medible.
El hallazgo: operaciones de razonamiento como el cálculo, el recuerdo de fórmulas y la deducción son claramente separables en los estados internos del modelo.
El método
Se hizo que los modelos resolvieran problemas de matemáticas paso a paso. Los caminos de solución resultantes se segmentaron y cada segmento se etiquetó con una operación de razonamiento, usando otro modelo para el etiquetado.
Después se examinó cómo aparece cada segmento en los estados internos del modelo. La pregunta era simple: ¿pueden distinguirse esas operaciones desde dentro?
| Detalle | Valor |
|---|---|
| Instituciones | KAIST y Naver AI Lab |
| Modelos probados | Qwen2.5-7B, Qwen3-8B, Gemma4-31B |
| Replicación | Repetido con Llama-3-8B |
| Operaciones separadas | Ocho tipos de razonamiento |
La señal está en las capas medias
La parte más nítida del hallazgo es la distribución por capas. La separación es más fuerte en las capas medias y se debilita hacia las tempranas y las tardías.
Eso se sostuvo en los tres modelos. Así que el resultado no parece una rareza de una arquitectura sino un patrón compartido.
Que la separación se concentre en las capas medias cae donde cabría esperar. Las capas tempranas tratan más con rasgos superficiales del lenguaje y las tardías con elegir la siguiente palabra; la información sobre el tipo de operación queda entre ambas.
El detalle más interesante
El hallazgo destacado del estudio está en el nivel de la palabra. La misma palabra recibe una representación interna distinta según el paso de razonamiento al que pertenece.
Es decir, el modelo no codifica un número igual cuando recuerda una fórmula que cuando hace un cálculo. El contexto no lleva solo significado sino el tipo de operación.
Por qué importa para la seguridad
Este trabajo conecta directamente con una preocupación: lo que un modelo hace por dentro puede diferir de la cadena de razonamiento que escribe.
Investigaciones anteriores ya habían mostrado esa brecha. Se halló que Claude Opus 4.6 procesa más de lo que muestra, y en la medición de Anthropic los modelos revelaban las pistas recibidas solo en el 25 a 39 por ciento de los casos.
Leídos juntos, esos dos hallazgos dan lo siguiente: la cadena de razonamiento escrita no es todo lo que hay dentro del modelo sino un resumen. El resumen suele ser correcto pero incompleto, y qué parte falta no se ve desde fuera.
Qué significa
Si los tipos de razonamiento se separan en los estados internos, podría volverse posible medir qué hace realmente un modelo sin leer el texto que escribe. No depender de la salida escrita para supervisar es algo que la interpretabilidad persigue desde hace tiempo.
El límite también está claro: el estudio usó problemas de matemáticas y la clasificación de pasos se apoya en otro modelo. Si la misma separación se sostiene en tareas abiertas todavía no se ha demostrado.