Cuando un modelo de lenguaje responde mal a una pregunta factual, pueden haber ocurrido dos cosas muy distintas: o nunca aprendió el dato, o lo aprendió y no logra alcanzarlo. Las métricas habituales de precisión funden ambas en un único fallo, pese a que apuntan a limitaciones y soluciones muy diferentes.
Un nuevo trabajo de Google Research ha medido esa distinción y ha llegado a una conclusión clara: el problema son sobre todo llaves perdidas, no estantes vacíos.
Por qué importa la distinción
La diferencia se traduce directamente en el remedio:
- Un fallo de codificación obliga a ampliar el tamaño del modelo o la cobertura de datos: vías caras y lentas.
- Un fallo de recuperación puede abordarse con métodos posteriores al entrenamiento y técnicas en el momento de la inferencia, ayudando al modelo a aprovechar mejor lo que ya contiene.
Dicho de otro modo, la causa que hay detrás de un error idéntico en apariencia marca la diferencia entre una tanda de entrenamiento millonaria y unas pocas semanas de trabajo.
Perfilado de conocimiento
Los investigadores presentan un marco conductual al que llaman perfilado de conocimiento. Su idea central es desplazar la unidad de análisis de la pregunta al hecho: no si el modelo respondió bien una pregunta concreta, sino cuál es el estado de ese hecho dentro del modelo.
Cada hecho se sitúa en uno de cinco perfiles: fallo de codificación, fallo de recuperación, recuperación directa, recuperación con razonamiento e inferencia sin codificación.
La clasificación se apoya en tres nociones conductuales:
- Codificación: el modelo puede reproducir correctamente el hecho en un contexto similar al de preentrenamiento
- Recuperación: puede recobrar el hecho codificado sin pistas externas
- Reconocimiento: puede identificar el hecho correcto cuando se le presenta entre alternativas
La codificación se mide mediante compleción de proposiciones y preguntas contextuales, que colocan al modelo en contextos parecidos a aquellos donde el hecho aparecería de forma natural durante el preentrenamiento, sin revelar la respuesta.
La prueba: WikiProfile
Para sostener el análisis, el equipo construyó WikiProfile: 2.150 hechos extraídos de Wikipedia, cada uno acompañado de diez preguntas que sondean por separado codificación, recuperación y reconocimiento.
Examinados con este marco, modelos punteros como Gemini3 y GPT-5 muestran un cuadro constante: codifican casi todos los hechos, pero les cuesta recuperar muchos.
Qué significa
El hallazgo cambia la dirección del debate sobre las alucinaciones. Una respuesta errónea no significa que el modelo carezca de la información; más a menudo la tiene y no puede alcanzarla. Que los pasos de razonamiento — sacar a la luz cálculos intermedios — rescaten algunos hechos apunta en el mismo sentido, y el perfil de "recuperación con razonamiento" nombra exactamente ese caso.
La dificultad de medirlo
Medir esta distinción es más difícil de lo que parece, porque no podemos observar directamente que un modelo "sepa" un dato. Solo tenemos el comportamiento: qué responde cuando preguntamos.
La solución del marco es sondear el mismo dato de varias formas. Si el modelo no lo produce cuando se le pregunta directamente pero lo reconoce entre varias opciones, el conocimiento está ahí y lo que está bloqueado es la vía de acceso. Lo mismo ocurre si puede completar la frase en un contexto parecido al del preentrenamiento. Juntas, estas tres mediciones dibujan un cuadro mucho más informativo que un único porcentaje de acierto.
El método tiene su propio límite: un marco conductual mide cómo se ve el modelo desde fuera, no qué ocurre dentro. Aun así, esa es exactamente la información que hace falta para decidir una intervención.