Cuando un modelo de lenguaje responde mal a una pregunta factual, pueden haber ocurrido dos cosas muy distintas: o nunca aprendió el dato, o lo aprendió y no logra alcanzarlo. Las métricas habituales de precisión funden ambas en un único fallo, pese a que apuntan a limitaciones y soluciones muy diferentes.
Un nuevo trabajo de Google Research ha medido esa distinción y ha llegado a una conclusión clara: el problema son sobre todo llaves perdidas, no estantes vacíos.
Por qué importa la distinción
La diferencia se traduce directamente en el remedio:
- Un fallo de codificación obliga a ampliar el tamaño del modelo o la cobertura de datos: vías caras y lentas.
- Un fallo de recuperación puede abordarse con métodos posteriores al entrenamiento y técnicas en el momento de la inferencia, ayudando al modelo a aprovechar mejor lo que ya contiene.
Dicho de otro modo, la causa que hay detrás de un error idéntico en apariencia marca la diferencia entre una tanda de entrenamiento millonaria y unas pocas semanas de trabajo.
Perfilado de conocimiento
Los investigadores presentan un marco conductual al que llaman perfilado de conocimiento. Su idea central es desplazar la unidad de análisis de la pregunta al hecho: no si el modelo respondió bien una pregunta concreta, sino cuál es el estado de ese hecho dentro del modelo.
Cada hecho se sitúa en uno de cinco perfiles: fallo de codificación, fallo de recuperación, recuperación directa, recuperación con razonamiento e inferencia sin codificación.
La clasificación se apoya en tres nociones conductuales:
- Codificación: el modelo puede reproducir correctamente el hecho en un contexto similar al de preentrenamiento
- Recuperación: puede recobrar el hecho codificado sin pistas externas
- Reconocimiento: puede identificar el hecho correcto cuando se le presenta entre alternativas
La codificación se mide mediante compleción de proposiciones y preguntas contextuales, que colocan al modelo en contextos parecidos a aquellos donde el hecho aparecería de forma natural durante el preentrenamiento, sin revelar la respuesta.
La prueba: WikiProfile
Para sostener el análisis, el equipo construyó WikiProfile: 2.150 hechos extraídos de Wikipedia, cada uno acompañado de diez preguntas que sondean por separado codificación, recuperación y reconocimiento.
Examinados con este marco, modelos punteros como Gemini3 y GPT-5 muestran un cuadro constante: codifican casi todos los hechos, pero les cuesta recuperar muchos.
Qué significa
El hallazgo cambia la dirección del debate sobre las alucinaciones. Una respuesta errónea no significa que el modelo carezca de la información; más a menudo la tiene y no puede alcanzarla. Que los pasos de razonamiento — sacar a la luz cálculos intermedios — rescaten algunos hechos apunta en el mismo sentido, y el perfil de "recuperación con razonamiento" nombra exactamente ese caso.