¿Qué ocurrió?
Saleh Almohaimeed y otros cuatro colegas presentaron un marco llamado Sensitive Entity Alias Generator (SEAG), que ofrece una solución al problema de privacidad en los sistemas de generación aumentada por recuperación (retrieval-augmented generation, RAG). El estudio fue publicado en arXiv el 13 de agosto de 2026. SEAG utiliza un modelo ligero que detecta entidades sensibles (como nombres, instituciones o datos personales), genera alias correspondientes y crea una tabla de sustitución.
Esta tabla se utiliza para reemplazar las palabras sensibles de la consulta del usuario y de los documentos recuperados antes de que los datos se envíen a un modelo generador externo (external generator) de terceros. De esta manera, el modelo externo puede producir una respuesta significativa y correcta sin acceder directamente a la información sensible real.
¿Por qué es importante?
Hasta ahora, las investigaciones sobre privacidad en sistemas RAG que utilizan modelos de lenguaje grande (large language model, LLM) se habían centrado principalmente en impedir el acceso de usuarios no autorizados a datos sensibles. Sin embargo, según los investigadores, un problema pasado por alto era que los modelos generadores externos podían acceder directamente a la consulta y a los documentos recuperados, lo que generaba el riesgo de uso indebido o acceso no autorizado a información confidencial. SEAG permite a los usuarios beneficiarse de potentes modelos generadores de terceros sin tener que compartir su información sensible.
Hallazgos
- En la métrica de usuario, es decir, la capacidad del modelo de responder correctamente al usuario mientras oculta la información sensible del generador externo, todos los modelos SEAG lograron una precisión superior al 80 %.
- El modelo SEAG basado en Qwen-3 mostró una precisión total del 77,83 % en ocultar todas las entidades sensibles de los documentos.
- El modelo basado en LLaMA-3.2 obtuvo una precisión del 76,73 %, mientras que el basado en Phi-4 alcanzó el 74,91 %.
- Los investigadores crearon un conjunto de datos para entrenar los modelos SEAG y otro conjunto separado para evaluar el marco.
¿Qué sigue?
El estudio ha sido enviado a la revista Knowledge-Based Systems y se espera que pase por el proceso de revisión por pares. En la página de arXiv de la publicación están disponibles el PDF, el HTML y los archivos fuente en TeX; los detalles sobre la publicación del código y los datos aún no están definidos.