Investigadores de Google Research han presentado WikiSkill, un marco que empareja a los agentes de inteligencia artificial con una base de conocimiento persistente. La idea es sencilla: en lugar de tirar lo que el agente aprendió tras cada ejecución, reunir el conocimiento sobre fracasos y aciertos en una estructura tipo wiki y usarlo para mejorar sus capacidades con el tiempo.
Ese conocimiento se empaqueta en "Destrezas de Agente", módulos reutilizables que guían la conducta del agente sin alterar lo que aprendió durante el entrenamiento.
Es decir, el modelo no aprende realmente de forma continua: eso sigue siendo un problema sin resolver. Lo que hace es escribirse mejores instrucciones después de cada ronda y recuperarlas la vez siguiente. No es elegante y probablemente sea más propenso a errores que el aprendizaje real, pero el estudio demuestra que funciona como remedio.
El trabajo bebe de la idea de la "LLM Wiki" de Andrej Karpathy: convertir la experiencia en conocimiento persistente y acumulativo.
Tres capas
- Capa bruta. Guarda los registros completos de ejecución, desde las llamadas a herramientas hasta los resultados. Es inmutable y sirve de materia prima.
- Capa wiki. Aquí los datos brutos se destilan en ideas estructuradas: patrones de fallo documentados y estrategias que funcionan. Esta capa nunca se reinicia y solo crece.
- Capa de destrezas. Contiene las instrucciones activas que sigue el agente. A diferencia del wiki, las destrezas pueden revertirse si una actualización empeora el rendimiento.
El ciclo funciona así: un agente de inferencia ejecuta tareas con las destrezas actuales y genera registros. Un "Mantenedor del Wiki" los analiza, detecta patrones de fallo y estrategias exitosas y escribe los hallazgos. Un "Proponente de Destrezas" usa el wiki actualizado para sugerir cambios concretos. Por último, un mecanismo de control prueba el cambio propuesto en un conjunto de validación aparte para confirmar que realmente ayuda.
Si no ayuda, la destreza se revierte pero el wiki permanece intacto. Ni siquiera las propuestas fallidas se pierden: el wiki documenta qué se intentó y por qué falló, y las siguientes iteraciones construyen sobre eso.
Los resultados
El marco se probó en cinco pruebas: razonamiento matemático, búsqueda web, manejo de hojas de cálculo, preguntas sobre documentos y tareas interactivas en un entorno virtual.
De media, Gemini 3.5 Flash pasó del 49,5 al 68,1 por ciento y Qwen-3.6-27B del 39,4 al 63,3 por ciento. En pruebas concretas los saltos son mayores: Gemini 3.5 Flash subió del 33 al 72,6 por ciento en LiveMath.
Dónde no funciona
Las ganancias varían mucho según el tipo de tarea. Las mayores mejoras se dan en matemáticas y hojas de cálculo; las tareas con contextos documentales largos muestran avances mucho menores.
La explicación de los investigadores: modelos pequeños como Qwen-3.5-4B no logran ejecutar de forma fiable estrategias de búsqueda de varios pasos en contextos largos y vuelven a su conducta por defecto. Leen la instrucción, pero no la sostienen hasta el final.
En cambio, los modelos pequeños con WikiSkill pueden igualar a modelos mayores que no usan el marco. Las destrezas desarrolladas por un modelo suelen transferirse a otro y a veces funcionan mejor que las que el receptor construyó por su cuenta, aunque no siempre: conviene comprobar la transferibilidad caso por caso.