Google Research'ten araştırmacılar, yapay zeka ajanlarını kalıcı bir bilgi tabanıyla eşleştiren WikiSkill adlı bir çerçeve tanıttı. Fikir basit: ajanın her koşudan sonra öğrendiğini çöpe atmak yerine, başarısızlıklar ve başarılar hakkındaki bilgiyi wiki benzeri bir yapıda toplamak ve zamanla yeteneğini artırmak için kullanmak.

Bu bilgi "Ajan Becerileri" adı verilen, yeniden kullanılabilir modüllere paketleniyor. Bu modüller ajanın davranışını yönlendiriyor ama eğitim sırasında öğrendiklerine dokunmuyor.

Yani model gerçek anlamda sürekli öğrenmiyor — o hâlâ çözülmemiş bir problem. Model her turdan sonra kendine daha iyi talimat yazıyor ve bir sonraki sefer o talimatı önüne çekiyor. Zarif bir çözüm değil ve gerçek öğrenmeden muhtemelen daha hataya açık; ama çalışma bunun etkili bir çare olduğunu gösteriyor.

Çalışma, Andrej Karpathy'nin "LLM Wiki" fikrinden besleniyor: deneyimi kalıcı ve birikimli bilgiye dönüştürmek.

Üç katman

  • Ham katman. Araç çağrılarından sonuçlara kadar bütün yürütme kayıtlarını tutuyor. Bu veri değiştirilemiyor ve ham malzeme görevi görüyor.
  • Wiki katmanı. Ham veri burada yapılandırılmış içgörülere damıtılıyor: belgelenmiş başarısızlık örüntüleri ve işe yarayan stratejiler. Bu katman hiç sıfırlanmıyor, her turda yalnızca büyüyor.
  • Beceri katmanı. Ajanın görev yürütürken izlediği etkin yönergeler burada. Wiki'den farklı olarak beceriler, bir güncelleme performansı düşürürse geri alınabiliyor.

Döngü şöyle işliyor: bir çıkarım ajanı mevcut becerilerle görevleri yürütüp kayıt üretiyor. "Wiki Bakımcısı" bu kayıtları çözümleyip başarısızlık örüntülerini ve başarılı stratejileri wiki'ye yazıyor. "Beceri Önericisi" güncellenmiş wiki'yi kullanarak hedefli beceri değişiklikleri öneriyor. Son olarak bir kapı mekanizması, önerilen değişikliği ayrı bir doğrulama kümesinde sınayıp gerçekten işe yarayıp yaramadığını ölçüyor.

İşe yaramazsa beceri geri alınıyor ama wiki olduğu gibi kalıyor. Başarısız öneriler bile kaybolmuyor: wiki neyin denendiğini ve neden başarısız olduğunu belgeliyor, sonraki turlarda bunun üstüne inşa ediliyor.

Sonuçlar

Çerçeve beş kıyaslamada sınandı: matematiksel akıl yürütme, web araması, hesap tablosu işleme, belge üzerinden soru yanıtlama ve sanal ortamda etkileşimli görevler.

Ortalamada Gemini 3.5 Flash yüzde 49,5'ten yüzde 68,1'e, Qwen-3.6-27B ise yüzde 39,4'ten yüzde 63,3'e çıktı. Tek tek kıyaslamalarda sıçrama daha büyük olabiliyor: Gemini 3.5 Flash LiveMath'te yüzde 33'ten yüzde 72,6'ya yükseldi.

Nerede işe yaramıyor

Kazanç görev türüne göre çok değişiyor. En büyük iyileşme matematik ve hesap tablosunda; uzun belge bağlamı gerektiren görevlerde kazanç belirgin biçimde küçük.

Araştırmacıların açıklaması şu: Qwen-3.5-4B gibi küçük modeller, uzun bağlamlar boyunca çok adımlı arama stratejilerini güvenilir biçimde uygulamakta zorlanıyor ve varsayılan davranışlarına geri dönüyor. Yani talimatı okuyor ama sonuna kadar taşıyamıyor.

Buna karşılık WikiSkill kullanan küçük modeller, çerçeveyi kullanmayan büyük modellerin performansını yakalayabiliyor. Bir modelin geliştirdiği beceriler çoğu zaman başka bir modele aktarılabiliyor ve bazen alıcı modelin kendi ürettiğinden daha iyi çalışıyor — ama her zaman değil, o yüzden aktarılabilirlik vaka bazında denenmeli.