Ne oldu?
Saleh Almohaimeed ve dört meslektaşı, retrieval-augmented generation (bilgi getirimiyle zenginleştirilmiş üretim, RAG) sistemlerinde gizlilik sorununa çözüm sunan Sensitive Entity Alias Generator (SEAG) adlı bir çerçeveyi tanıttı. Çalışma 13 Ağustos 2026 tarihinde arXiv üzerinde yayımlandı. SEAG, hassas varlıkları (isim, kurum, kişisel veri gibi) tespit eden hafif bir model kullanarak bunlara karşılık gelen takma adlar üretiyor ve bir değiştirme tablosu oluşturuyor.
Bu tablo, kullanıcı sorgusundaki ve alınan belgelerdeki hassas kelimeleri, veriler üçüncü taraf bir üretici modele (external generator) iletilmeden önce değiştirmek için kullanılıyor. Böylece dış model, gerçek hassas bilgiye erişmeden yine de anlamlı ve doğru bir yanıt üretebiliyor.
Neden önemli?
Büyük dil modellerini (large language model, LLM) kullanan RAG sistemlerinde gizlilik araştırmaları şimdiye kadar genellikle yetkisiz kullanıcıların hassas verilere erişimini engellemeye odaklanmıştı. Ancak araştırmacılara göre gözden kaçan bir sorun, dış üretici modellerin sorguya ve alınan belgelere doğrudan erişebilmesiydi; bu durum gizli bilgilerin kötüye kullanılması veya amaç dışı erişilmesi riskini doğuruyordu. SEAG, kullanıcıların güçlü üçüncü taraf üretici modellerden faydalanırken hassas bilgilerini paylaşmak zorunda kalmamasını sağlıyor.
Bulgular
- Kullanıcı metriğinde, yani modelin hassas bilgiyi dış üreticiden gizlerken kullanıcıya doğru yanıt verme becerisinde tüm SEAG modelleri yüzde 80'in üzerinde doğruluk elde etti.
- Qwen-3 tabanlı SEAG modeli, belgelerdeki tüm hassas varlıkları gizleme konusunda yüzde 77,83 toplam doğruluk gösterdi.
- LLaMA-3.2 tabanlı model yüzde 76,73, Phi-4 tabanlı model ise yüzde 74,91 doğruluk elde etti.
- Araştırmacılar, SEAG modellerini eğitmek için bir veri kümesi, çerçeveyi değerlendirmek için ise ayrı bir veri kümesi oluşturdu.
Sırada ne var?
Çalışma, Knowledge-Based Systems dergisine gönderilmiş durumda ve hakem değerlendirme sürecinden geçmesi bekleniyor. Yayının arXiv sayfasında PDF, HTML ve TeX kaynak dosyaları erişime açık; kod ve veri paylaşımına ilişkin ayrıntılar henüz netleşmedi.
Yüzde 77 gizleme ne demek
Rakamlara yakından bakmak gerekiyor. En iyi sonucu veren modelde bile varlık gizleme başarısı yüzde 77,83; yani yaklaşık dört hassas varlıktan biri dış modele olduğu gibi gidiyor. Doğruluk ölçütlerinde yüzde 78 saygın bir sayı olabilir, ama gizlilik ölçütlerinde ortalamanın anlamı farklı: bir isim, bir kurum ya da bir hasta kaydı ya gizlenmiştir ya gizlenmemiştir. Yüzde 22'lik sızıntı, sistemi kullanan kurum için “kısmen korundum” değil, “neyin sızdığını bilmiyorum” demek.
Makale bir karşılaştırma tabanı da vermiyor. SEAG'ın hiç kullanılmadığı durumda ne kadar hassas varlığın geçtiği, ya da daha basit bir maskeleme yönteminin ne verdiği paylaşılmamış. Bu olmadan, çerçevenin katkısının nereden geldiğini ayırt etmek mümkün değil.
Riskin yer değiştirmesi
Yaklaşımın kendisi de bir soru doğuruyor. Takma ad tablosu, gerçek varlıklarla sahte karşılıklarını birebir eşleyen bir dosya — yani sistemin en hassas parçası artık o tablo. Dış modelden korunan bilgi, kendi altyapınızda saklanan yeni bir varlığa dönüşüyor. Bu bir kusur değil, mimari bir takas; ama makalenin sınırlar bölümü olmadığı için tartışılmadan kalıyor.
Pratikte önemli olan bir nokta daha var: takma ad değiştirme, hassas bilginin yalnızca adını gizliyor. Bir belgede kişinin adı takma adla değiştirilse bile, o belgedeki tarih, konum ve rol bilgisi kişiyi tanımlamaya yetebiliyor. Anonimleştirme literatüründe bilinen bu sorun, varlık düzeyinde çalışan her yöntemi ilgilendiriyor.