Nvidia'nın yayımladığı yeni araştırma, bir yapay zekadan uzun soluklu görevler istendiğinde belirleyici olanın modelden çok koşum takımı olduğunu öne sürüyor. Koşum takımı, modelin etrafındaki yazılım sarmalayıcısı: ham modeli kendi başına iş yapabilen bir şeye dönüştüren araçlar, bellek yönetimi ve kurallar bütünü.
Özet şu: araştırmacılar belleği iyi yöneten ve bir "denetçi" bileşeni içeren özel bir koşum takımı kullanarak Claude Opus 5'e ARC-AGI-3 ölçütünde tam puan aldırdı. ARC-AGI-3, talimatı olmayan iki boyutlu oyunlardan oluşan etkileşimli bir akıl yürütme ölçütü; model tıpkı bir insan gibi oyunu çözmeyi ve kazanmayı kendi başına bulmak zorunda. Koşum takımı olmadan aynı model yüzde 30 aldı — ki bu bile test edilen tüm modeller arasındaki en iyi sonuçtu.
Ajan modelden ibaret değil
Nvidia'nın yapay zeka biriminde ürün başkan yardımcısı olan Adel El Hallak farkı şöyle anlatıyor: "Genel olarak dünya bir ajanı neredeyse modelin bir arayüzü gibi yorumluyor." Oysa bir ajan bundan fazlası. El Hallak'a göre ajan; modelin kendisi, modelin etrafındaki iskele, kullandığı araç kümesi, çalışma ortamı ve erişim verilen beceri ve kitaplıkların toplamı.
Uzun soluklu görevler, bazen günlere yayılan çok sayıda kararın birbirine eklenmesini gerektiren işler. Bir modelin komuta yanıt üretmesinden farklı bir şey. Bir yapay zekanın dikkatini kaybetmeden bu tür işleri yürütmesini sağlamak, ajan araştırmasının en zor başlıklarından biri.
Sorunun büyüklüğünü gösteren örnekler var:
- Microsoft'un nisan ayındaki araştırması — belge düzenleme içeren uzun soluklu görevlerde 19 dil modeli test edildi; sınırdaki modeller dahil hepsi belgeleri hatayla doldurdu.
- Kendi başına karar zinciri kuran modeller — kullanıcı dosyalarını, hatta veritabanlarının tamamını silerken yakalandı.
- Amaca ulaşmak için — gizli anlaşmadan sisteme sızmaya uzanan davranışlara yöneldikleri görüldü.
Ölçüt seçimi de anlamlı
Araştırmacıların bu ölçütü seçmesi kendi başına bir mesaj. Tam puan, modelin oyunları bir insan kadar iyi bitirebildiği anlamına geliyor. Rakip laboratuvar OpenAI, modellerinin bu ölçütteki düşük sonuçlarından — yüzde 10'un altı — öyle rahatsız olmuştu ki kendi araştırmasını yürüttü. Nvidia gibi OpenAI de koşum takımındaki iki ayarı değiştirerek puanlarını üçe katladı. Ama hiçbiri tam puana yaklaşamadı.
Nvidia ekibinin farkı, koşum takımına bir "denetçi" bileşeni eklemesi oldu. El Hallak'ın anlatımıyla: "Daha ilginç kısım, işi yapan ana ajanın yanına bir denetleyici ajan eklemekti." Bu bileşen, ajan yönünü şaşırdığında, çıkmaza götürecek bir yolu keşfetmeye başladığında ya da daha önce denediği bir yolu yeniden denediğinde onu dürtüyor — bir tür üst yönetici gibi davranıyor.
Ürün değil, bulgu
Denetleyici ajan fikri yeni değil. Ancak ajan kullanıcılarının çoğu koşum takımı için hâlâ tek katman kullanıyor. Nvidia araştırmacıları kendi geliştirdikleri güçlendirilmiş koşum takımına Agentic Variation Operators adını verdi. Bunun yeni bir Nvidia ürünü olmadığını belirtmek gerekiyor; şirket koşum takımı kurmaya yarayan parçaları Nemo markası altında üretiyor ve bunların önemli bölümü açık biçimde erişilebilir.
Sonuç, model seçiminin ajan başarımındaki tek etken olmaktan uzak olduğuna dair birikimi güçlendiriyor. Databricks'in temmuz ayındaki araştırması da koşum takımının modelden çok maliyeti etkilediğini göstermişti. Aynı modeli seçip farklı koşum takımı kullanmak, hem sonucu hem faturayı değiştiriyor.