Yapay zeka durağan soru-cevaptan hızla uzaklaşıp karmaşık, çok adımlı ortamlarda plan yapabilen, akıl yürütebilen ve eyleme geçebilen otonom ajanlara doğru ilerliyor. Microsoft Research bu alandaki araştırmayı ucuzlatmayı hedefleyen açık kaynaklı bir çerçeve yayımladı: Orchard.

Ortak altyapı fikri

Çerçevenin merkezinde Orchard Env duruyor: farklı görev alanlarında ajan eğitmek ve değerlendirmek için yeniden kullanılabilir bir ortam servisi.

Buradaki asıl iddia teknik değil ekonomik. Ajan araştırmasında her ekip kendi ortamını, veri hattını ve değerlendirme akışını sıfırdan kuruyor; bu iş, araştırmanın kendisinden daha çok zaman alabiliyor. Aynı altyapının yazılım mühendisliği, web gezinme ve kişisel asistan ajanlarını birden desteklemesi, o tekrarı ortadan kaldırıyor.

Dahası, ajanlar gerçek dağıtım iskelelerinin içinde doğrudan eğitilebiliyor — Codex, OpenClaw ve ZeroClaw gibi. Bu ayrım önemli: eğitim ortamı ile çalışma ortamı arasındaki fark, laboratuvarda iyi çalışan bir ajanın sahada tökezlemesinin bilinen sebeplerinden biri.

Rakam: 3 milyar parametre

Çerçeveyle birlikte üç örnek model yayımlandı: Orchard-SWE, Orchard-GUI ve Orchard-Claw. Ortak gösterdikleri şey, görece küçük açık ağırlıklı modellerin karmaşık gerçek dünya görevlerinde güçlü sonuçlar alabilmesi.

En çarpıcı ölçüm Orchard-SWE'den geliyor. Model, yazılım mühendisliği görevlerini ölçen SWE-bench Verified testinde yüzde 69,7 alıyor. Değer modeliyle yeniden sıralama uygulandığında bu oran yüzde 73'e çıkıyor.

Rakamı anlamlı kılan şey maliyeti: bu sonuç yalnızca yaklaşık 3 milyar etkin parametreyle elde ediliyor ve on kattan fazla büyük modeller kullanan öncü sistemlere yaklaşıyor.

Neden önemli

Bu, son dönemde tekrarlanan bir bulgunun bir örneği daha: model boyutu tek başına belirleyici değil. Görev dar tanımlandığında ve eğitim gerçek çalışma ortamının içinde yapıldığında, çok daha küçük bir model çok daha büyüğüne yaklaşabiliyor.

Pratik karşılığı doğrudan maliyet. Üç milyar etkin parametreli bir modeli çalıştırmak, otuz milyarlık bir modeli çalıştırmaktan kat kat ucuz — ve sürekli çalışan ajan sistemlerinde bu fark her istekte tekrarlanıyor.

Proje modellerin ve iş akışlarının yanında eğitim verisini ve değerlendirme yöntemlerini de yayımlıyor. Amaç, açık ajan sistemleri kuran ve inceleyen daha geniş bir araştırma topluluğuna zemin sağlamak.

Açık yayımlamanın anlamı

Çerçevenin açık kaynak olması, sonucun doğrulanabilir olması demek. SWE-bench Verified puanı bağımsız olarak sınanabiliyor; eğitim verisi ve değerlendirme yöntemi de yayımlandığı için sonucun nasıl elde edildiği görülebiliyor.

Bu, kapalı sistemlerin duyurduğu rakamlardan farklı bir kategori. Şirketin kendi ölçümüne dayanan bir iddia ile başkasının tekrarlayabileceği bir ölçüm arasındaki fark, aynı yüzdenin ne kadar anlam taşıdığını belirliyor.

Rakamlarla

  • Orchard-SWE: SWE-bench Verified'da yüzde 69,7 — yeniden sıralamayla yüzde 73
  • Etkin parametre: yaklaşık 3 milyar
  • Karşılaştırma: on kattan fazla büyük öncü sistemlere yaklaşıyor
  • Yayımlananlar: çerçeve, üç model, eğitim verisi ve değerlendirme yöntemleri
  • Desteklenen iskeleler: Codex, OpenClaw, ZeroClaw