Ne oldu?

Amazon Web Services (AWS), 14 Ağustos 2026 tarihinde Amazon Nova Forge platformunda çok turlu pekiştirmeli öğrenme (multi-turn reinforcement learning, RL) için özel ödül fonksiyonu tasarımını anlatan bir teknik blog yazısı yayımladı. Yazı, Amazon Nova modellerini pekiştirmeli ince ayar (reinforcement fine-tuning, RFT) yöntemiyle özelleştirmek isteyen geliştiricilere yönelik bir rehber niteliğinde.

Nova Forge, Bring Your Own Orchestration (BYOO) adlı özelliğiyle geliştiricilerin ödül mantığını kendi ortamlarında, örneğin Amazon Elastic Container Service (Amazon ECS) üzerinde çalıştırmasına olanak tanıyor. Platform ayrıca, bu altyapıyı yönetmek istemeyen ekipler için artık genel kullanıma açık olan sunucusuz (serverless) bir çok turlu RL seçeneği de sunuyor.

Neden önemli?

Çok turlu görevlerde -araç çağırma, kod çalıştırma veya hatadan kurtulma gibi adımlar içeren ajan tabanlı işlemlerde- doğru ödül fonksiyonu tasarlamak, modelin ne öğrendiğini doğrudan belirliyor. AWS'ye göre hafifçe hatalı bir ödül, eğitim eğrileri sağlıklı görünse bile modele yanlış davranışı öğretebiliyor.

Bu nedenle tek turlu görevlerde kullanılan AWS Lambda tabanlı ödül fonksiyonları, çok turlu görevlerde yetersiz kalıyor; zira uzun süreli konuşmalar ve puanlama işlemleri 15 dakikalık Lambda çağrı sınırını aşabiliyor. Nova Forge bu sorunu BYOO ile aşarak her bir yeniden oynatmayı (rollout) müşteri ortamına devrediyor ve tamamlanan bölümleri eğitim için geri topluyor.

Ödül fonksiyonu nasıl çalışıyor?

AWS'nin paylaştığı bilgilere göre sistem, Group Relative Policy Optimization (GRPO) algoritmasını kullanıyor. Bu yöntemde her konuşma için modelden birden fazla tamamlama (rollout) örneklenip ödül fonksiyonuyla sıralanıyor; en yüksek puanlı tamamlamalar model ağırlıklarını güncellemek için kullanılıyor.

  • Sonuç ödülleri (episode-level): Nihai çıktının hedefi karşılayıp karşılamadığını ölçer, örneğin birim testlerin geçip geçmediğini.
  • Davranışsal ödüller (turn-level): Modelin harekete geçmeden önce sorması veya doğru aracı çağırması gibi ara davranışları ölçer.
  • Cezalar (penalties): Tahmin etme, tekrar etme veya durma gibi başarısızlık biçimlerini caydırır.

AWS, bu üç bileşenin birlikte kullanılmasının, modelin hem doğru davranışı hem de doğru sonucu öğrenmesini sağladığını, aksi halde bir bileşenin diğerini gölgeleyebileceğini belirtiyor.

Sırada ne var?

Blog yazısı, AWS'nin bu konudaki seri yazılarının ikinci parçası olarak sunuluyor; ilk bölüm Amazon SageMaker HyperPod ve Nova Forge altyapısını, eğitim yapılandırmasını ele almıştı. AWS, kod örneklerini aws-samples/sample-nova-multi-turn-rl-infra deposunda paylaştığını ve gerçek bir eğitim çalışmasından elde edilen hatalı ödül tasarımı örneklerini de yazının devamında ele alacağını duyurdu.