Ne oldu?
Amazon Web Services (AWS), 14 Ağustos 2026 tarihinde Amazon Nova Forge platformunda çok turlu pekiştirmeli öğrenme (multi-turn reinforcement learning, RL) için özel ödül fonksiyonu tasarımını anlatan bir teknik blog yazısı yayımladı. Yazı, Amazon Nova modellerini pekiştirmeli ince ayar (reinforcement fine-tuning, RFT) yöntemiyle özelleştirmek isteyen geliştiricilere yönelik bir rehber niteliğinde.
Nova Forge, Bring Your Own Orchestration (BYOO) adlı özelliğiyle geliştiricilerin ödül mantığını kendi ortamlarında, örneğin Amazon Elastic Container Service (Amazon ECS) üzerinde çalıştırmasına olanak tanıyor. Platform ayrıca, bu altyapıyı yönetmek istemeyen ekipler için artık genel kullanıma açık olan sunucusuz (serverless) bir çok turlu RL seçeneği de sunuyor.
Neden önemli?
Çok turlu görevlerde -araç çağırma, kod çalıştırma veya hatadan kurtulma gibi adımlar içeren ajan tabanlı işlemlerde- doğru ödül fonksiyonu tasarlamak, modelin ne öğrendiğini doğrudan belirliyor. AWS'ye göre hafifçe hatalı bir ödül, eğitim eğrileri sağlıklı görünse bile modele yanlış davranışı öğretebiliyor.
Bu nedenle tek turlu görevlerde kullanılan AWS Lambda tabanlı ödül fonksiyonları, çok turlu görevlerde yetersiz kalıyor; zira uzun süreli konuşmalar ve puanlama işlemleri 15 dakikalık Lambda çağrı sınırını aşabiliyor. Nova Forge bu sorunu BYOO ile aşarak her bir yeniden oynatmayı (rollout) müşteri ortamına devrediyor ve tamamlanan bölümleri eğitim için geri topluyor.
Ödül fonksiyonu nasıl çalışıyor?
AWS'nin paylaştığı bilgilere göre sistem, Group Relative Policy Optimization (GRPO) algoritmasını kullanıyor. Bu yöntemde her konuşma için modelden birden fazla tamamlama (rollout) örneklenip ödül fonksiyonuyla sıralanıyor; en yüksek puanlı tamamlamalar model ağırlıklarını güncellemek için kullanılıyor.
- Sonuç ödülleri (episode-level): Nihai çıktının hedefi karşılayıp karşılamadığını ölçer, örneğin birim testlerin geçip geçmediğini.
- Davranışsal ödüller (turn-level): Modelin harekete geçmeden önce sorması veya doğru aracı çağırması gibi ara davranışları ölçer.
- Cezalar (penalties): Tahmin etme, tekrar etme veya durma gibi başarısızlık biçimlerini caydırır.
AWS, bu üç bileşenin birlikte kullanılmasının, modelin hem doğru davranışı hem de doğru sonucu öğrenmesini sağladığını, aksi halde bir bileşenin diğerini gölgeleyebileceğini belirtiyor.
Sırada ne var?
Blog yazısı, AWS'nin bu konudaki seri yazılarının ikinci parçası olarak sunuluyor; ilk bölüm Amazon SageMaker HyperPod ve Nova Forge altyapısını, eğitim yapılandırmasını ele almıştı. AWS, kod örneklerini aws-samples/sample-nova-multi-turn-rl-infra deposunda paylaştığını ve gerçek bir eğitim çalışmasından elde edilen hatalı ödül tasarımı örneklerini de yazının devamında ele alacağını duyurdu.
Ödül tasarımının kendi tuzağı
AWS'nin "hafifçe hatalı bir ödül, eğrileri sağlıklı gösterirken yanlış davranışı öğretir" uyarısı, yazının en önemli cümlesi. Çünkü tarif edilen üçlü yapının ikinci bileşeni -tur düzeyinde davranışsal ödüller- tam da ödül istismarının (reward hacking) yaşandığı yer.
Modelin harekete geçmeden önce soru sormasını ödüllendirirseniz, model soru sormayı öğrenir; görevi anlamayı değil. Gerekmediği yerde de sorar, çünkü ödül davranışa bağlıdır, uygunluğuna değil. Sonuç ödülüyle dengelenmediğinde bu tür ara teşvikler, ölçülen metriği iyileştirirken gerçek performansı düşürebilir.
BYOO'nun getirdiği ikinci konu da teknik değil sorumlulukla ilgili: yeniden oynatmalar müşterinin ortamında çalışıyor. Bu, hesaplama maliyetinin yanı sıra modelin ürettiği kodun sizin altyapınızda çalıştığı anlamına geliyor — izolasyon, kaynak sınırı ve ağ erişimi kararları artık eğitim yapılandırmasının bir parçası.