Ne oldu?
Amazon Web Services (AWS), 14 Ağustos 2026 tarihli teknik blog yazısında Amazon Bedrock AgentCore ile Amazon SageMaker AI'ı birleştiren bir çoklu ajan (multi-agent) mimarisi tanıttı. Bu yaklaşım, geliştiricilerin yönetilen temel modelleri (foundation models) kendi maliyet-optimize edilmiş veya alana özel modelleriyle ajan çerçevesini yeniden yazmadan bir arada kullanmasını amaçlıyor.
Örnek mimaride üç farklı model barındırma yolu tek bir Bedrock AgentCore konteynerinde birleştirildi. Orkestratör ajan Claude Haiku 4.5 modelini, bütçe ajanı Claude Sonnet 4.6 modelini Bedrock üzerinden kullanırken, finansal analiz ajanı SageMaker AI üzerinde vLLM ile dağıtılan Qwen 3.5 9B modelini OpenAI uyumlu API üzerinden çağırıyor.
Neden önemli?
Kurumsal geliştiriciler genellikle maliyet optimizasyonu, veri ikametgahı (data residency) ve model esnekliği gereksinimleri arasında denge kurmak zorunda kalıyor. AWS'nin gösterdiği mimari, farklı iş yükleri için farklı modelleri aynı üretim hattında birleştirerek bu üç gereksinimi tek bir yapıda karşılamayı hedefliyor.
Blog yazısı, ayrıca önemli bir teknik boşluğa dikkat çekiyor: Bedrock AgentCore runtime, ajanları OpenTelemetry ile otomatik olarak izlerken bu izleme yalnızca Bedrock model çağrılarını kapsıyor. SageMaker üzerindeki OpenAI uyumlu uç noktalar için token kullanımı varsayılan olarak görünmüyor; bu da maliyet takibi ve gecikme hata ayıklamasını zorlaştırıyor. AWS bu sorunu, özel bir gen_ai.chat span'i oluşturarak Strands Agents'ın dahili metriklerinden token kullanımını manuel olarak çıkarmayı öneren bir çözümle ele alıyor.
Mimaride kullanılan modeller
| Ajan | Model | Barındırma | Görev |
|---|---|---|---|
| Orkestratör | Claude Haiku 4.5 | Amazon Bedrock | Kullanıcı niyetini sınıflandırma ve yönlendirme |
| Bütçe ajanı | Claude Sonnet 4.6 | Amazon Bedrock | 50/30/20 bütçe ayrımı, yapılandırılmış çıktı |
| Finansal analiz ajanı | Qwen 3.5 9B | Amazon SageMaker AI (vLLM, ml.g6e.2xlarge) | Hisse senedi analizi ve portföy oluşturma |
Bilinenler
- Qwen 3.5 9B, vLLM 0.22.1 içeren derin öğrenme konteyneri (Deep Learning Container) ile tek bir L40S GPU'lu ml.g6e.2xlarge örneğinde dağıtıldı.
- Sistem, Strands Agents kütüphanesinin 'araç olarak ajanlar' (agents as tools) desenini kullanıyor.
- Dağıtım, bedrock-agentcore-starter-toolkit üzerinden ap-south-1 bölgesinde gerçekleştirildi.
- Tam kaynak kodu AWS'nin ilişkili GitHub deposunda paylaşıldı.
Sırada ne var?
AWS, blog yazısında bu mimarinin bir referans uygulama olarak sunulduğunu belirtiyor; geliştiricilerin kendi model karışımlarını benzer bir yapıyla üretime taşıyabileceğini gösteriyor. Şirket, Bedrock model erişiminin bölgeye göre değiştiğini ve geliştiricilerin desteklenen modelleri AWS dokümantasyonundan kontrol etmesi gerektiğini hatırlatıyor.
Asıl karar model değil, doluluk
Mimarinin ilginç yanı model seçimi değil, faturalama biçimlerinin karışması. Bedrock jeton başına ücretlendiriyor; SageMaker'daki GPU örneği ise istek gelsin gelmesin saatlik çalışıyor. Yani kendi modelini barındırmanın hesabı "jeton başına ucuz mu" sorusuyla değil, "bu örneği ne kadar dolu tutabiliyorum" sorusuyla veriliyor.
Düşük trafikte boşta bekleyen bir L40S, aynı işi yapan yönetilen bir modelden pahalıya gelir; yoğun ve sürekli iş yükünde ise tersi olur. Veri ikametgahı gereksinimi varsa bu hesap zaten baştan kapanır — o durumda barındırma bir maliyet tercihi değil, zorunluluk.
Blog yazısının en değerli kısmı da bir eksiği itiraf etmesi: AgentCore'un otomatik izlemesi yalnızca Bedrock çağrılarını görüyor, SageMaker uç noktasındaki jeton kullanımı varsayılan olarak kayda girmiyor. Elle span açarak kapatılan bu boşluk, karışık barındırmanın gizli bedelini gösteriyor — maliyetini göremediğiniz bir bileşen, optimize edemediğiniz bir bileşendir.