Yapay zeka sohbet robotlarından otonom ajanlara kaydıkça, açık modeller yapay zekanın nerede çalıştığı ve nasıl dağıtıldığı üzerinde tam denetim talebini karşılıyor. NVIDIA bu talebe iki yeni ürünle karşılık verdi.

Nemotron 3.5 Lightning

Şirket Nemotron 3 model ailesini Nemotron 3.5 Lightning ile genişletti: uzun süreli ajan iş yükleri için sınıfının en verimli modeli olarak tanıtılan, 30 milyar parametreli bir uzman karışımı (mixture-of-experts) modeli. Sürüm, Nemotron 3 Nano'nun ardından geliyor.

Model daha büyük çok ajanlı sistemlerin içindeki uzmanlaşmış görevler için tasarlanmış. Şirketin verdiği rakamlar:

  • Sınıfındaki diğer modellere kıyasla dört kata kadar hızlı çıktı üretimi
  • Buna bağlı olarak yüzde 30 daha hızlı ajan görevi tamamlama
  • Açık ve özelleştirilebilir olduğu için NVIDIA NeMo ile kurumun kendi alan verisi, araçları ve iş akışları üzerinde ek eğitimden geçirilebiliyor

Model, değerlendirme yöntemleri, çıkarım yazılımı ve veri kümeleri sağlayan Nemotron Koalisyonu üyelerinin katkısıyla geliştirildi.

Model topluluğu fikri

NVIDIA'nın anlattığı mimari, tek bir dev modele değil bir model topluluğuna dayanıyor. Sürekli çalışan modern ajan sistemleri giderek farklı görevler için uzmanlaşmış model kümeleri hâlinde işliyor.

Pratikte bu şu anlama geliyor: Nemotron 3 Ultra ya da GPT-5.6 gibi öncü bir akıl yürütme modeli iş akışını planlayıp yönetirken, Nemotron 3.5 Lightning gibi daha küçük ve uzmanlaşmış modeller hedefli işleri yapıyor — kod incelemesi, araç kullanımı, güvenlik uyarısı izleme ya da fatura sorularını yanıtlama gibi.

NeMo Switchyard

İkinci ürün bu mimarinin eksik parçasını dolduruyor. NeMo Switchyard, yaygın ajan araçlarının içinde akıllı yönlendirme yapan açık kaynaklı bir kütüphane. Kurumlar kendi ihtiyaçlarına göre bir yönlendirici kurabiliyor.

Devreye alındığında Switchyard her isteği o iş için en yetkin ve en uygun modele yönlendiriyor — geliştiricinin kendi açık, tescilli ve NVIDIA modelleri karışımı arasında, üstelik uygulamaların yeniden yazılmasını gerektirmeden.

Kimler kullanıyor

Şirketin aktardığına göre çeşitli sektörlerden kurumlar modeli kendi iş yüklerine göre özelleştiriyor: siber güvenlik için CrowdStrike, hukuk hizmetleri için Trajectory ile birlikte Harvey, kod incelemesi için Baseten ile birlikte CodeRabbit. Lila Sciences fiziksel ve yaşam bilimlerindeki ajan görevlerinde akıl yürütmeyi geliştirmeye çalışıyor; Fastino Labs ise modeli özelleştirerek yazılım geliştirme, finans ve sağlık iş yüklerinde önde gelen doğruluk oranları elde ettiğini bildiriyor.

Model yerel yapay zeka sistemlerinde de çalışabiliyor; bu, kurumlara gizlilik ve dağıtım üzerinde denetim veriyor.

Küçük modelin ekonomisi

Sürümün asıl mesajı boyutla ilgili. Sürekli çalışan bir ajan sisteminde her isteği en büyük modele göndermek hem pahalı hem yavaş. Kod incelemesi ya da fatura sorusu yanıtlama gibi dar görevler, o görevi bilen küçük bir modelle çok daha ucuza yapılabiliyor.

Switchyard'ın önemi de burada: yönlendirme kararı otomatikleşmezse model topluluğu fikri kâğıt üstünde kalıyor. Her isteği elle doğru modele göndermek geliştiriciye kalırsa, çoğu ekip pratiklik adına her şeyi tek modele yollamayı seçiyor.