Anthropic, Claude 5.5 ailesinin ilk modeli olan Claude Opus 5.5'i yayımladı. Şirkete göre model çoğu işte Claude Fable 5.1 seviyesinde sonuç veriyor ve tipik iş yüklerinde, varsayılan ayarlarda Opus 5'e göre yüzde 40 daha ucuza çalışıyor.

Duyurunun zamanlaması dikkat çekici: TechCrunch'ın aktardığına göre Anthropic modeli, OpenAI'ın GPT-6 Sol ve Luna duyurusundan yalnızca 90 dakika önce yayımladı. İki şirket de aynı hafta aynı vaadi verdi: biraz daha iyi sonuç, belirgin biçimde daha az para.

Maliyet nereden düşüyor?

Anthropic'e göre Opus 5.5, Opus 5'e kıyasla daha az işlem gücüyle sunuluyor ve fiyatlandırma bunu yansıtıyor. Kazanç üç yerden geliyor:

  • Ajan ve kodlama işlerinde maliyetin büyük kısmını oluşturan önbellek okumaları yüzde 60 ucuzladı.
  • Model görev başına daha az jeton harcıyor.
  • Çıktı üretimi Opus 5'e göre yüzde 30'dan fazla hızlandı.

Bu üçü birleşince tipik iş yükünde yüzde 40 maliyet düşüşü çıkıyor. Claude Code ve Claude Platform'daki hızlı kipte ise model 2,5 kata kadar hızlanıyor; bu kipin fiyatı milyon jeton başına 8 dolar girdi ve 40 dolar çıktı. Anthropic ayrıca Pro, Max, Team ve koltuk bazlı Enterprise planlarında beş saatlik kullanım sınırlarını yükseltiyor.

Kıyaslamalar: lider ama temiz bir üstünlük değil

Anthropic'in kendi testlerinde Opus 5.5 ajan tabanlı kodlama, bilgisayar kullanımı ve bilgi işlerinde önde görünüyor. Ama şirketin kendisi iki uyarı koyuyor: GPT-6 Astra hâlâ Terminal-Bench-Science ve AutomationBench'te lider, ve kıyaslama farkları artık güvenilir bir rehber olmaktan uzaklaşıyor. Anthropic, kendi kullanımında Fable 5.1 ile arasındaki farkın puanların gösterdiğinden dar olduğunu söylüyor.

Maliyete göre düzeltilmiş sonuçlar daha anlamlı. Varsayılan orta çaba ayarında Opus 5.5, FrontierCode testinde yüzde 54,6 alıyor; bu, GPT-6 Astra'nın yüzde 53,3'lük en iyi sonucunu görev başına yaklaşık beşte bir maliyetle geçiyor. CursorBench'te orta ayarda yüzde 52,5 alıyor, yani GPT-5.6 Sol'ün en iyi sonucunun 11 puan üzerinde ve yaklaşık üçte bir maliyetle.

Erken kullanıcıların bildirdikleri

Anthropic'in paylaştığı örnekler, modelin uzun süren işlerdeki iddiasını gösteriyor:

  • Bir test kullanıcısı 680 bin satırlık bir kod taşımasını bir günden kısa sürede bitirdi.
  • Bir diğeri 200 bin satırlık bir kod tabanını üç saatten kısa sürede denetleyip düzeltti; aynı iş Opus 5 ile 20 saatten uzun sürmüş ve 2,5 katı jeton harcamıştı.
  • Şirket içi bir C'den Rust'a taşıma işinde Opus 5.5 işi 9,5 saatte bitirdi; Fable 5.1 aynı işi 12 saatte yaptı ve Opus 5.5 yüzde 51 daha ucuza mal oldu.
  • Deloitte'a göre en düşük çaba ayarındaki Opus 5.5, bilinen inceleme hatalarının yüzde 72'sini yakaladı; yüksek ayardaki Opus 5 yüzde 56'sını yakalıyordu.

Bu sonuçların hepsinin üreticiden ve onun seçtiği erken kullanıcılardan geldiğini akılda tutmak gerekiyor.

Erişim

Model claude-opus-5-5 adıyla Claude Platform, Amazon Web Services, Google Cloud ve Microsoft Azure üzerinden çağrılabiliyor. Önceki Opus modellerinde olduğu gibi sıfır veri saklama seçeneği var. Ağırlıklar yayımlanmadı, yani kendi donanımınızda çalıştırmak mümkün değil.

Geliştirici açısından asıl soru şu: bu iki duyuru da aynı vaadi verirken, hangisinin sizin işinizde daha ucuza çalıştığını üreticinin tablosu söyleyemez. Bunu ancak kendi iş yükünüzle ölçerek görebilirsiniz.