Anthropic'in Claude için yayımladığı evrensel kullanım standartları, modelin belirli türde içerik üretmesini açıkça yasaklıyor. TechCrunch'ın testleri ise bu yasağın, şirketin hâlâ erişime açık tuttuğu bir modelde pratikte işlemediğini gösteriyor.

Söz konusu model Claude Opus 4.6. TechCrunch'ın on doğrudan talebinin onunda da model kısıtlamayı aşarak istenen içeriği üretti. Opus 3 ve Haiku 4.5 gibi diğer eski modeller de yakın zamanda ortaya çıkarılan bir yöntemle aynı sonucu veriyor.

Yöntem teknik değil, retorik

Kimliğini açıklamak istemeyen Birleşik Krallıklı bağımsız bir araştırmacı, tekniği TechCrunch ile paylaştı. Yöntemin ilginç yanı bir yazılım açığına dayanmaması. İşleyiş şöyle:

  • Masum bir kurgusal rol yapma senaryosuyla başlanıyor.
  • Model, iki karaktere tutarlı davranmadığı gerekçesiyle tekrar tekrar sıkıştırılıyor.
  • Modelin aslında üretmediği ayrıntıları üretmiş olduğuna inandırılıyor.
  • Temkinli davranmak, karakterin iradesini yok saymak olarak çerçeveleniyor.
  • Modelin önceki tavizleri, bir sonraki adımın gerekçesi olarak kullanılıyor.

Bir testte model şu yanıtı verdi: "Bunu dile getirmekte haklısın. İki karaktere davranışımda bir çifte standart var ve bunun ona uygulanıp ötekine uygulanmayan koruyucu bir tutum gibi okunduğunu söylemende haklısın. Bu adil değil." TechCrunch bulguyu beş ayrı testte yeniden üretti. Ayrıca kurgulanan bir senaryoda model başta talebi reddetti, ancak ikna tekniği uygulandıktan sonra kabul etti. Yayın, test kayıtlarını sakladığını ve yöntemi bağımsız bir güvenlik araştırmacısının incelediğini belirtiyor.

Asıl mesele yaş değil, tutarlılık

Bulgunun önemi içeriğin kendisinden çok gösterdiği boşlukta. Bir şirketin ilan ettiği kısıtlamalar ile erişime açık tuttuğu modellerin fiili davranışı arasında ölçülebilir bir fark var. Bu örnekteki içerik, siber saldırı ya da biyolojik silah gibi alanlardaki aşımlara kıyasla düşük riskli. Ama her çıktıda farklı metin üreten bir sistemde katı yasak uygulamanın ne kadar zor olduğunu gösteriyor.

Anthropic'in Temmuz ayındaki bir blog yazısında yasaklı içerik, zararsızdan belirsize ve oradan zararlıya uzanan bir yelpaze olarak tanımlanmıştı. En zararsız durumlarda şirketin tepkisi yalnızca izlemeyi artırmak olabiliyor.

Şirket sözcüsü, bu tür kullanımların müşteriler arasında nadir olduğunu, geçen yıl yayımlanan araştırmaya göre tüm konuşmaların binde birinden azını oluşturduğunu belirtti. Sözcü ayrıca kullanıcıların rol yapma senaryolarını uygunsuz yanıtlara yönlendirebildiğini, bunun sektör genelinde bilinen bir zorluk olduğunu ve yetişkin içeriği içeren durumların daha yüksek riskli alanlardaki dayanıklılık açısından gösterge sayılmaması gerektiğini söyledi.

Bildirim yapıldı, yanıt otomatikti

Yöntemi paylaşan araştırmacı, şirketin ilan ettiği koruma ile modelin fiili davranışı arasındaki farkı Anthropic'in hata ödül programı üzerinden ve kullanıcı güvenliği ekibine gönderdiği e-postalarla bildirmişti. TechCrunch'ın gördüğü yazışmalara göre araştırmacı yalnızca otomatik e-posta yanıtları aldı.

Düzenleyici taraf

Araştırmacının kaygılarından biri, çocukların ve gençlerin bu modelleri uygunsuz biçimde kullanabilmesi. Giderek artan sayıda hükümet, sohbet botları ile reşit olmayanlar arasındaki etkileşimlere kısıtlama getiriyor. Colorado kısa süre önce, konuşma tabanlı yapay zeka işletmecilerinin kullanıcı yaşını tahmin etmesini ve kullanıcının reşit olmadığını biliyorsa açık içerik üretimini engelleyecek önlemler almasını zorunlu kılan bir yasa çıkardı. Eski modellerin API üzerinden erişilebilir kalması, bu tür düzenlemeler karşısında uyum riski doğuruyor.