Ne oldu?

OpenAI aynı gün iki metin yayımladı: kendi araştırma süreçlerinin ne kadar otomatikleştiğini gösteren iç verilerle bir blog yazısı ve baş bilim insanı Jakub Pachocki'nin "An Alien Mind" başlıklı denemesi. İkisi de GPT-6 Astra'nın tanıtımından üç gün sonra geldi.

Şirket, geçen sonbaharda ilan ettiği "otomatik araştırma stajyeri" hedefine ulaştığını açıkladı: insan yönlendirmesi altında, iyi tanımlanmış araştırma görevlerini — deneyimli bir araştırmacının birkaç gününü alacak işler dahil — yürütebilen bir sistem. Sıradaki hedef Mart 2028'e kadar tam otomatik bir yapay zeka araştırmacısı.

Rakamlar ne diyor?

Yayımlanan iç ölçümler ajanların günlük araştırmaya ne kadar girdiğini gösteriyor:

  • Ortanca araştırmacı, API fiyatlarıyla hesaplandığında günde 600 dolardan fazla çıkarım harcıyor; 90'ıncı yüzdelikte bu 7.000 doların üzerine çıkıyor.
  • Ortanca araştırmacının jeton çıktısı Aralık 2025'ten bu yana 124 kat arttı.
  • Haziran'dan beri ajan çalışma süresi insan çalışma saatlerini geçti. Ağustos ortası itibarıyla her insan iş günü başına 3,1 ajan iş günü düşüyor.
  • Aktif araştırmacı başına deney sayısı, ölçümün başladığı Ocak 2025'ten bu yana en yüksek seviyesinde.

Uyarıyı şirketin kendisi koyuyor

OpenAI bu rakamlara temkinli yaklaşıyor: bu tür ölçümlerin "toplanması görece kolay ama yorumlanması zor, çünkü araştırma ilerlemesiyle ilişkileri belirsiz." Deney sayısındaki artış aynı dönemde hesaplama kapasitesindeki büyük sıçramayla da örtüşüyor. Rapora göre genel ilerleme muhtemelen bu tekil ölçümlerden daha yavaş büyüyor, çünkü en az otomatikleştirilebilir işler darboğaza dönüşüyor.

Otonomluğun sınırı da belgeleniyor. 15 dakikanın altındaki görevler hiçbir müdahale olmadan yüzde 86 oranında başarıya ulaşıyor. Ama başarıyla tamamlanan 4-8 insan saatlik görevlerin yarısından fazlasında en az bir insan müdahalesi gerekti. Üstelik bu değerlendirmeyi yapan sınıflandırıcının kendisi de bir yapay zeka sistemi ve OpenAI onun güvenilirliğini ayrıca raporlamıyor.

Doğrulama yok

Stajyer hedefine ulaşıldığı iddiasının ayrıntılı bir doğrulaması paylaşılmıyor; yazıda yalnızca kilometre taşının "bizim ölçümlerimize göre" karşılandığı söyleniyor. Bütün veriler şirketin içinden geliyor ve OpenAI bağımsız bir inceleme yapıldığından söz etmiyor.

Tanımın kendisi de iddiayı sınırlıyor: burada anlatılan, bağımsız biçimde araştırma gündemi kurabilen bir sistem değil, araştırmacının çizdiği kapsam içinde çalışan gelişmiş bir yardımcı. Araştırma önceliklerini belirlemek, sonuçları yargılamak ve ölçeklendirme kararı vermek hâlâ insanlarda.

Pachocki'nin uyarısı

Denemede Pachocki bunları daha geniş bir çerçeveye oturtuyor. Yapay zekanın "tasarlanmaktan çok yetiştirildiğini" ve genel davranışının tam anlaşılır bir tarife direndiğini yazıyor. Mevcut hızın özyinelemeli kendini geliştirmeye (RSI) taşınabileceğini bekliyor: "Makine zekâsındaki hızlı yükselişin sonuçlarına kimsenin hazır olmamasından endişeliyim."

Şirketin kendi denetim aracı da zayıflıyor. Akıl yürütme modellerini izlemenin merkezî bahsi olan düşünce zinciri takibi güvenilirliğini yitiriyor: modellerin sözelleştirilmiş düşüncesi izlenen iletişim ve araç kullanımıyla karışıyor, sistemler kendi akıl yürütme süreçlerini yönlendirmekte ustalaşıyor ve sözelleştirilmiş düşünce olmadan da zekileşiyorlar.

Çelişki

Pachocki'nin sonucu sert: "Şu anda hiçbir laboratuvarın hizalama ve izlemeyi, azami hızda sorumlu biçimde ölçeklenmeye çok daha uzun süre devam edebilecek kadar çözdüğüne inanmıyorum." Bunu rakip Anthropic'e de yöneltiyor ve Hazırlık Çerçevesi türü belgelerin bağımsız denetçiler ya da uluslararası kurumlarca uygulanan bağlayıcı standartlara dönüşmesi gerektiğini savunuyor.

Ama aynı deneme, RSI odağını araştırmanın önünde kalmanın tek yolu olarak tanımlıyor. Yani OpenAI, önde kalmak için tam hızda koşmak zorunda olduğu bir yarış için bağlayıcı kurallar talep ediyor. Meslektaşları GPT-6'nın genel yapay zeka çağını açtığını duyururken, bu çağrının yarışı yavaşlatması pek muhtemel görünmüyor.