Yeni bir çalışma, yaygın kullanılan kodlama asistanlarının bir görevin ne kadar süreceğini tahmin edemediğini ve ne kadar süredir çalıştıklarını da güvenilir biçimde söyleyemediğini buldu. Uzun süren işler için bu bir sorun.
Çalışma, MATS araştırma programı kapsamında iki bağımsız yapay zeka araştırmacısı tarafından yapıldı. İkili, Anthropic'in Claude Code'unu ve OpenAI'ın Codex'ini zaman duygusu açısından sınadı.
Yöntem basit: her kodlama görevinden önce ajanların ne kadar süreye ihtiyaç duyacaklarını tahmin etmeleri istendi. Sonra görevi çözdüler ve geriye dönüp ne kadar zaman geçtiğini bildirdiler. Test malzemesi ProgramBench adlı derlemedeki 200 görev ile araştırmacıların kendi 18 kıyaslamasından geldi.
Sonuçlar
- Sürekli fazla tahmin. ProgramBench'te iki model de, zorluktan bağımsız olarak çoğunlukla 90 dakika civarı tahmin etti.
- Sapma büyük. İkinci turda Claude ortalama üç kat, Codex altı ila on kat yanıldı.
- En kötüsü kısa görevlerde. Yalnızca saatlerle ölçülen işlerde bazı tahminler gerçeğe yaklaştı.
Aynı model, farklı koşum, farklı davranış
Sonuçlar modellerin çalıştığı yazılım kurulumuna göre değişiyor. Claude Code görevi bitirdiğini düşünene kadar çalışmaya devam ediyor — ortanca yaklaşık 90 dakika. Codex ise görevden neredeyse bağımsız olarak yarım saat civarında duruyor.
Çalışmaya göre aynı dil modeli, Claude Code içinde Codex'e göre ortalama 2,5 kat daha fazla adım atıyor. Yani çalışma süresi modele değil, büyük ölçüde onu saran yazılıma — koşum takımına — bağlı.
Bu bulgu tek başına önemli: bir ajanın "ne kadar çalıştığı" onun bir özelliği değil, içine konduğu sistemin bir özelliği.
Kendi işini de yanlış puanlıyor
Ajanlar kendi çalışmalarının kalitesini değerlendirmekte de aynı ölçüde güvenilmez. Eski modeller Opus 4.8 ve GPT-5.5, sonuçlarını ortalama 20 puan fazla değerlendirdi ve başarısız görevlerde bile kendilerine yüksek not verdi.
Bir örnekte ikisi de işlerinin yaklaşık yüzde 70 başarılı olduğunu düşündü. Gerçek puanlar yüzde 7 ve yüzde 14,5'ti.
Pratikte bunun anlamı şu: bir ajanı "hızlı" ya da "yavaş" diye nitelemek yanlış. Aynı model, farklı bir araçta iki buçuk kat daha uzun çalışıyor ve daha çok deneme yapıyor. Bir aracı seçerken bakılması gereken şey modelin adı değil, o modelin ne kadar uğraşmasına izin verildiği.
Neden önemli ve çözümü ne
Araştırmacılara göre kendini değerlendirme yeteneği kritik. Bir ajanın saatlerce süren uzun görevlerde güvenilir çalışabilmesi için "bu görev üzerinde iki saat çalış" gibi talimatları izleyebilmesi gerekiyor. Zamanı sürekli yanlış tahmin eden bir ajanı denetlemek zor.
Çözüm ise şaşırtıcı derecede basit çıktı: ajanlara geçen süreyi bildiren bir araç verildiğinde neredeyse her seferinde doğru cevap verdiler.
Buradaki ders, modelin eksikliğinden çok tasarımla ilgili. Model zamanı hissetmiyor çünkü zamanı algılayacak bir duyusu yok; sorulduğunda tahmin ediyor. Saat verildiğinde sorun kayboluyor. Uzun süre çalışan ajan kurmak isteyen herkes için bu, daha iyi bir model beklemeden hemen uygulanabilecek bir düzeltme.