OpenAI, GPT-6 ailesine iki yeni model ekledi: GPT-6 Sol ve GPT-6 Luna. İkisi de eylül başında çıkan GPT-6 Astra'nın altında konumlanıyor ve Astra'ya benzer yöntemlerle eğitildi. Duyurunun ana başlığı yetenek değil fiyat: iki modelin de jeton ücreti yarıya indi.
The Decoder'ın değerlendirmesi daha keskin: fiyatlar yarıya iniyor ama performans iğneyi zar zor oynatıyor. Modeller seleflerinin seviyesinde iş çıkarıyor, yarı fiyata.
Yeni fiyatlar
| Model | Girdi (milyon jeton) | Çıktı (milyon jeton) |
|---|---|---|
| GPT-6 Sol | 4 dolar → 2 dolar | 20 dolar → 10 dolar |
| GPT-6 Luna | 0,20 dolar → 0,10 dolar | 1,20 dolar → 0,50 dolar |
Luna'nın çıktı fiyatındaki düşüş aslında yüzde 50 değil, yüzde 58'e yakın. OpenAI indirimi önbellekleme ve çıkarım tarafındaki iyileştirmelere bağlıyor ve tasarrufu doğrudan kullanıcıya yansıttığını söylüyor. Listedeki en ucuz model olan Terra ise artık sunulmuyor.
Hangi model ne için?
- Astra: en zor işler için en üst model.
- Sol: yeni özellik geliştirme, kod inceleme, hata ayıklama ve veri analizi gibi karmaşık ve tekrar eden işler.
- Luna: belge özetleme, bilgi çıkarma, kısa soru yanıtlama gibi yüksek hacimli ve tanımı net işler.
Kıyaslamalar: kazanç maliyet tarafında
OpenAI'ın paylaştığı sonuçlar mutlak puanlardan çok görev başına maliyete bakıyor. İş akışlarını 47 araç üzerinden ölçen AutomationBench'te Sol, en yüksek çaba ayarında yüzde 33,2 alıyor ve görev başına 27 sent harcıyor; Claude Opus 5 en yüksek ayarda yüzde 26,9 alırken maliyeti 11 katı. Bilgisayar kullanımını ölçen OSWorld 2.0'da Sol yüzde 60,5, Opus 5 orta ayarda yüzde 60,3 alıyor; Sol'ün görev maliyeti yaklaşık yüzde 80 daha düşük.
Kodlamada DeepSWE testinde Sol yüzde 68,8 ile Claude Fable 5'in 1,1 puan gerisinde kalıyor, ama görev başına maliyeti yaklaşık yüzde 80 daha az. Luna aynı testte yüzde 66,6 alıyor ve karşılaştırılan modellerden yüzde 93 ila 96 daha ucuza çalışıyor.
Bütün bu sayıların üreticinin kendi ölçümü olduğunu hatırlatmak gerekiyor. Bağımsız ölçüm yayımlandığında tablo değişebilir; nitekim bir gün önce xAI'ın Grok 4.7 duyurusunda şirket tablosuyla bağımsız ölçüm arasında belirgin fark çıkmıştı.
Doğruluk ve önbellek
OpenAI'ın kendi doğruluk testi, kullanıcıların hata olarak işaretlediği gerçek ChatGPT konuşmalarından oluşuyor. Şirkete göre Sol, selefinin yaklaşık yarısı kadar hata yapıyor. Ajanlar için önemli bir başka değişiklik de istem önbelleğinde: önbellekten okunan girdide yüzde 90 indirim var, yeni bir önbellek panosu geldi ve geliştiriciler çaba ayarını değiştirdiğinde önbellek artık geçersiz olmuyor.
Modeller API'de gpt-6-sol ve gpt-6-luna adlarıyla çalışıyor; ağırlıklar yayımlanmadığı için kendi sunucunuzda çalıştırmak mümkün değil. ChatGPT tarafında Work ve Codex kullanıcıları erişebiliyor, Luna ise masaüstü uygulamasında ücretsiz kullanıcılara da açılıyor.
Zamanlama rekabeti özetliyor: TechCrunch'a göre Anthropic, Claude Opus 5.5'i OpenAI'ın duyurusundan yalnızca 90 dakika önce yayımladı.