Elon Musk'ın yapay zeka şirketi xAI, kodlama, ajan görevleri ve bilgi işleri için yeni amiral modeli Grok 4.7'yi yayımladı. MarkTechPost'un aktardığı duyuruda şirket adı SpaceXAI olarak geçiyor. Modelin en dikkat çeken yanı fiyatı: milyon girdi jetonu başına 2 dolar, milyon çıktı jetonu başına 6 dolar. Bu, Grok 4.6'nın fiyatıyla aynı.
Grok 4.7'nin asıl hikayesi ise iki tablo arasındaki fark: şirketin kendi ölçümleri büyük bir sıçrama gösteriyor, bağımsız ölçüm modeli orta sıraya yerleştiriyor.
Neler değişti?
xAI'ın Grok 4.6'ya göre saydığı dört değişiklik şunlar:
- Yeni ve daha büyük bir taban model; Grok 4.6'nın tabanı yeniden kullanılmadı.
- Tamamlanması saatler süren zor görevlere ağırlık veren daha uzun bir pekiştirmeli öğrenme turu.
- Kendi çıktısını daha dikkatli denetleme ve uzun bağlamı daha iyi işleme.
- Sohbet ve bilgi işleri için Grok Bot ortamına yerleşik destek.
İki tablo, iki sonuç
Şirketin tablosunda Grok 4.7 her satırda Grok 4.6'yı geçiyor. En büyük sıçrama Terminal-Bench 4.0'da: yüzde 20,3'ten yüzde 38'e. Harvey'nin hukuk ajanı testinde Grok 4.7 yüzde 19,6 alırken Claude Fable 5.1 Max yüzde 6,7'de kalıyor. Yine de şirket tablosunda bile model her alanda önde değil: yedi testin dördünde Fable 5.1 Max birinci.
Bağımsız Artificial Analysis endeksi ise daha soğuk bir tablo çiziyor. The Decoder'ın aktardığına göre on testi birleştiren endekste Grok 4.7 46 puan alıyor; Claude Fable 5.1 ve GPT-6 53'er puanla önde.
| Terminal-Bench 4.0 | Sonuç |
|---|---|
| Grok 4.7, xAI'ın kendi ölçümü | %38 |
| Grok 4.7, bağımsız ölçüm | %26 |
| GPT-6 Astra, bağımsız ölçüm | %60 |
| Claude Fable 5.1, bağımsız ölçüm | %55 |
| DeepSeek V4.1 Flash, bağımsız ölçüm | %27 |
Aradaki farkın bir kısmı ayarlardan geliyor olabilir: xAI kendi sonuçlarını en yüksek çaba ayarında (xHigh) raporluyor ve bütün puanlar üreticinin beyanı. Ama bağımsız ölçümde çok daha ucuz bir Çin modelinin, DeepSeek V4.1 Flash'ın, Grok 4.7'yi kıl payı geçmesi dikkat çekici.
Fiyat hesabı
xAI'ın savunması fiyat. Şirkete göre Fable 5.1 Max girdide 5 kat, çıktıda yaklaşık 8,3 kat pahalı. The Decoder'ın yorumuyla bu fiyatlar Batılı öncü modellerden çok Çin modellerine yakın ve bunun muhtemelen bir sebebi var. Görev başına maliyet grafiğinde xAI, modeli fiyat-performans sınırına yerleştiriyor.
Model xAI API'si, Cursor'ın bütün planları, Grok Build, OpenRouter, Vercel ve Cloudflare üzerinden kullanılabiliyor. Çıktı hızı iki kat, fiyatı iki kat olan Grok 4.7 Fast yalnızca Cursor ve Grok Build'de çalışıyor. Çıkarımı ABD'de tutan bölgesel uç nokta yüzde 10 ek ücretli.
Güvenlik tarafı
Grok 4.7 tamamen yeni bir güvenlik katmanıyla geliyor. Şirket, LatchBio'nun biyogüvenlik testinde yüzde 62,4 ile en yüksek puanı aldığını söylüyor. Kendi geliştirdiği HackerBench testinde ise riskli, çift kullanımlı siber isteklerin yüzde 3,3'ünü geçirdiğini belirtiyor.
Geliştirici açısından özet şu: Grok 4.7 ucuz ve eski sürümden belirgin biçimde iyi, ama üst sıradaki modellerle arası kapanmış değil. Seçim yapmadan önce şirketin tablosuna değil, kendi iş yükünüzde görev başına maliyete bakmak gerekiyor.