Çinli yapay zeka şirketi DeepSeek, metin yeteneklerine görüntü anlama ekleyen deneysel çok kipli modeli V4-Flash-Vision-Exp'i yayımladı. Şirketin kendi ölçümlerine göre model, ajan görevlerinde Opus 4.8'e neredeyse denk sonuç veriyor.
DeepSeek'in aktardığına göre yeni sürüm, V4-Flash'ı görüntü işlemeyle genişletirken temel modelin akıl yürütme ve dünya bilgisi tarafındaki metin başarımını koruyor. Bu ayrım önemli: çok kipli yetenek eklemek genellikle metin tarafında bir bedele yol açıyor.
Hedef sohbet değil, ajan iş akışı
Şirket modeli açıkça ajan tabanlı uygulamalar için konumlandırıyor. Farklı ajan çerçeveleriyle çalışacak ve görsel anlamayı araç çağırmayla birleştirecek biçimde tasarlanmış. Pratikte yapabildikleri şunlar:
- Görsel betimleme — bir resimde ne olduğunu açıklamak.
- Ekran görüntüsünden metin çıkarma — arayüz görüntülerindeki yazıyı okumak.
- Diyagram çözümleme — şema ve grafikleri yorumlamak.
Model JPEG, PNG, GIF ve WebP biçimlerini destekliyor. Biçimi dosya adından ya da bildirilen içerik türünden değil, dosyanın gerçek içeriğinden belirliyor. Küçük bir ayrıntı gibi görünse de ajan iş akışlarında anlamlı: bir ajanın indirdiği dosyanın uzantısı çoğu zaman güvenilir değil.
Model, OpenAI'ın sohbet tamamlama ve yanıt uçlarıyla ve Anthropic'in mesaj ucuyla çalışıyor. DeepSeek ayrıca kendi koşum takımı çerçevesinin yeni modeli doğrudan destekleyen bir sürümünü yayımladı.
Fiyatlandırma tarafı asıl haber
Görsel göndermenin üç yolu var: doğrudan Base64 kodlamayla gömmek, herkese açık bir adres vermek ya da yeni ve ücretsiz dosya arayüzünü kullanmak. Dosya arayüzü, bir dosyayı bir kez yükleyip birden çok istekte kimliğiyle yeniden kullanmaya izin veriyor.
Asıl dikkat çeken ayrıntı maliyet tarafında. İsteğe bağlı bir alan, ince görsel ayrıntı gerekmediğinde görüntüleri küçülterek jeton tasarrufu sağlıyor. Model, işlemeden önce görselleri en boy oranına göre yaklaşık sekiz yüze sekiz yüz piksele normalleştiriyor. Sonuç olarak özgün çözünürlük ne olursa olsun her görsel en fazla 384 jetona mal oluyor. Fiyatlandırma da V4-Flash oranlarını izliyor; yani görme yeteneği ayrı bir ücret getirmiyor.
Sabit üst sınır, çok görselli ajan iş akışlarının maliyetini önceden hesaplanabilir kılıyor. Görsel başına değişken jeton tüketimi, ekran görüntüsü döngüsünde çalışan bir ajanın faturasını öngörülemez hâle getiren en önemli etkenlerden biriydi.
Karşılaştırma açısından bu, ekran okuyan bir ajanın maliyetini doğrudan etkiliyor. Yüz ekran görüntüsü işleyen bir iş akışı, görsel tarafında en fazla 38.400 jetona mal oluyor — metin bağlamının yanında küçük kalan bir rakam. Ajanın asıl maliyeti yine biriken konuşma geçmişinden geliyor, görsellerden değil.
Sınırlar
Tek bir istek en fazla 600 görsel içerebiliyor. Kenar uzunluğu üst sınırı sekiz bin piksel; ancak istek 15 ya da daha fazla görsel içerdiğinde bu sınır dört bin piksele düşüyor. Görseller yalnızca kullanıcı mesajlarına konabiliyor. Modelin adındaki "deneysel" ibaresi de hatırda tutulmalı: karşılaştırma rakamları şirketin kendi iç ölçütlerinden geliyor, bağımsız bir doğrulama henüz yok.