Ne oldu?

Liquid AI, cihaz üzerinde çalışmak üzere tasarlanan 3,1 milyar parametreli görsel-dil modeli LFM2.5-VL-3B'yi yayımladı. Model mobil, web ve masaüstündeki dijital ekranları okuyor, nesneleri koordinatlara bağlıyor, belge ve grafik ayrıştırıyor ve metin ya da görüntü girdisinden araç çağırabiliyor.

Şirketin bildirdiğine göre model, 28 görsel kıyaslamada ortalama 69,4 puan alıyor. Bu, 4,7 milyar parametreli InternVL-3.5-4B ile aynı seviye ve yine 4,7 milyarlık Qwen3.5-4B'nin 0,7 puan gerisi. Model akıl yürütme yapmıyor; doğrudan cevap veriyor ve gecikmeyi düşük tutuyor.

Cihazda çalışması ne demek?

Model yaklaşık 3 GB belleğe sığıyor ve Apple M5 Max üzerinde saniyede 228 jeton çözüyor. Kontrol noktası dört biçimde dağıtılıyor: yerel, GGUF, ONNX ve MLX. İlk günden desteklenen çalışma ortamları arasında llama.cpp, MLX, vLLM, SGLang ve ONNX bulunuyor.

Buradaki asıl mesele boyut değil, nerede çalıştığı. Ekranı okuyan bir modelin buluta gitmesi, kullanıcının ekranındaki her şeyin ağdan geçmesi anlamına geliyor. Cihazda çalışan bir model bu soruyu baştan ortadan kaldırıyor — ve düzenlemeye tabi ortamlarda bu bir performans meselesi değil, uyum meselesi.

Neler değişti?

  • Ekran ve arayüz anlama: ScreenSpot-v2'de ortalama 80,7 — masaüstü 78,7, mobil 81,2, web 82,2. Liquid AI aynı testte Gemma-4-E4B için 51,2, Qwen3.5-4B için 78,5, daha büyük InternVL-3.5-4B için 84,1 bildiriyor.
  • Araç çağırma: Bu seride ilk kez. ToolSandbox 26,4'ten 59,5'e, BFCL v4 20,5'ten 32,5'e çıktı.
  • Nesne bağlama: RefCOCO ortalama precision@1 değeri 57,1'den 87,9'a yükseldi — 30 puanlık artış, ölçeklenen sentetik veriyle açıklanıyor.
  • Çoklu görüntü: BLINK 50,2'den 61,5'e, MuirBench 34,9'dan 58,3'e çıktı.

Mimari ve eğitim

Dil omurgası LFM2.5-2.6B, görü kulesi ise SigLIP2 NaFlex biçim-optimize 400M kodlayıcı. NaFlex, büyük görüntüleri örtüşmeyen 512×512 parçalara ve yeniden boyutlandırılmış bir küçük resme bölerek doğal çözünürlüğü işliyor. Bağlam penceresi 32.768 jeton ve 16 dil destekleniyor.

Ön eğitimde yaklaşık 34 trilyon jeton kullanıldı. Sözlük, mevcut jetonlaştırıcı yerinde genişletilerek 128 bine çıkarıldı; bu, Latin dışı yazı sistemlerinin kapsamını iyileştiriyor. Eğitim sonrası aşama, daha büyük bir öğretmenden bilgi damıtmalı denetimli ince ayar ve ardından çok ödüllü pekiştirmeli öğrenmeden oluşuyor.

Lisansın ayrıntısı

LFM Açık Lisansı v1.0, Apache 2.0 tabanlı ama tek bir değişiklik taşıyor: bir şirketin yıllık geliri 10 milyon dolara ulaştığında ücretsiz ticari kullanım sona eriyor. Bu eşiğin altındaki bağımsız geliştiriciler, girişimler ve küçük-orta ölçekli şirketler ürünlerini bedelsiz ticarileştirebiliyor; üstündekiler Liquid AI ile ticari lisans görüşmek zorunda. Araştırma, eğitim ve kâr amacı gütmeyen kullanımda gelir sınırı yok.

Ne kesin değil

Bütün kıyaslama sonuçları şirketin kendi ölçümüne dayanıyor; değerlendirme vLLM 0.26.0 ile akıl yürütmesiz kipte yapılmış. Bağımsız doğrulama henüz yok. Ağırlıkların indirilebilir olması bu doğrulamayı mümkün kılıyor — kapalı bir modelin puan iddiasından farklı olarak, buradaki sayılar başkası tarafından tekrarlanabilir.