¿Qué ocurrió?
Liquid AI ha publicado LFM2.5-VL-3B, un modelo de visión y lenguaje de 3.100 millones de parámetros pensado para ejecutarse en el dispositivo. Lee pantallas digitales en móvil, web y escritorio, ubica objetos en coordenadas, analiza documentos y gráficos, y llama a herramientas a partir de entradas de texto o de imagen.
La compañía informa de una media de 69,4 en 28 pruebas visuales. Esa cifra iguala a InternVL-3.5-4B, de 4.700 millones de parámetros, y queda 0,7 puntos por detrás de Qwen3.5-4B, también de 4.700 millones. El modelo no razona: responde directamente, lo que mantiene baja la latencia.
Qué significa que funcione en el dispositivo
El modelo cabe en unos 3 GB de memoria y decodifica 228 tokens por segundo en un Apple M5 Max. El checkpoint se distribuye en cuatro formatos —nativo, GGUF, ONNX y MLX— y entre los entornos compatibles desde el primer día están llama.cpp, MLX, vLLM, SGLang y ONNX.
Lo relevante aquí no es el tamaño, sino dónde se ejecuta. Que un modelo que lee tu pantalla vaya a la nube significa que todo lo que hay en esa pantalla viaja por la red. Un modelo que funciona en el dispositivo elimina esa pregunta de raíz, y en entornos regulados eso es una cuestión de cumplimiento, no de rendimiento.
Qué ha cambiado
- Comprensión de pantallas e interfaces: media de 80,7 en ScreenSpot-v2 —escritorio 78,7, móvil 81,2, web 82,2—. Liquid AI sitúa a Gemma-4-E4B en 51,2 y a Qwen3.5-4B en 78,5 en la misma prueba, con InternVL-3.5-4B, más grande, por delante con 84,1.
- Llamada a funciones: novedad en esta línea. ToolSandbox pasa de 26,4 a 59,5 y BFCL v4 de 20,5 a 32,5.
- Ubicación de objetos: la precisión media@1 en RefCOCO sube de 57,1 a 87,9, una ganancia de 30 puntos que la empresa atribuye a datos sintéticos a mayor escala.
- Entrada de varias imágenes: BLINK mejora de 50,2 a 61,5 y MuirBench de 34,9 a 58,3.
Arquitectura y entrenamiento
La columna lingüística es LFM2.5-2.6B y la torre visual es un codificador SigLIP2 NaFlex de 400M optimizado por forma. NaFlex gestiona la resolución nativa dividiendo las imágenes grandes en fragmentos de 512×512 sin solapamiento, más una miniatura de la imagen completa. La ventana de contexto es de 32.768 tokens y admite 16 idiomas.
El preentrenamiento usó unos 34 billones de tokens. El vocabulario se duplicó hasta 128K ampliando el tokenizador existente sobre la marcha, lo que mejora la cobertura de sistemas de escritura no latinos. El postentrenamiento consiste en ajuste fino supervisado con destilación de conocimiento desde un modelo maestro mayor, seguido de aprendizaje por refuerzo con múltiples recompensas.
El detalle de la licencia
La LFM Open License v1.0 se basa en Apache 2.0 con un cambio: el uso comercial gratuito termina cuando los ingresos anuales de una empresa alcanzan los 10 millones de dólares. Los desarrolladores independientes, las startups y las pymes por debajo de esa línea pueden comercializar sin coste; por encima, hay que negociar una licencia comercial con Liquid AI. El uso en investigación, educación y entidades sin ánimo de lucro no tiene límite de ingresos.
Qué no está cerrado
Todos los resultados de las pruebas se apoyan en la medición de la propia empresa, realizada con vLLM 0.26.0 en modo sin razonamiento. Todavía no hay verificación independiente. Que los pesos puedan descargarse es lo que hace posible esa verificación: a diferencia de la puntuación que declara un modelo cerrado, estas cifras puede reproducirlas otra persona.