La empresa china de inteligencia artificial DeepSeek ha publicado V4-Flash-Vision-Exp, un modelo multimodal experimental que suma comprensión de imágenes a sus capacidades de texto. Según las mediciones de la propia compañía, iguala casi a Opus 4.8 en tareas de agente.

DeepSeek explica que la nueva versión amplía V4-Flash con procesamiento de imagen mientras conserva el rendimiento en texto del modelo base en razonamiento y conocimiento del mundo. La distinción importa: añadir capacidad multimodal suele tener un coste en el lado del texto.

El objetivo son los flujos de agentes, no la conversación

La compañía posiciona el modelo de forma explícita para aplicaciones basadas en agentes. Está diseñado para funcionar con distintos marcos de agentes y para combinar comprensión visual con llamada a herramientas. En la práctica puede:

  • Describir imágenes: explicar qué contiene una fotografía.
  • Extraer texto de capturas: leer lo escrito en imágenes de interfaz.
  • Analizar diagramas: interpretar esquemas y gráficos.

El modelo admite JPEG, PNG, GIF y WebP, y determina el formato a partir del contenido real del archivo, no del nombre ni del tipo declarado. Parece un detalle menor, pero cuenta en los flujos de agentes, donde la extensión de un archivo descargado por un agente rara vez es fiable.

Funciona con las interfaces de conversación y de respuestas de OpenAI y con el punto de acceso de mensajes de Anthropic. DeepSeek publicó además una versión de su propio marco de arnés compatible con el nuevo modelo desde el primer momento.

Lo relevante está en el precio

Hay tres formas de enviar una imagen: incrustarla con codificación Base64, apuntar a una dirección pública o usar la nueva interfaz de archivos, gratuita. Esa interfaz permite subir un archivo una vez y referenciarlo por identificador en varias peticiones.

El dato llamativo está en el coste. Un campo opcional reduce el tamaño de las imágenes cuando no hace falta detalle visual fino, con el consiguiente ahorro de tokens. El modelo normaliza las imágenes a unos ochocientos por ochocientos píxeles según la relación de aspecto antes de procesarlas. El resultado es que, sea cual sea la resolución original, cada imagen cuesta como mucho 384 tokens. El precio sigue las tarifas de V4-Flash, de modo que la visión no supone un cargo aparte.

Un techo fijo hace previsible por adelantado el coste de los flujos de agentes con muchas imágenes. El consumo variable de tokens por imagen era uno de los principales motivos por los que un agente trabajando en un bucle de capturas generaba una factura impredecible.

Los límites

Una sola petición puede incluir hasta 600 imágenes. La longitud máxima de borde es de 8.192 píxeles por lado, pero baja a 4.096 en cuanto la petición contiene 15 imágenes o más. Las imágenes solo pueden ir en mensajes de usuario. Conviene recordar también el "experimental" del nombre: las cifras de comparación proceden de las pruebas internas de la compañía y todavía no hay verificación independiente.