DeepSeek añade visión para agentes: cada imagen cuesta como mucho 384 tokens
V4-Flash-Vision-Exp incorpora procesamiento de imagen sin perder rendimiento en texto. En las pruebas de la propia empresa se acerca a Opus 4.8.
Modelos
V4-Flash-Vision-Exp incorpora procesamiento de imagen sin perder rendimiento en texto. En las pruebas de la propia empresa se acerca a Opus 4.8.
PerceptionBench, de Moonshot AI, aísla la percepción visual de los modelos multimodales del razonamiento. Ninguno de los 16 modelos punteros evaluados alcanzó el 60 por ciento de acierto.