Moonshot AI, el equipo detrás del asistente chino Kimi, ha publicado PerceptionBench, una prueba comparativa que aísla y mide la percepción visual de los modelos de lenguaje multimodales. Su tesis es directa: buena parte de los fallos registrados como "errores de razonamiento" ocurren mucho antes, cuando el modelo lee la imagen.

Separar el ver del pensar

Las pruebas habituales mezclan percepción, conocimiento y razonamiento en una sola tarea. PerceptionBench los separa y divide la visión en diez subhabilidades atómicas. Cada pregunta puede responderse mirando únicamente la imagen: sin razonamiento y sin conocimiento externo.

Los diez dominios son:

  • Relación visual, conteo, atributos
  • Profundidad y 3D, localización, comparación
  • Reconocimiento de grano fino, integración de contexto
  • OCR y alucinación

Las categorías no se definieron de antemano. Los autores recopilaron primero los errores que los modelos cometían realmente en pruebas existentes, rastrearon cada uno hasta el primer paso fallido y construyeron la taxonomía a partir de esos rastros. Esa decisión se apoya en otra medición: entre las 42 pruebas de código abierto analizadas, los perfiles de error se solapan muy poco, de modo que cada una capta una porción distinta de la debilidad visual. Ninguna prueba aislada, ni un grupo pequeño de ellas, abarcaba la percepción visual en conjunto.

Las preguntas parecen triviales

De un fondo interno de más de 17.000 preguntas verificadas, Moonshot AI publica 3.000 tareas. El 60 por ciento se derivó de errores atribuidos a modelos concretos; el 40 por ciento restante se reformuló con imágenes modificadas.

En apariencia las tareas son triviales: averiguar dónde se sitúa un símbolo en la esfera de un reloj, contar las flores dentro de una caja roja o decidir cuál de dos portalápices combina gris y rosa y cuál es rosa liso con un dibujo animado.

Ningún modelo pasa del 60 por ciento

Entre los 16 modelos punteros evaluados, la precisión general más alta es del 59,7 por ciento, lograda por GPT-5.6 Sol. Le siguen Kimi K3 con 58,5 por ciento, Claude Fable 5 con 57,2 por ciento, Gemini 3.1 Pro con 56,2 por ciento y GPT-5.5 con 55,8 por ciento. La brecha se amplía entre los modelos abiertos: Qwen3.5-397B-A17B llega al 47,5 por ciento y GLM-4.6V se queda en el 32,5 por ciento.

Los autores sostienen que el desglose por categorías importa más que la clasificación general: modelos con puntuaciones agregadas casi idénticas divergen con claridad en las subhabilidades.

Por qué importa

El hallazgo confirma lo que ya apuntaban estudios anteriores: incluso los mejores modelos tropiezan en tareas visuales básicas. La consecuencia práctica es que intentar corregir una respuesta errónea con "mejor razonamiento" suele ser mirar al lugar equivocado. Si el fallo empieza al mirar y no al pensar, ahí es donde corresponde arreglarlo.