Moonshot AI, el equipo detrás del asistente chino Kimi, ha publicado PerceptionBench, una prueba comparativa que aísla y mide la percepción visual de los modelos de lenguaje multimodales. Su tesis es directa: buena parte de los fallos registrados como "errores de razonamiento" ocurren mucho antes, cuando el modelo lee la imagen.

Separar el ver del pensar

Las pruebas habituales mezclan percepción, conocimiento y razonamiento en una sola tarea. PerceptionBench los separa y divide la visión en diez subhabilidades atómicas. Cada pregunta puede responderse mirando únicamente la imagen: sin razonamiento y sin conocimiento externo.

Los diez dominios son:

  • Relación visual, conteo, atributos
  • Profundidad y 3D, localización, comparación
  • Reconocimiento de grano fino, integración de contexto
  • OCR y alucinación

Las categorías no se definieron de antemano. Los autores recopilaron primero los errores que los modelos cometían realmente en pruebas existentes, rastrearon cada uno hasta el primer paso fallido y construyeron la taxonomía a partir de esos rastros. Esa decisión se apoya en otra medición: entre las 42 pruebas de código abierto analizadas, los perfiles de error se solapan muy poco, de modo que cada una capta una porción distinta de la debilidad visual. Ninguna prueba aislada, ni un grupo pequeño de ellas, abarcaba la percepción visual en conjunto.

Las preguntas parecen triviales

De un fondo interno de más de 17.000 preguntas verificadas, Moonshot AI publica 3.000 tareas. El 60 por ciento se derivó de errores atribuidos a modelos concretos; el 40 por ciento restante se reformuló con imágenes modificadas.

En apariencia las tareas son triviales: averiguar dónde se sitúa un símbolo en la esfera de un reloj, contar las flores dentro de una caja roja o decidir cuál de dos portalápices combina gris y rosa y cuál es rosa liso con un dibujo animado.

Ningún modelo pasa del 60 por ciento

Entre los 16 modelos punteros evaluados, la precisión general más alta es del 59,7 por ciento, lograda por GPT-5.6 Sol. Le siguen Kimi K3 con 58,5 por ciento, Claude Fable 5 con 57,2 por ciento, Gemini 3.1 Pro con 56,2 por ciento y GPT-5.5 con 55,8 por ciento. La brecha se amplía entre los modelos abiertos: Qwen3.5-397B-A17B llega al 47,5 por ciento y GLM-4.6V se queda en el 32,5 por ciento.

Los autores sostienen que el desglose por categorías importa más que la clasificación general: modelos con puntuaciones agregadas casi idénticas divergen con claridad en las subhabilidades.

¿Por qué es importante?

El hallazgo confirma lo que ya apuntaban estudios anteriores: incluso los mejores modelos tropiezan en tareas visuales básicas. La consecuencia práctica es que intentar corregir una respuesta errónea con "mejor razonamiento" suele ser mirar al lugar equivocado. Si el fallo empieza al mirar y no al pensar, ahí es donde corresponde arreglarlo.

La medición es en sí misma un problema

La parte más llamativa del estudio, junto a sus resultados, es lo que dice sobre las herramientas de medición actuales. Si los perfiles de error de las 42 pruebas de código abierto analizadas no coinciden entre sí, cualquier juicio sobre la "capacidad visual" de un modelo extraído de una sola prueba queda incompleto. Un modelo puede puntuar bien en una prueba y fallar estrepitosamente en un área de habilidad que esa prueba no toca.

Esto explica además un patrón habitual en los anuncios de IA: el mismo modelo aparece en distintos puestos en distintas listas. Las clasificaciones no se contradicen; simplemente miden cosas distintas. La estructura de PerceptionBench, dividida en diez áreas de habilidad, al menos dice con claridad qué subhabilidad se está midiendo.

Los límites de la prueba también son claros. Las 3.000 tareas publicadas son una porción pequeña de un conjunto verificado de 17.000, y el 40 % de las tareas se reconstruyó con imágenes alteradas. La medición representa, por tanto, no todos los errores del mundo real, sino aquellos que pudieron rastrearse.