¿Siguen conectadas dos habitaciones después de levantar un muro? ¿Está el animal dentro del cercado? ¿Qué distingue un nudo real de un lazo enredado? ¿Pueden reordenarse varias cuerdas sin que pasen unas a través de otras?

Estas preguntas atañen a la topología tridimensional: una forma de comprensión espacial que no se basa en distancias, ángulos o formas exactas, sino en relaciones estructurales que persisten aunque los objetos se doblen, estiren o deformen.

Una capa sin medir

La conectividad, el encerramiento, el orden y la condición de nudo son ejemplos de esas propiedades topológicas. En ciencia cognitiva se consideran una capa fundamental de la comprensión espacial humana, y sin embargo apenas aparecen en la forma en que se evalúan los sistemas multimodales de IA.

La mayoría de las evaluaciones espaciales para estos modelos se centran en propiedades euclidianas: distancia, dirección, tamaño y posición relativa. La nueva prueba de Microsoft Research, MindTopo, se inspira en Piaget y en la literatura cognitiva sobre la capacidad topológica para medir otra capa distinta.

Dos habilidades separadas

La idea central del diseño es separar dos cosas:

  • Reconocimiento: ¿puede el modelo ver una relación topológica en una imagen fija — un camino conectado, una región encerrada, un nudo?
  • Conservación y manipulación: ¿puede mantener y alterar esas relaciones a lo largo de una secuencia de acciones?

El hallazgo es claro: los modelos multimodales actuales rinden mucho mejor en el reconocimiento estático que en las tareas interactivas. Eso sugiere que les cuesta sostener una comprensión coherente de la topología a lo largo del tiempo.

Dónde se produce el fallo

El detalle más revelador es en qué fase se rompe todo. Los fallos surgen sobre todo en la planificación, no en la percepción.

Los modelos pierden el rastro de las relaciones estructurales a medida que cambia la escena, o proponen acciones que violan restricciones físicas. El modelo identifica bien el nudo al principio y, al planificar los pasos para deshacerlo, actúa como si hubiera olvidado qué era ese nudo.

Según los investigadores, los modelos a veces logran identificar un camino conectado, una región encerrada o un nudo en una sola escena, pero esa comprensión suele derrumbarse en cuanto deben manipular la escena mediante una secuencia de acciones.

Por qué importa

El hallazgo apunta de lleno a la robótica y a los entornos interactivos. Entender qué permanece conectado, encerrado, ordenado o anudado es condición previa para tomar decisiones fiables en esos ámbitos.

Un brazo robótico que ordena un cable sin enrollarlo sobre sí mismo; un sistema de navegación que sabe qué habitaciones siguen siendo accesibles tras cerrarse una puerta: ambos exigen razonamiento topológico, y ninguno se resuelve leyendo bien una imagen fija.