MindTopo reveals VLMs’ spatial reasoning abilities
Microsoft Research ha presentado MindTopo, un nuevo referente para evaluar el razonamiento topológico en la inteligencia artificial (IA). Este benchmark está diseñado para determinar si los modelos multimodales pueden comprender conceptos como conectividad, encierro, orden, separación y nudos. MindTopo mide tanto el razonamiento como la planificación, evaluando no solo si los modelos pueden reconocer relaciones topológicas en imágenes estáticas, sino también si pueden preservar y manipular esas relaciones a través de una secuencia de acciones.
Los modelos multimodales actuales muestran un mejor desempeño en el reconocimiento estático que en las tareas interactivas, lo que sugiere que tienen dificultades para mantener una comprensión consistente de la topología a lo largo del tiempo. Las fallas suelen surgir durante la planificación más que en la percepción, con modelos que pierden de vista las relaciones estructurales a medida que cambian las escenas o que proponen acciones que violan las restricciones físicas.
Estos hallazgos resaltan una importante oportunidad para avanzar en los sistemas de IA para robótica y entornos interactivos, donde comprender qué permanece conectado, encerrado, ordenado o anudado es esencial para la toma de decisiones confiable. ¿Puede la IA determinar si dos habitaciones permanecen conectadas después de agregar una pared? ¿Puede reconocer si un animal está dentro de una cerca, distinguir un verdadero nudo de un lazo enredado o reorganizar varias cuerdas sin permitir que pasen unas a través de otras?
Estas preguntas conciernen a la topología 3D, una forma de comprensión espacial basada no en distancias exactas, ángulos o formas, sino en relaciones estructurales que persisten a medida que los objetos se doblan, estiran o deforman. La conectividad, el encierro, el ordenamiento y la anudación son ejemplos de propiedades topológicas. Estas propiedades son una capa fundamental de la comprensión espacial humana en la Ciencia Cognitiva, pero siguen siendo en gran medida ausentes en la evaluación de los sistemas de IA multimodales.
En un nuevo estudio de investigación, se introduce MindTopo, un benchmark diseñado para evaluar si los modelos de lenguaje multimodal poseen este tipo de intuición topológica. Nuestros hallazgos revelan una brecha sustancial entre reconocer la topología en una imagen estática y mantener una comprensión innata de esa topología mientras se planifica y actúa. Los modelos actuales a veces pueden identificar un camino conectado, una región cerrada o un nudo en una sola escena, pero esa comprensión a menudo se descompone una vez que el modelo debe manipular la escena a través de una secuencia de acciones.
Fuente: https://www.microsoft.com/en-us/research/blog/mindtopo-reveals-vlms-spatial-reasoning-abilities/