← Últimos artículos
🤖 AI

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

El artículo presenta MMArch, un riguroso referente para la arquitectura y la ingeniería civil que evalúa la capacidad de los modelos de lenguaje extensos multimodales para sintetizar evidencia visual distribuida con principios de ingeniería, revelando una brecha de rendimiento significativa entre los sistemas de IA actuales y los expertos humanos.

Autores originales: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

Publicado 2026-08-11
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo ser arquitecto. No quieres solo que reconozca que una foto muestra una casa; quieres que entienda por qué la casa no se caerá. Este es el mundo de los "Modelos de Lenguaje Extensos Multimodales" (MLLM, por sus siglas en inglés). Piensa en estos modelos como cerebros digitales superinteligentes que pueden leer texto y mirar imágenes al mismo tiempo. Son excelentes describiendo lo que ven, como decir: "Esa es una puerta azul", o "Este gráfico muestra una línea subiendo". Pero en el mundo real de la ingeniería, saber lo que ves no es suficiente. Tienes que conectar los puntos entre un dibujo, una regla de física y un código de seguridad para emitir un juicio. Es como ser un detective que tiene que mirar la foto de la escena de un crimen, recordar una ley específica y luego decidir si el sospechoso es culpable. La gran pregunta que los investigadores se han estado haciendo es: ¿Pueden estos detectives de IA realmente resolver el caso, o solo están adivinando basándose en las pistas que ven?

Aquí es donde entra en juego un nuevo estudio llamado MMArch. Los investigadores construyeron una prueba gigante y complicada específicamente para la arquitectura y la ingeniería civil para ver si la IA realmente puede "pensar" como un ingeniero. No se limitaron a pedirle a la IA que describiera una imagen; le dieron un rompecabezas donde la respuesta estaba oculta en diferentes partes de un dibujo y requería una regla específica de física para resolverse. Los resultados fueron un poco un llamado de atención. Mientras que los modelos de IA más inteligentes podían acertar aproximadamente la mitad de las preguntas, un equipo de expertos humanos acertó casi todas. El estudio encontró que la IA no está fallando porque no pueda "ver" la imagen; está fallando porque no puede conectar la imagen con la regla correcta y luego hacer las matemáticas para obtener la respuesta. Es como si la IA pudiera leer el menú y ver los ingredientes, pero no pudiera descifrar cómo cocinar el plato.

La Gran Prueba: MMArch

Los investigadores crearon un referente llamado MMArch (Arquitectura Multimodal). Piensa en esto como un examen final para la IA, pero en lugar de preguntas de opción múltiple donde puedes simplemente adivinar, es un examen de respuesta corta. El examen se compone de 1,212 preguntas extraídas directamente de artículos científicos revisados por pares sobre edificios, puentes y ciudades. Estos no son dibujos inventados; son los diagramas reales que los ingenieros usan para demostrar que sus diseños funcionan.

La prueba cubre 10 áreas diferentes, desde cómo se sacuden los edificios durante los terremotos hasta cómo diseñamos modelos digitales de ciudades. Para asegurar que la IA no pudiera usar atajos, los investigadores utilizaron un ingenioso sistema de "planificador-escritor". Primero, un "planificador" analizó un artículo y eligió una respuesta específica (como "Varilla #6 y #7"). Luego, un "escritor" creó una pregunta que requería mirar la imagen y conocer la regla de ingeniería para encontrar esa respuesta. La IA no podía simplemente leer el texto o mirar una pequeña parte de la imagen; tenía que mirar toda la imagen, encontrar las pistas adecuadas y aplicar una regla para resolverlo.

Los Resultados: IA vs. Humanos

Cuando sometieron a 18 modelos de IA (tanto modelos gratuitos de código abierto como modelos comerciales costosos y de alto nivel) a esta prueba, los resultados fueron claros: la IA todavía está muy lejos de ser un ingeniero real.

  • Los Expertos Humanos: Un panel de arquitectos e ingenieros reales acertó el 94.6% de las respuestas. Aprobaron el examen con excelencia.
  • La Mejor IA: El modelo de IA comercial más inteligente (GPT-5.5) solo acertó el 51.7%.
  • La IA de Código Abierto: El mejor modelo gratuito logró alrededor del 30%.

Esa es una brecha de más de 40 puntos porcentuales. Incluso la mejor IA apenas está aprobando, mientras que los humanos obtienen puntuaciones casi perfectas. Los investigadores verificaron para asegurarse de que la IA no estuviera simplemente adivinando o leyendo el texto en lugar de la imagen, y confirmaron que la IA realmente estaba teniendo problemas con la parte del razonamiento.

¿Por qué tiene dificultades la IA?

El equipo no se detuvo solo en las puntuaciones; analizaron por qué la IA cometía errores. Encontraron que el problema no era que la IA no pudiera "ver" la imagen. La IA era en realidad bastante buena detectando las líneas y números correctos en los diagramas. El verdadero problema ocurría cuando la IA intentaba combinar lo que veía con lo que sabía.

Desglosaron los errores en cinco tipos:

  1. Errores de Percepción (20.3%): La IA simplemente leyó mal la imagen (como confundir dos líneas similares).
  2. Errores de Principio (21.7%): La IA vio la imagen correctamente pero usó la regla equivocada (como pensar que un bucle ancho en un gráfico significaba que el material se estaba debilitando, cuando en realidad significaba que se estaba fortaleciendo).
  3. Errores de Composición (35.8%): Este fue el mayor problema. La IA encontró los números correctos y conocía la regla correcta, pero al intentar juntarlos para obtener la respuesta final, omitió un paso o arruinó las matemáticas. Es como tener todos los ingredientes y la receta, pero quemar el pastel porque olvidaste mezclarlos en el orden correcto.
  4. Errores de Fundamentación (14.5%): La IA sabía qué buscar pero leyó mal el número (como decir +138 en lugar de -142).
  5. Errores de Consistencia (7.7%): La IA dedujo la respuesta correcta en su "cerebro" pero escribió la incorrecta.

La conclusión principal es que los Errores de Composición representaron más de un tercio de todos los errores. Esto significa que la mayor debilidad de la IA es conectar los puntos. Puede ver la evidencia y puede recordar la regla, pero no puede unirlas de manera confiable para resolver un problema complejo.

¿Ayuda "Pensar Paso a Paso"?

Es posible que hayas escuchado que decirle a la IA que "piense paso a paso" (una técnica llamada Cadena de Pensamiento o Chain-of-Thought) ayuda a resolver problemas difíciles. Los investigadores probaron esto en MMArch. Le pidieron a la IA que explicara su razonamiento antes de dar la respuesta. ¿El resultado? No ayudó mucho. Para algunos modelos, los hizo ligeramente mejores; para otros, de hecho, los hizo peores. Esto sugiere que el problema no es que la IA necesite que se le diga cómo pensar, sino que simplemente no sabe lo suficiente sobre las reglas específicas de la arquitectura y la ingeniería para construir una cadena de pensamiento correcta en primer lugar.

¿Qué sigue?

El estudio concluye que no podemos simplemente hacer la IA más grande o darle más datos para solucionar esto. El problema no es la falta de tamaño; es la falta de un razonamiento profundo y especializado. La IA necesita aprender cómo vincular la evidencia visual con el conocimiento del dominio de una manera que los modelos actuales simplemente no pueden hacer todavía.

MMArch ya está disponible para que otros investigadores lo utilicen como campo de entrenamiento. Es una herramienta de diagnóstico para ayudarnos a ver exactamente dónde está fallando la IA para que podamos construir mejores modelos para el futuro. Hasta entonces, si necesitas diseñar un rascacielos que no se caiga durante un terremoto, es mejor contratar a un experto humano que pedirle ayuda a un robot.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →