← Últimos artículos
🤖 AI

MELLON - Multimodal Enhanced LLM for Online Navigation

El artículo presenta MELLON, un marco multimodal que mejora significativamente el rendimiento de los agentes de navegación web en el benchmark WebShop al alinear texto e imágenes para mejorar el razonamiento y la planificación, logrando un aumento del 9,26% en la precisión tras solo una época de entrenamiento.

Autores originales: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a ir de compras por internet. Podrías pensar: "Solo dale las instrucciones de texto, como 'compra una camisa roja', y leerá el sitio web y hará clic en los botones". Pero aquí está el truco: los sitios web no son solo paredes de texto. Son lugares visuales y coloridos llenos de imágenes, diseños y distribuciones. Si le pides a un humano que encuentre un par de zapatos específicos, no solo lee la descripción; mira la foto para ver el color, el estilo y la forma. Durante mucho tiempo, los programas informáticos más inteligentes que intentaban navegar por la web eran como compradores ciegos: podían leer el texto perfectamente pero no podían "ver" las imágenes. Este artículo vive en el mundo de la Inteligencia Artificial, específicamente centrándose en los "Agentes de Navegación Web". Estos son ayudantes digitales diseñados para comprender comandos de lenguaje natural y realizar tareas en sitios web reales, como comprar artículos o reservar entradas. La gran pregunta que se hacen los investigadores es: ¿Podemos enseñar a estos agentes a usar tanto sus "ojos" (para ver imágenes) como su "cerebro" (para leer texto) al mismo tiempo, tal como lo hacen los humanos?

Los investigadores detrás de este estudio, trabajando en un proyecto llamado MELLON, decidieron probar esta idea en una tienda en línea simulada llamada WebShop. Querían ver si darle a un agente de IA una vista de las fotos de los productos, junto con las descripciones de texto, le ayudaría a tomar mejores decisiones. No solo lo adivinaron; construyeron tres herramientas experimentales diferentes para intentar resolver el rompecabezas. La primera, y la más exitosa, fue el propio MELLON. Piensa en MELLON como un comprador súper inteligente que usa gafas especiales que traducen el mundo visual a un lenguaje que el cerebro de la IA puede entender. El equipo descubrió que, al entrenar a este agente durante solo una ronda de aprendizaje (un "epoch"), mejoró significamente en su trabajo. Específicamente, la precisión al completar tareas aumentó un 9,26% en comparación con una versión básica que solo miraba el texto. Esto sugiere que mezclar visión y texto es una forma poderosa de ayudar a la IA a navegar por la web, incluso si el sistema todavía tiene algunas dificultades de crecimiento.

Sin embargo, la historia no es una victoria simple de "lo multimodal siempre es mejor". El equipo también probó otros dos enfoques creativos que no funcionaron tan bien como esperaban. Una idea fue tratar la tarea de compra como un juego de "Preguntas y Respuestas Visuales" (VQAgent), donde la IA mira una imagen y una pregunta, y luego elige la respuesta correcta. Pensaron que esto funcionaría porque comprar es similar a responder preguntas sobre imágenes. Pero descubrieron que, en el contexto desordenado y real de WebShop, las descripciones de texto contenían pistas más importantes que las imágenes. Debido a que la IA fue entrenada para depender fuertemente de las imágenes, se confundió cuando el texto era la verdadera clave para la solución. Es como intentar resolver un acertijo mirando fijamente un dibujo cuando la respuesta está escondida en la letra pequeña.

El tercer intento involucró a un "Clasificador Multimodal", una herramienta diseñada para hacer que el agente se detenga y compare cuidadosamente cada uno de los artículos en una página antes de tomar una decisión, en lugar de simplemente agarrar lo primero que ve. La esperanza era que este tiempo de pensamiento adicional llevaría a mejores resultados. En cambio, el experimento mostró que esta precaución adicional hizo al agente más lento y menos preciso. Los investigadores encontraron que las herramientas utilizadas para medir la similitud entre imágenes y texto (llamadas puntuaciones BERT y CLIP) no coincidían bien con lo que realmente hacía que un producto fuera una "buena combinación" en el sistema de puntuación del juego. Resultó que intentar clasificar cada opción era como un comprador que pasa una hora comparando cada camisa en la tienda, solo para terminar comprando la equivocada porque se sintió abrumado.

Entonces, ¿cuál es la conclusión final de esta aventura de compras digital? El artículo sugiere que, si bien dar a los agentes de IA la capacidad de "ver" la web es un camino prometedor, no es una varita mágica. El agente MELLON demostró que alinear imágenes y texto puede aumentar el rendimiento, pero los otros experimentos mostraron que simplemente añadir un razonamiento visual más complejo o forzar al agente a mirar todo no siempre es la estrategia correcta. Los investigadores concluyen que necesitamos seguir explorando cómo mezclar mejor estas pistas visuales y textuales, quizás entrenando a los agentes durante más tiempo o utilizando "cerebros" aún más inteligentes (Modelos de Lenguaje Extensos) en el futuro. Por ahora, han demostrado que un poco de visión llega muy lejos, pero la IA todavía necesita aprender exactamente cuándo mirar la foto y cuándo leer la letra pequeña.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →