← Últimos artículos
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

El artículo presenta MMSkills, un marco que aborda las limitaciones de las representaciones de habilidades basadas en texto mediante la formalización e implementación de conocimiento procedimental multimodal reutilizable, que combina procedimientos textuales con evidencia visual condicionada por el estado, para mejorar las capacidades de toma de decisiones en tiempo real de los agentes visuales generales.

Autores originales: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Enseñar a los Robots a "Ver" como los Humanos

Imagina que estás enseñando a un robot a usar una computadora.

  • La Vieja Forma (Habilidades solo de Texto): Le das al robot una receta escrita: "Haz clic en el menú 'Archivo', luego en 'Nuevo', luego en 'Hoja'."
    • El Problema: Si el robot está en la pantalla equivocada, o si una ventana emergente bloquea el menú, el robot sigue el texto a ciegas. Hace clic en "Archivo" aunque el menú no esté allí, se atasca y falla. Sabe qué hacer, pero no cuándo hacerlo o cómo se ve cuando está hecho.
  • La Nueva Forma (MMSkills): Le das al robot una "Guía Inteligente". Esta guía no tiene solo texto; tiene fotos de cómo debería verse la pantalla en cada paso, junto con listas de verificación para confirmar si el robot va por el buen camino.

Este artículo presenta MMSkills, un sistema que convierte estas "Guías Inteligentes" en herramientas reutilizables para agentes de IA (robots que usan computadoras o juegan videojuegos).


Los Tres Problemas Principales que Resolvieron

Los autores identificaron tres grandes obstáculos para hacer que estas Guías Inteligentes funcionaran:

  1. ¿Qué va dentro del paquete?

    • Analogía: Si estás enseñando a alguien a hornear un pastel, una receta de texto no es suficiente. Necesitas una foto de la mezcla (para saber cuándo está lista), una foto del horno (para saber si está caliente) y una lista de verificación (para asegurarte de no olvidar los huevos).
    • La Solución: Un paquete MMSkill contiene tres cosas:
      • El Texto: Las instrucciones paso a paso.
      • Tarjetas de Estado: Un sistema de "semáforo". Le dice al agente: "Adelante solo si ves un botón azul", o "¡Alto! No hagas clic si ves un mensaje de error rojo".
      • Evidencia Visual: Fotos (fotogramas clave) que muestran exactamente cómo debería verse la pantalla en momentos críticos (por ejemplo, fotos de "Antes" y "Después").
  2. ¿De dónde sacamos estas guías?

    • Analogía: No quieres contratar a una persona para escribir una receta nueva para cada pastel individual. Quieres observar a personas horneando pasteles, identificar los pasos comunes y escribir una receta genérica tú mismo.
    • La Solución: Construyeron un "Generador" automatizado. Observa miles de videos públicos de personas usando computadoras (trayectorias), agrupa tareas similares y escribe automáticamente estas Guías Inteligentes. No solo copia el video; extrae la lógica y las pistas visuales.
  3. ¿Cómo las usa el robot sin confundirse?

    • Analogía: Imagina intentar leer un álbum de fotos enorme de 50 páginas mientras conduces un coche. Es distractor y peligroso. El robot podría concentrarse tanto en las fotos antiguas que chocaría contra el mundo real.
    • La Solución: Inventaron la "Carga por Ramas".
      • En lugar de meter todo el álbum de fotos en el cerebro principal del robot, el robot abre una ventana lateral temporal (una rama).
      • En esta ventana lateral, mira rápidamente solo la foto específica que necesita en ese momento para tomar una decisión.
      • Luego cierra la ventana lateral y le dice al robot principal: "Bien, revisé la foto. Vas por el buen camino. Ahora, haz clic en el botón".
      • Esto mantiene al robot principal enfocado en la pantalla en vivo, no en las fotos de referencia antiguas.

Cómo Funciona en la Vida Real (El Ejemplo de la "Tabla")

El artículo utiliza un ejemplo específico para mostrar por qué esto es mejor: Crear una Tabla en una Hoja de Cálculo.

  • Escenario: La tarea es "Crear una tabla en la Hoja 2".
  • Agente solo de Texto: Lee "Crear tabla". Ve que se está creando una tabla. Hace clic en "Listo".
    • Resultado: Creó la tabla en la Hoja 1 (la hoja incorrecta) porque el texto no le dijo que verificara qué hoja estaba activa. Puntuación: 0.
  • Agente MMSkills:
    1. Carga la habilidad "Crear Tabla".
    2. La Tarjeta de Estado dice: "Verificar: ¿La hoja activa se llama 'Hoja 2'?".
    3. La Evidencia Visual muestra una foto de la pestaña de la hoja correcta.
    4. El robot ve que está actualmente en la Hoja 1. La "Rama" dice: "¡Espera! Estás en la hoja incorrecta. Cambia a la Hoja 2 primero".
    5. El robot cambia, crea la tabla y verifica que el título coincida con la foto.
    • Resultado: Tabla perfecta en la hoja correcta. Puntuación: 1.

Lo que Mostraron los Resultados

Los investigadores probaron esto en dos tipos de tareas:

  1. Tareas de Escritorio: Como usar Excel, Chrome o Word (OSWorld, macOSWorld).
  2. Tareas de Juego: Como jugar Minecraft o Super Mario Bros.

Los Hallazgos:

  • Mayores Tasas de Éxito: Los robots que usan MMSkills resolvieron significativamente más tareas que los robots sin habilidades o con solo habilidades de texto.
  • Ayudó a Robots Más Pequeños: Incluso los modelos de IA más pequeños y menos potentes mejoraron mucho en las tareas cuando se les dieron estas guías visuales.
  • Menos Errores: Los robots cometieron menos errores repetitivos (como hacer clic en el mismo botón 10 veces) y terminaron las tareas más rápido.
  • No Solo para Computadoras: El sistema funcionó igual de bien en videojuegos, demostrando que "ver el estado" es importante tanto si estás gestionando archivos como si saltas obstáculos.

Resumen

MMSkills es una forma de enseñar a los agentes de IA no solo qué hacer, sino cómo reconocer si lo están haciendo bien. Al combinar instrucciones de texto con listas de verificación de "semáforo" y fotos específicas, y al usar un método de "ventana lateral" para observarlas, el sistema ayuda a los robots a evitar perderse, confundirse o quedarse atascados en la pantalla equivocada. Convierte a un robot que sigue órdenes a ciegas en un robot que realmente entiende el mundo visual en el que está trabajando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →